LLM уязвимы по определению, и, кажется, с этим ничего не поделать Исследователи, представившие работу на конференции ICML, утверждают: большие языковые модели имеют фундаментальную архитектурную слабость, которую невозможно полностью устранить дообучением или «закручиванием» защитных механизмов. Проблема связана с тем, как LLM определяют источник инструкций. Вместо того чтобы надежно различать команды пользователя, системные инструкции и собственные внутренние рассуждения, модели во многом ориентируются на стиль текста, а не на его реальную роль. Если злоумышленник имитирует формат внутреннего «мышления» модели (chain of thought), она может воспринять поддельную инструкцию как собственную и проигнорировать ограничения. Авторы назвали этот тип атаки chain-of-thought forgery. В экспериментах исследователям удалось заставить популярные модели выдавать информацию, которую они обычно блокируют. По словам авторов, аналогичное поведение наблюдалось как у моделей OpenAI, так и у Anthropic, Alibaba и DeepSeek. То есть традиционный подход с редтимингом и дообучением лишь закрывает уже найденные сценарии атак, но не решает проблему как таковую. Как отмечают исследователи, невозможно составить исчерпывающий список всех потенциальных способов обхода защит. И хотя существующие методы защиты значительно повысили устойчивость современных моделей, однако для критически важных систем — от госструктур до здравоохранения — этого может быть недостаточно. Если выводы работы подтвердятся, придется пересматривать не только механизмы безопасности ИИ-систем, но и сам подход к возможностям безопасного использования LLM. @anti_agi