Недавнее исследование выявило новую технику под названием sockpuppeting, которая может обойти встроенные ограничения 11 популярных языковых моделей, используя всего одну строку кода. Проблема кроется не в самих моделях, а в функции assistant prefill, которая обычно применяется в легальных сценариях для предустановки ответов. Злоумышленники могут подставить готовое начало фразы, создавая иллюзию согласия модели на выполнение опасного запроса.
Современные языковые модели стремятся сохранить последовательность ответов, что приводит к генерации запрещенного контента после ложного согласия. Исследователи Trend Micro отмечают, что такое вмешательство не требует доступа к весам модели и не требует сложной оптимизации. Наиболее уязвимой оказалась модель Gemini 2.5 Flash, в то время как GPT-4o-mini проявила наибольшую устойчивость.
В случае успешного обхода, модели могли выдавать вредоносный код и раскрывать чувствительные данные. Исследователи рекомендуют проверять порядок сообщений на уровне API, чтобы избежать подобных атак, и включать тесты на уязвимость в программы безопасности.