Исследование об обходе защиты языковых моделей

Недавнее исследование выявило новую технику под названием sockpuppeting, которая может обойти встроенные ограничения 11 популярных языковых моделей, используя всего одну строку кода. Проблема кроется не в самих моделях, а в функции assistant prefill, которая обычно применяется в легальных сценариях для предустановки ответов. Злоумышленники могут подставить готовое начало фразы, создавая иллюзию согласия модели на выполнение опасного запроса.

Современные языковые модели стремятся сохранить последовательность ответов, что приводит к генерации запрещенного контента после ложного согласия. Исследователи Trend Micro отмечают, что такое вмешательство не требует доступа к весам модели и не требует сложной оптимизации. Наиболее уязвимой оказалась модель Gemini 2.5 Flash, в то время как GPT-4o-mini проявила наибольшую устойчивость.

В случае успешного обхода, модели могли выдавать вредоносный код и раскрывать чувствительные данные. Исследователи рекомендуют проверять порядок сообщений на уровне API, чтобы избежать подобных атак, и включать тесты на уязвимость в программы безопасности.

  • Related Posts

    Витамин D: защита от рака и укрепление иммунной системы

    На сегодняшний день известно о 13 различных витаминах, каждый из которых играет важную роль в поддержании здоровья. В числе таких витаминов находится и витамин D, который, по мнению исследователей из…

    Как жара может предотвратить болезнь Альцгеймера?

    Даг Уитни, пожилой американец, является уникальным примером: обладая мутацией гена PSEN2, связанной с ранним развитием болезни Альцгеймера, он удивительным образом не столкнулся с её симптомами даже в возрасте за 70…

    В Наркология 24 - https://narkologiya24.clinic/ вы можете рассчитывать на профессиональную помощь и поддержку на каждом этапе лечения. Их специалисты готовы помочь вам в любой ситуации.