Техника sockpuppeting позволяет обойти защиту языковых моделей

Недавно в исследовательской работе была представлена техника, известная как sockpuppeting, которая помогает обойти ограничения 11 крупных языковых моделей. Оказалось, что для этого не требуются сложные манипуляции. Метод основан на использовании функции assistant prefill, позволяющей заранее задать ответ. Путем подстановки фразы, создающей видимость согласия модели на выполнение опасного запроса, можно заставить систему сгенерировать запрещенный контент. Исследователи Trend Micro отметили, что наиболее уязвимой моделью оказалась Gemini 2.5 Flash, где успешные атаки составили 15,7%. В то же время GPT-4o-mini продемонстрировала наименьшую уязвимость – всего 0,5%. Для повышения безопасности рекомендовано проверять порядок сообщений на уровне API и использовать строгие механизмы защиты, чтобы предотвратить подобные атаки.