Недавно в исследовательской работе была представлена техника, известная как sockpuppeting, которая помогает обойти ограничения 11 крупных языковых моделей. Оказалось, что для этого не требуются сложные манипуляции. Метод основан на использовании функции assistant prefill, позволяющей заранее задать ответ. Путем подстановки фразы, создающей видимость согласия модели на выполнение опасного запроса, можно заставить систему сгенерировать запрещенный контент. Исследователи Trend Micro отметили, что наиболее уязвимой моделью оказалась Gemini 2.5 Flash, где успешные атаки составили 15,7%. В то же время GPT-4o-mini продемонстрировала наименьшую уязвимость – всего 0,5%. Для повышения безопасности рекомендовано проверять порядок сообщений на уровне API и использовать строгие механизмы защиты, чтобы предотвратить подобные атаки.
Связанные записи
Пять тревожных симптомов рака, на которые стоит обратить внимание
Онколог из сети медицинских центров «СМ-Клиника» Магомед Иманшапиев выделил пять тревожных симптомов, которые могут сигнализировать о наличии рака. В интервью…
Новый метод диагностики туберкулеза с использованием выдыхаемого воздуха
Группа ученых из Каролинского института в Швеции совместно с коллегами из Южной Африки представила новый подход к диагностике туберкулеза. Вместо…
Как выбрать семейную стоматологию: на что обращать внимание при выборе клиники для всей семьи
Поиск стоматологии, куда можно приводить всех членов семьи — от малышей до пожилых родственников, — задача не из простых. Клиника…