Новости

Технология sockpuppeting обходит защиту языковых моделей

Специалисты описали метод sockpuppeting, который позволяет обходить защитные меры 11 крупных языковых моделей с помощью всего одной строки кода. Этот способ наносит удар не по самой модели, а по работе некоторых API, в частности функции assistant prefill, используемой для легальных сценариев. Суть в том, что можно подставить заранее подготовленное начало фразы, создавая видимость согласия модели на выполнение опасного запроса.

Современные LLM склонны сохранять последовательность ответов, что приводит к генерации запрещенного контента после ложного согласия. Исследование показывает, что Gemini 2.5 Flash оказалась самой уязвимой, с успешными атаками на уровне 15,7%, тогда как GPT-4o-mini продемонстрировала наибольшую защиту с 0,5%.

Кроме того, уязвимые модели иногда раскрывают чувствительные системные данные. Эффективные атаки могут использовать многоходовые настройки роли или маскировать опасные запросы под безобидные задачи. Trend Micro рекомендует проверять порядок сообщений на уровне API и включать такие атаки в программы безопасности, чтобы выявлять уязвимости до возникновения инцидентов.

Вам также может понравиться...