Техника sockpuppeting: обход ограничений языковых моделей

Недавнее исследование выявило технику sockpuppeting, которая позволяет обходить ограничения 11 крупных языковых моделей с помощью всего одной строки кода. Вместо того чтобы атаковать саму модель, метод нацелен на работу некоторых API, в частности на функцию assistant prefill. Эта функция обычно используется для легальных целей, но может быть использована для создания ложного «согласия» модели на выполнение небезопасного запроса. После этого модели продолжают генерировать запрещённый контент, сохраняя внутреннюю последовательность ответов. По данным Trend Micro, наиболее уязвимой оказалась Gemini 2.5 Flash с 15,7% успешных атак, в то время как GPT-4o-mini показала устойчивость на уровне 0,5%. Авторы исследования рекомендуют усиливать безопасность, проверяя порядок сообщений на уровне API и избегая передачи сообщений с ролью ассстента, когда это не требуется.