Soft-prefix и устойчивость логических ответов LLM
Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes, Brian K Chen, arXiv:2607.18228, 20 июля 2026 года. На момент проверки ссылка на официальный код в arXiv-записи отсутствует.
Soft prefix не является текстом перед пользовательским запросом. Это набор обучаемых непрерывных векторов, которые добавляются на уровне embedding-слоя. Веса модели остаются замороженными, а префикс оптимизируется так, чтобы сдвинуть ответы на точно размеченных силлогизмах.
Работа проверяет Qwen3.6-35B-A3B MoE, Qwen3-8B и Gemma 4 31B. Автор выясняет, сохраняет ли модель правильное логическое суждение при оптимизированном контексте, который не меняет формальные посылки.
Основные результаты
В repeated tests learned prefixes превзошли парные случайные префиксы во всех 16 сравнениях «модель × направление × split». Разница составила от 37 до 99 процентных пунктов. В abstract приведены такие диапазоны:
| Проверка | Flip rate |
|---|---|
| Qwen3.6 MoE при вариациях wording и prompt | от 72 до 90% |
| Gemma, prefixes для validity | от 54 до 56% |
| Сопоставленные random prefixes для Gemma | менее 1% |
Результат не означает, что любая LLM всегда «ломается от 16 векторов». Диапазоны относятся к конкретным моделям, задачам, направлениям оптимизации и интерфейсам ответа.
Что происходит внутри эксперимента
Диагностические тесты автор описывает как широкий сдвиг предпочтения ответа, answer preference. Успешный префикс чаще не создаёт новую логическую операцию, а подталкивает модель к одному смыслу ответа. Эффект переносится между некоторыми формулировками и форматами интерфейса, но заметно хуже работает на других логических задачах.
Поэтому слово «атака» здесь может ввести в заблуждение. Работа измеряет разницу между accuracy и stability. Модель может давать правильный ответ в обычном контексте, но менять его под специально оптимизированным embedding-контекстом.
Реальный threat model
Обычный удалённый пользователь API не может напрямую отправить такой soft prefix: для этого нужен доступ к embedding-слою или к системе, которая разрешает prefix tuning, adapters либо иное внедрение непрерывных параметров. Поэтому исследование ближе к аудиту:
- локально развёрнутых open-weight моделей;
- сторонних adapters и prefix-tuning модулей;
- multi-tenant систем, загружающих внешние параметрические расширения;
- pipelines, где embedding-контекст формируется недоверенным компонентом.
Приравнивать этот эксперимент к обычному текстовому prompt injection некорректно.
Ограничения
- Это preprint одного автора и контролируемый силлогистический benchmark.
- Высокий flip rate внутри задачи не превращается в универсальную логическую операцию.
- Работа не демонстрирует удалённую компрометацию закрытого API.
- На момент проверки публичный репозиторий с кодом и обученными префиксами не указан.
- Редакция не воспроизводила обучение префиксов и опирается на опубликованные таблицы и abstract.
Что исправлено
В предыдущей версии были неверно указаны авторы Dingyun Zhang, Lixue Gong и Wei Liu. В arXiv-записи указан один автор: Brian K Chen. Утверждения о применимости к юридическим, медицинским и финансовым системам также смягчены, поскольку paper не содержит таких production-экспериментов.
Связанные материалы: обзор adversarial-атак на LLM, замаскированный prompt injection, влияние формулировки промпта и устойчивость к изменению убеждений.