Soft-prefix и устойчивость логических ответов LLM

Soft-prefix и устойчивость логических ответов LLM

Первичный источник

Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes, Brian K Chen, arXiv:2607.18228, 20 июля 2026 года. На момент проверки ссылка на официальный код в arXiv-записи отсутствует.

Soft prefix не является текстом перед пользовательским запросом. Это набор обучаемых непрерывных векторов, которые добавляются на уровне embedding-слоя. Веса модели остаются замороженными, а префикс оптимизируется так, чтобы сдвинуть ответы на точно размеченных силлогизмах.

Работа проверяет Qwen3.6-35B-A3B MoE, Qwen3-8B и Gemma 4 31B. Автор выясняет, сохраняет ли модель правильное логическое суждение при оптимизированном контексте, который не меняет формальные посылки.

Основные результаты

В repeated tests learned prefixes превзошли парные случайные префиксы во всех 16 сравнениях «модель × направление × split». Разница составила от 37 до 99 процентных пунктов. В abstract приведены такие диапазоны:

Проверка Flip rate
Qwen3.6 MoE при вариациях wording и prompt от 72 до 90%
Gemma, prefixes для validity от 54 до 56%
Сопоставленные random prefixes для Gemma менее 1%

Результат не означает, что любая LLM всегда «ломается от 16 векторов». Диапазоны относятся к конкретным моделям, задачам, направлениям оптимизации и интерфейсам ответа.

Что происходит внутри эксперимента

Диагностические тесты автор описывает как широкий сдвиг предпочтения ответа, answer preference. Успешный префикс чаще не создаёт новую логическую операцию, а подталкивает модель к одному смыслу ответа. Эффект переносится между некоторыми формулировками и форматами интерфейса, но заметно хуже работает на других логических задачах.

Поэтому слово «атака» здесь может ввести в заблуждение. Работа измеряет разницу между accuracy и stability. Модель может давать правильный ответ в обычном контексте, но менять его под специально оптимизированным embedding-контекстом.

Реальный threat model

Обычный удалённый пользователь API не может напрямую отправить такой soft prefix: для этого нужен доступ к embedding-слою или к системе, которая разрешает prefix tuning, adapters либо иное внедрение непрерывных параметров. Поэтому исследование ближе к аудиту:

  • локально развёрнутых open-weight моделей;
  • сторонних adapters и prefix-tuning модулей;
  • multi-tenant систем, загружающих внешние параметрические расширения;
  • pipelines, где embedding-контекст формируется недоверенным компонентом.

Приравнивать этот эксперимент к обычному текстовому prompt injection некорректно.

Ограничения

  • Это preprint одного автора и контролируемый силлогистический benchmark.
  • Высокий flip rate внутри задачи не превращается в универсальную логическую операцию.
  • Работа не демонстрирует удалённую компрометацию закрытого API.
  • На момент проверки публичный репозиторий с кодом и обученными префиксами не указан.
  • Редакция не воспроизводила обучение префиксов и опирается на опубликованные таблицы и abstract.

Что исправлено

В предыдущей версии были неверно указаны авторы Dingyun Zhang, Lixue Gong и Wei Liu. В arXiv-записи указан один автор: Brian K Chen. Утверждения о применимости к юридическим, медицинским и финансовым системам также смягчены, поскольку paper не содержит таких production-экспериментов.

Связанные материалы: обзор adversarial-атак на LLM, замаскированный prompt injection, влияние формулировки промпта и устойчивость к изменению убеждений.

← Все записи