GEAR: как снизить копирование промпта в reasoning traces

GEAR: как снизить копирование промпта в reasoning traces

На длинном контексте reasoning trace иногда превращается в копию промпта. Модель переносит в рассуждение целые фрагменты исходного текста, в том числе те, которые не нужны для ответа. В работе «Copy Less, Ground More» авторы обнаружили такое поведение у семи протестированных моделей. На GSM-Infinite доля совпадающих трёхграмм росла вместе с длиной контекста. Для разных моделей она составляла от 20 до 43,7% на 8K токенов и от 29,7 до 70,8% на 64K. Авторы связывают высокий overlap с более частыми ошибками и предлагают GEAR, Grounding Evidence-Aware Reward. ## Как измеряли копирование Метрика n-gram overlap rate показывает, какая доля n-грамм из reasoning trace встречается в исходном промпте. Она не доказывает, что модель ничего не поняла, но хорошо ловит длинные дословные вставки. На контексте 64K Qwen3.5-9B получила 52,7% overlap даже для десятиграмм. Иными словами, больше половины trace входило в длинные фрагменты, уже присутствовавшие в запросе. У примеров с высоким overlap правильных ответов было меньше. Проблема не сводится к расходу токенов. Когда модель переписывает фоновые абзацы, полезная часть рассуждения теряется среди повторов. Более длинный trace в таком случае не означает более тщательное решение. ## Полезное и бесполезное копирование Авторы разделяют контекст на key evidence и distractor context. Правильные решения чаще содержат фрагменты, связанные с доказательствами, и реже воспроизводят дистракторы. Ошибочные решения копируют оба типа текста менее разборчиво. Это уточняет диагноз. Модель не обязательно забывает сведения из середины длинного документа. Она может видеть нужный фрагмент, но плохо отличать его от фона. Поэтому дополнительное внимание к дальним токенам само по себе не решает задачу отбора. ## Из чего состоит награда GEAR Полная награда включает accuracy reward и два сигнала на основе n-грамм: - grounding reward растёт при совпадении trace с размеченными доказательствами;

  • distractor penalty растёт при совпадении с посторонним контекстом. Один grounding reward оказался недостаточным. Модель может увеличить его, если начнёт копировать всё подряд и вместе с шумом захватит нужные фрагменты. Один distractor penalty тоже мешает: модель подавляет любое обращение к промпту, включая полезное. В экспериментах улучшение давала только их комбинация. Расчёт не требует отдельной reward model или ретривера. Нужны support indices, то есть позиции релевантных фрагментов. Для синтетических задач они известны из генератора данных. ## Как размечают реальные документы Для обычных документов авторы сначала выбирают область, которая будет служить источником ответа. Документ делится на чанки по 1024 символа, после чего от одного до трёх чанков назначаются evidence region. Вопрос генерируется по содержанию этой области. Так support annotations появляются из конструкции примера. Разметчику не приходится искать доказательство после того, как вопрос уже написан. Языковая модель помогает извлечь факты, числа и причинные связи, а финальная запись хранит точные позиции исходных фрагментов. Подход удобен для генерации данных, но у него есть ограничение. Качество вопросов зависит от модели, которая их составляет, и от способа выбора evidence region. Синтетическая точность аннотаций не гарантирует естественности самих задач. ## Результаты на контекстах до 128K GEAR обучали на Qwen3.5-9B, Qwen3.5-35B-A3B и Qwen3.5-27B. В смесь вошли 3200 long-context примеров, а обучение использовало GSPO. Проверка проводилась на Ruler, LongBench-v2, BrowseComp-LC, GraphWalks и AA-LCR. Эти наборы не пересекались с обучающей выборкой. | Модель | Прирост на 32K | Прирост на 128K | | --- | ---: | ---: | | Qwen3.5-9B | +2,8 | +4,6 | | Qwen3.5-35B-A3B | +2,1 | +2,8 | | Qwen3.5-27B | +1,5 | +2,1 | Обучающие контексты имели длину от 16K до 32K, однако самый большой прирост авторы получили на 128K. Это выглядит как перенос поведения на большую длину, хотя таблица сама по себе не объясняет механизм. Абляция дала полезный отрицательный результат. Grounding reward без штрафа ухудшал качество, причём на 128K падение доходило до 8,3 пункта относительно accuracy-only baseline. Отдельный distractor penalty также проигрывал полной формуле. ## Почему одного self-attention недостаточно Self-attention вычисляет связи между позициями, но доступ к токену не равен умению правильно им воспользоваться. В длинном контексте релевантный фрагмент конкурирует с большим числом похожих или просто шумных фрагментов. Позиционное смещение дополнительно повышает шанс, что начало и конец документа получат больше внимания, чем середина. GEAR не меняет архитектуру attention. Он корректирует поведение через reward: полезная опора на текст вознаграждается, а перенос дистракторов в trace становится дорогим. Поэтому метод можно применять к существующей модели во время RL-обучения. ## Что можно использовать на практике Overlap rate полезно отслеживать даже без обучения GEAR. Резкий рост длинных совпадений служит простым предупреждением: модель расходует trace на пересказ входа. Эту метрику легко посчитать локально, если система сохраняет reasoning traces. Для собственного reward shaping важно сохранить оба сигнала. Награда только за цитирование доказательств провоцирует копирование, а штраф без положительного ориентира отучает модель пользоваться документом. Из работы не следует, что n-граммы измеряют полноценное семантическое grounding. Они дают дешёвый proxy, который оказался полезным на выбранных задачах. Для документов с перефразированными доказательствами или сложными выводами буквального overlap может быть мало. ## Часто задаваемые вопросы ### Чем GEAR отличается от LongTraceRL? LongTraceRL использует entity-level рубрики и поисковые траектории агента. GEAR размечает релевантные и нерелевантные области контекста, а reward вычисляет по n-gram overlap. Он нацелен именно на repetitive copying. ### Можно ли применить GEAR к GPT или Claude через API? Нет, пользователю API недоступно RL-обучение модели с собственной reward function. Но overlap rate можно измерять в системах, где провайдер возвращает или где локальная модель сохраняет reasoning trace. ### Почему grounding reward в одиночку вредит? Такой reward поощряет совпадение с доказательствами, но не запрещает переносить вместе с ними дистракторы. Модель получает высокий балл, копируя слишком много. Distractor penalty добавляет недостающий отрицательный сигнал. ## Вывод GEAR рассматривает копирование промпта как проблему отбора, а не как неизбежную цену длинного контекста. На выбранных бенчмарках сочетание grounding reward и distractor penalty улучшило точность максимум на 4,6 пункта. Проверять перенос на другие модели, типы документов и реальные пользовательские задачи всё равно придётся отдельно.
← Все записи