ISO для RLVR: фиксируем спектр, обучаем сингулярные фреймы
Первичный источник
Гипотеза ISO звучит так: при reinforcement learning with verifiable rewards модель может сохранять сингулярные значения весовых матриц, а новое поведение получать в основном за счёт изменения входных и выходных сингулярных фреймов. Авторы называют этот эффект **spectral inheritance**, или спектральным наследованием. Это не метод сжатия модели. ISO меняет координаты оптимизации: вместо обычного обновления всей матрицы `W` работа идёт с её разложением `W = UΣVᵀ`, где спектр `Σ` фиксирован на значениях базовой модели, а фреймы `U` и `V` остаются обучаемыми. ## Что показал анализ весов По данным авторов, спектральная составляющая объясняет около 3% смещения RLVR-чекпойнта относительно базы. Для сопоставленного SFT-перехода на странице проекта приведено около 35%. В интервенционных экспериментах возвращение спектра базовой модели в RLVR-чекпойнт почти не уничтожало приобретённые результаты, тогда как перенос только RL-спектра в старые фреймы не давал сопоставимого улучшения. Пока это наблюдение, а не универсальный закон. Эксперименты охватывают конкретные модели и задачи. Из них нельзя заключить, что любое RL-дообучение любой архитектуры меняет только фреймы. ## ISO-Optimizer: результат, который можно проверить В online-варианте базовый оптимизатор, например AdamW или Muon, применяется к переменным `U` и `V`, а `Σ₀` остаётся фиксированным. В paper рассматриваются reasoning- и coding-задачи для моделей от 1,5B до 8B параметров. | Конфигурация на Qwen3-8B-Base | Aggregate accuracy | Actor updates |
| --- | ---: | ---: |
| AdamW | 0,495 | 270 |
| ISO-AdamW, совпавший уровень | 0,495 | 100 |
| ISO-AdamW, более поздняя точка | 0,509 | 210 | Таким образом, заявленное авторами ускорение до 2,7 раза относится к числу actor updates до **совпадающего уровня accuracy** в конкретном запуске. Это не означает 2,7-кратного ускорения всего wall-clock обучения. Репозиторий отдельно указывает примерно 7% накладных расходов на шаг RL для использованной реализации. ## ISO-Merger: объединение специалистов Offline-вариант работает с несколькими RL-специалистами, полученными из одной базы. Он комбинирует изменения фреймов без новых данных, rollout, градиентных шагов или on-policy distillation. В опубликованных aggregate-сравнениях ISO-Merger получил 63,80 против 62,88 у лучшего сравниваемого data-free baseline для трёх специалистов на Qwen2.5-7B-Instruct. В конфигурации coding + math на 1,5B результат составил 44,38 против 43,52. Это небольшие, а не порядковые различия; ценность метода здесь в объединении без дополнительного обучения. ## Ограничения - Это preprint, а не завершённая независимая репликация.
- Масштаб online-экспериментов ограничен моделями до 8B.
- Экономия actor updates не равна экономии GPU-часов: rollout и операции с фреймами имеют собственную стоимость.
- ISO предполагает общий базовый checkpoint для объединяемых специалистов.
- Открытый репозиторий содержит воспроизводимый `iso_merger.py`, но редакция не запускала дорогостоящие training-эксперименты. ## Что исправлено в статье Предыдущая версия ошибочно приписывала ISO «88% сжатия», результаты AIME 2026 и вариант `ISO-Train-Q4`. Эти утверждения не следовали из paper arXiv:2607.19331 и были удалены. Также исправлена аффилиация авторов. Для контекста полезны разборы [scaling laws](/blog/scaling-laws-kaplan-chinchilla/), [test-time compute](/blog/why-llms-think-test-time-compute/), [квантизации LLM](/blog/llm-quantization-illusion/) и [экстраполяции RLVR](/blog/relex-rlvr-extrapolation/). **Что проверено редакцией:** paper, страница проекта и открытый репозиторий сопоставлены между собой. Результаты обучения локально не воспроизводились.
ISO: An RLVR-Native Optimization Stack, Hanqing Zhu, Wenyan Cong, Zhizhou Sha и соавторы, arXiv:2607.19331, 21 июля 2026 года. Дополнительно: страница проекта и официальный код.