SciDiagramEdit: AI-агент научился редактировать научные диаграммы как живой редактор

SciDiagramEdit: AI-агент научился редактировать научные диаграммы как живой редактор

Научная диаграмма это не просто картинка в статье. Это концентрированное визуальное доказательство, которое рецензенты и читатели считывают за секунды. Авторы статей знают: прежде чем диаграмма станет финальной, она проходит 10–20 итераций правок: перестановка панелей, переименование подписей, перекраска блоков. Каждый раунд это микро-решения о композиции, смысловых акцентах и визуальной иерархии.

Проблема в том, что все существующие инструменты ИИ для научных иллюстраций работают только «с нуля»: генерируют диаграмму по текстовому описанию. А вот режим редактирования (когда нужно взять существующую фигуру и внести точечные изменения по естественной инструкции) оставался полностью закрытым. До сих пор.

Команда исследователей представила SciDiagramEdit, первый фреймворк, который обучает агента редактировать научные диаграммы через эволюцию навыков, используя реальные пары правок из пересмотров статей на arXiv.

Что такое SciDiagramEdit и почему это сложно

Научная диаграмма это плотный инфографический объект, где смешаны схемы, графики, фотографии, подписи и стрелки. Редактировать такую фигуру по текстовой инструкции означает выполнять локализованные композиционные операции: сдвинуть панель, переименовать элемент, перекрасить блок, переложить компоновку, не задев остальное.

Коммерческие растровые редакторы вроде GPT-Image-2 или Nano Banana Pro умеют перерисовать сложную фигуру по промпту, но делают это в один проход на уровне пикселей. Результат растрированное изображение, которое нельзя дальше править по слоям. Для научной работы это критично: после ИИ-правки автору всё равно нужно двигать мелочи, менять числа в осях, подправлять подписи.

SciDiagramEdit решает эту проблему радикально: агент работает на уровне SVG-кода. Каждая правка это модификация векторных примитивов. Выходной файл остаётся редактируемым в Inkscape, Illustratorе или любом SVG-редакторе. Структура, слои и группы сохраняются.

Архитектура: три агента в цикле улучшения

Система состоит из трёх компонентов, которые работают в итеративном цикле.

Editor (ℰ) это центральный агент. Получает на вход исходную SVG-фигуру и текстовую инструкцию («поменяй панели 1×4 на 2×2», «убери процентные подписи», «перекрась блок A в синий»). Работает с code-level инструментами: выполняет Python-код, манипулирующий SVG-деревом. Editor опирается на текущую «спецификацию навыков»: набор правил, которые он усвоил из предыдущих итераций.

Judge (𝒥) оценивает результат по двум осям. Семантическая точность (semantic faithfulness) измеряется через чек-лист из атомарных утверждений: каждая правка из инструкции должна быть выполнена. Эстетическое качество (aesthetic quality) оценивается pairwise-сравнением с эталонной правкой автора через модель UniPercept.

Coach (𝒞) анализирует execution trace агента (какие команды вызывал, какие ошибки допустил), сравнивает результат с эталоном автора и генерирует «патч» к спецификации навыков. Например: «после структурного перелоja всегда сжимай viewBox», «при перекраске блока сохраняй толщину контура».

Цикл повторяется: Editor → Judge → Coach → обновлённые навыки → снова Editor. На каждой итерации агент накапливает библиотеку правил, закреплённых за конкретными типами сбоев.

Бенчмарк: 364 реальные пары правок из arXiv

Главная сложность в создании такого бенчмарка достать «до/после» пары с реальными намерениями автора. Synthetically сгенерированные инструкции плохо отражают практику: настоящие правки диаграмм редко формулируются как «измени цвет блока на #FF0000», они выглядят как «давай сделаем этот компонент более заметным, чтобы рецензент сразу увидел основной pipeline».

Исследователи решили это элегантно: они взяли 364 пары фигур из двух версий одних и тех же статей на arXiv. Автор статьи сам правил свою диаграмму между версиями: это и есть ground truth. Аннотаторы затем формулировали естественные инструкции, описывающие намерение каждой правки.

Статистика датасета: 2628 атомарных утверждений, распределённых по четырём категориям: Content (добавление/удаление элементов), Structure (перекомпоновка), Visual (стилизация, цвета), Misc. Фигуры покрывают 23 категории arXiv, при этом 73.6% приходятся на машинное обучение (cs.LG, cs.CL, cs.CV, cs.RO).

Как создавался датасет: от сырого diff'а до осмысленной инструкции

Процесс кураторства отдельная история. Сырой визуальный diff между двумя версиями одной и той же фигуры на arXiv часто содержит шум: перерендер растра, замену шрифта, незначительные изменения позиционирования без смысловой нагрузки. А иногда авторы полностью заменяют фигуру: это уже не редактирование, а перерисовка с нуля.

Команда SciDiagramEdit оставила только «среднюю полосу»: случаи, где автор добавил панель, переименовал подпись, перенаправил стрелку или перекомпоновал элементы, сохранив достаточно оригинальной структуры, чтобы изменение читалось как edit, а не как redraw. Даже в этой «средней полосе» визуальный diff сам по себе не раскрывает намерение автора: одна и та же поверхностная правка может выражать разные интенты. Поэтому инструкции не извлекались автоматически. Их формулировали аннотаторы вручную через Gradio-интерфейс с поддержкой vision LLM для итеративного уточнения.

Результат: 2628 атомарных утверждений, каждое привязано к конкретной паре «до/после» и конкретной текстовой инструкции. Это первый бенчмарк, который одновременно закрывает четыре условия: режим редактирования, домен научных диаграмм, paired before/after данные и естественно возникшие авторские инструкции.

Результаты: GPT-5.5 с эволюцией навыков обходит GPT-5.5 без неё

Ключевой эксперимент это сравнение одного и того же backbone-модели с эволюционированными навыками и без них. На GPT-5.5:

Без навыков: semantic win rate 0.745, aesthetic 0.466. С evolved skill: semantic 0.756 (+0.011), aesthetic 0.515 (+0.049).

Прирост в эстетике особенно показателен: почти 5 процентных пунктов. Агент научился не делать типовые ошибки вроде «оставить пустые полосы после перекладки панелей»: это ровно то, что фиксирует правило «сжимай viewBox после структурного переложа».

Ещё более интересный результат это трансфер навыков. Навыки, эволюционировавшие на GPT-5.5, применяются к GPT-5.3 без переобучения. Semantic score GPT-5.3 прыгает с 0.659 до 0.706 (+0.047), aesthetic с 0.285 до 0.358 (+0.073). Это означает, что накопленные правила редактирования не специфичны для одной модели, а представляют собой универсальную библиотеку знаний о том, как правильно редактировать SVG.

В прямом сравнении с растровым редактором GPT-Image-2 система достигает паритета по семантике, но сохраняет векторную редактируемость: качество, которого растровые модели не имеют в принципе.

Библиотека навыков: что агент усвоил

Эволюционированная спецификация навыков это не один общий промпт, а структурированная библиотека файлов:

SKILL/
├── SKILL.md
└── workflows/
    ├── safe-string-replace.md
    ├── math-notation.md
    ├── post-restructure-compactness.md
    ├── deliverable.md
    └── ...

Каждый файл описывает триггер и правило. Например, post-restructure-compactness.md срабатывает всякий раз, когда агент выполнил структурную перекладку, и указывает пересчитать viewBox. safe-string-replace.md учит, как безопасно заменять текстовые подписи в SVG без поломки атрибутов. math-notation.md контролирует корректность LaTeX-формул внутри диаграмм.

Это похоже на то, как живой редактор накапливает чек-листы типовых правок: «всегда проверяй alignment после перемещения», «не забудь обновить легенду при смене цветовой схемы». Разница в том, что эти правила выводятся автоматически из execution traces и паттернов ошибок.

Место в экосистеме: как SciDiagramEdit соотносится с существующими работами

До появления SciDiagramEdit в этой области были два непересекающихся направления. Первое генерация научных диаграмм с нуля: системы вроде AutoFigure, PaperBanana и SciFig, которые строят SVG по текстовому описанию. Второе instruction-based редактирование, но на generic SVG-объектах: SVGEditBench V2 работает с эмодзи-иконками, AutoFigure-Edit подмножество AutoFigure с 200 парами.

SciDiagramEdit находится на пересечении: это именно научные диаграммы, именно режим редактирования, именно пары до/после с естественно возникшими инструкциями. Ни один из предыдущих бенчмарков не закрывал все четыре условия одновременно. При этом система оценки заимствует идеи из rubric-based протоколов AIBench и SridBench: чек-листов с атомарными утверждениями, адаптированных под задачу редактирования.

Практические импликации: что это меняет для исследователей

Представьте типичный сценарий: вы получили reviewer comments с просьбой «перекладывать pipeline diagram, чтобы подчеркнуть contribution B». Сегодня это означает открыть Inkscape, вручную двигать блоки, следить за выравниванием, обновлять подписи, перекрашивать стрелки. Каждый раунд правок 30–60 минут работы, и это повторяется 3–5 раз до camera-ready.

SciDiagramEdit предлагает альтернативу: описать правку текстом, получить SVG-результат, который остаётся полностью редактируемым. Если результат не идеален повторить с уточнённой инструкцией. Навыки, накопленные в процессе эволюции, означают, что типичные ошибки (оставшиеся пустые полосы, сломанные viewBox, неправильная толщина контуров) агент уже знает и исправляет preemptively.

Это не заменяет human judgment: автор всё равно принимает финальное решение. Но оно превращает 30-минутный цикл ручной работы в 2-минутный цикл «напиши инструкцию → проверь результат → подтверди или скорректируй».

Ограничения и что дальше

Авторы честно отмечают три ограничения. Первое: бенчмарк охватывает только правки, где намерение явно сформулировано в инструкции. Случаи, где нужно вывести намерение из контекста всей статьи это следующий уровень сложности.

Второе: цикл эволюции всё ещё оркестрируется извне. Полностью автономная система должна была бы самостоятельно решать, когда навыки достаточно хороши и какие компромиссы между эстетикой и семантикой считать приемлемыми.

Третье: масштаб эксперимента скромен: 364 тренировочные пары и несколько десятков шагов эволюции. Авторы предполагают, что масштабирование может выявить эмерджентные поведения и более абстрактные правила, чем текущий бюджет позволяет.

FAQ

Почему именно SVG, а не растровая графика? SVG это векторный формат с явной структурой: группы, слои, текстовые элементы. Агент может точечно модифицировать отдельный компонент, не затрагивая остальное. Результат остаётся редактируемым в любом векторном редакторе, что критично для научной работы, где автор продолжает править после автоматической обработки.

Можно ли применить этот подход к другим типам графики? Да, архитектура достаточно общая. Coach-агент анализирует execution traces и извлекает правила: этот механизм не привязан к научным диаграммам. Адаптация потребует другого набора инструментов Editor'а и другого бенчмарка с до/после парами, но цикл эволюции навыков переносим.

Какие модели поддерживаются как backbone? В экспериментах использованы GPT-5.1, GPT-5.3, GPT-5.4 и GPT-5.5. Навыки трансферируются между моделями: библиотеку правил, выученную на GPT-5.5, можно применить к более ранним версиям и получить улучшение без переобучения.

Итог

SciDiagramEdit закрывает пробел между генерацией и редактированием научных иллюстраций. Вместо одноразовой генерации «с нуля» итеративный процесс правок, в котором агент накапливает навыки из собственных ошибок. 364 реальные пары из arXiv-пересмотров дают беспрецедентный бенчмарк для режима редактирования. Эволюция навыков даёт +5% к эстетике и переносится между моделями. А главное результат остаётся SVG, а не растром, что сохраняет рабочий процесс исследователя нетронутым.

Если вы публикуете научные статьи и тратите часы на итеративные правки диаграмм по комментариям соавторов, это тот класс инструментов, за которым стоит следить. Открытый код и бенчмарк обещают под лицензией CC BY-NC 4.0.

← Все записи