Six Sigma для ИИ: почему ваши агенты работают на уровне брака 1950-х

Six Sigma для ИИ: почему ваши агенты работают на уровне брака 1950-х

В авиации считают инциденты на час полёта. В банках капитал-резервы. На заводе дефекты на миллион деталей. Спросите у любого из них, как дела, и получите конкретную цифру. Спросите у команды AI Governance то же самое про их агента и услышите «да» или «нет». Прошли ли мы чеклист? Закрыли ли compliance-гейт? Это говорит о том, пытался ли кто-то управлять ИИ. Но не о том, насколько хорошо это работает.

Разрыв между «мы что-то делаем с ИИ» и «вот насколько хорошо наш ИИ работает» становится критическим. И именно здесь методология Six Sigma (подход, который 40 лет назад спас Motorola и Toyota от брака) оказывается полезнее всех современных AI-eval фреймворков.

Три измерения качества ИИ-агента

Идея проста: разбить качество работы ИИ-системы на три уровня, где каждый следующий зависит от предыдущего. Это не три независимых показателя для красивого дашборда. Это цепь, и её прочность определяется самым слабым звеном.

Data Sigma это качество данных, на которых работает агент. Полнота, точность, актуальность, согласованность между источниками, соответствие правилам. Большинство компаний измеряют не то: проверяют, есть ли данные, а не правильные ли они. Сырые корпоративные данные обычно набирают меньше 3,5 сигма. После очистки 4–5 сигма. Но чистит их мало кто по-настоящему.

Process Sigma это воспроизводимость. Один и тот же агент, одна и та же задача, два запуска, два одинаковых ответа? Для большинства современных агентов результат 1–1,5 сигма. То есть от 310 000 до 500 000 «дефектов» на миллион запусков. Причины банальны: температура выше нуля, контекстное окно плавает, порядок вызова тулов меняется, формулировка промпта чуть другая. Всё это не баги, это фичи архитектуры. Но именно они убивают воспроизводимость.

Agent Sigma это то, что происходит, когда агенты передают работу друг другу. Здесь ошибки не складываются: они умножаются. Если агент A с 3-сигма качеством передаёт результат агенту B с 3-сигма качеством, итог не 3 сигма, а хуже. Рассогласование в интерфейсах, потеря контекста при хэндоффе, конфликт интерпретаций: всё это съедает качество на каждом стыке.

На практике это выглядит так. Первый агент классифицирует запрос клиента и извлекает его намерение. Второй агент ищет подходящее решение в базе знаний. Третий формулирует ответ. Четвёртый проверяет на соответствие compliance-правилам. Каждый переход это шанс потерять часть контекста, исказить намерение или пропустить ограничение. Даже если каждый агент в отдельности работает на 3,5 сигма, после четырёх хэндоффов итоговая система едва дотягивает до 2 сигма. Именно поэтому мультиагентные пайплайны так часто разочаровывают в продакшене: отдельные демо впечатляют, а итоговое качество посредственное.

Что означают эти цифры на практике

Для контекста вот шкала, с которой работает всё мировое производство. Six Sigma (уровень аэрокосмической отрасли) 3,4 дефекта на миллион. Пять сигма (точная медицина) 233. Три сигма (типичный промышленный процесс) 66 700. Два сигма уровень сырых корпоративных данных.

А теперь главное: большинство ИИ-агентов, работающих в продакшене сегодня, находятся на уровне 1–1,5 сигма. Это от 500 000 до 690 000 дефектов на миллион действий.

Технически говоря, индустрия ИИ-агентов operates at a quality level that manufacturing abandoned decades ago. Звучит как провокация, но давайте посчитаем. Агент, который «прав в 90% случаев» это 3,8 сигма, уже неплохо. Но если этот агент обрабатывает 1000 запросов в день, он выдаёт 100 ошибок ежедневно, 36 500 в год. В финансах это 36 500 неверных транзакций. В медицине 36 500 неверных интерпретаций.

Почему «лучше модель» не поможет

Самое важное следствие из фреймворка это constraint chain. Process Sigma не может быть выше Data Sigma. Agent Sigma не может быть выше Process Sigma. Общий уровень системы это минимум из трёх.

Это значит, что если вы потратили год и миллионы на переход с GPT-4 на GPT-5, но данные по-прежнему мусорные, вы не увидите никакого улучшения качества реальных выходов. Модель не была узким местом. Данные были. Улучшение модели выше того уровня, на котором её ограничивают данные, это как поставить гоночный двигатель в машину с квадратными колёсами.

Правильный порядок инвестиций: сначала Data Sigma (самый высокий рычаг), потом Process Sigma (структурированные промпты, детерминированный вызов инструментов, валидационные чекпоинты), и Agent Sigma улучшится автоматически, когда первые два встанут на место.

Практический расчёт: как посчитать сигма для вашего агента

Давайте пройдём конкретный пример. Представьте, что у вас есть агент для обработки заявок клиентов. Он читает письмо, классифицирует его (техподдержка, продажи, возврат), извлекает ключевые данные (номер заказа, сумма, продукт) и маршрутизирует в нужный департамент.

Шаг первый определяете эталон. Берёте 50 исторических заявок, где человек-оператор уже проставил все метки. Это ваш ground truth.

Шаг второй прогоняете все 50 через агента 10 раз подряд (500 запусков суммарно). Фиксируете температуру, промпт, контекст: всё одинаковое.

Шаг третий считаете дефекты. Каждый случай, когда классификация не совпала с эталоном, извлечённый номер заказа неверен, или маршрут назначен ошибочно, это один дефект. Не «катастрофический провал», а любое отклонение от эталона.

Результат: допустим, из 500 запусков 78 дали отклонения. Это 156 000 дефектов на миллион (DPMO). По стандартной таблице конвертации это около 2,4 сигма. Уровень, который в автомобилестроении 1980-х считался неприемлемым.

Теперь повторяете то же самое с данными: берёте те же 50 заявок, но проверяете входные данные. Насколько часто номер заказа в письме совпадает с реальным номером в ERP? Насколько актуальна информация о продукте? Насколько полны контактные данные? Получаете Data Sigma: скажем, 2,8 сигма.

Вывод: ваш агент работает на 2,4 сигма, но ограничен данными на 2,8. Даже если вы найдёте способ поднять процесс до 3 сигма (уменьшите температуру, добавите валидацию, зафиксируете порядок тулов), вы не увидите улучшения: потому что мусорные данные всё равно тянут вниз. Сначала чистите данные.

Почему чеклисты не работают

Большинство AI Governance сегодня устроено так: команда составляет список из 20–50 пунктов (fairness, safety, transparency, privacy...) и раз в квартал проходит по ним галочками. Вопрос «прошли ли мы governance» сводится к «все ли галочки стоят».

Проблема в том, что чеклист бинарен: а реальность непрерывна. «Fairness: ✓» не говорит вам, насколько fair система. «Safety: ✓» не говорит, безопасна ли она на уровне, приемлемом для продакшена. Это всё равно что спрашивать у завода «вы выпускаете брак?» и получать ответ «ну, мы проверяем».

Six Sigma-подход превращает бинарные чеклисты в непрерывные шкалы. Вместо «fairness: да/нет» конкретное число сигма, с методологией измерения, доверительным интервалом и динамикой. Это позволяет увидеть тренды, сравнивать версии, выявлять деградацию до того, как она станет катастрофой.

Что с этим делать

Если вы управляете ИИ-агентами в продакшене, начните с измерения. Не с улучшения: именно с измерения. Возьмите один процесс (один агент, одну задачу), прогоните его 100 раз с одинаковыми входными данными, и посчитайте, сколько раз результат отклоняется от эталона. Это даст вам Process Sigma, отправную точку.

Затем посмотрите на данные, которые агент потребляет. Насколько они полны? Насколько свежи? Насколько согласованы между источниками? Это ваш Data Sigma: и скорее всего, он ниже, чем вам кажется.

И наконец, если у вас мультиагентная система, измерьте, что происходит на стыках. Передаётся ли контекст без потерь? Совпадают ли интерпретации? Не теряется ли информация при каждом хэндоффе?

Инструменты измерения уже появляются. Идея не в том, что нужно бежать и внедрять конкретный фреймворк от конкретного вендора: а в том, что сам подход «измерять качество числами, а не чеклистами» должен стать стандартом для индустрии, которая управляет всё более автономными системами.

Часто задаваемые вопросы

Что такое Six Sigma и почему это применимо к ИИ?

Six Sigma это методология управления качеством, разработанная в Motorola в 1986 году. Одна сигма это стандартное отклонение от среднего; шесть сигма означают, что спецификация допускает ±6 стандартных отклонений, что соответствует 3,4 дефектам на миллион операций. К ИИ это применимо, потому что агенты это процессы: они принимают входы, выполняют преобразования, выдают выходы. Любой процесс можно измерить на воспроизводимость и точность.

Почему 90% точности недостаточно?

Потому что масштаб имеет значение. Агент с 90% точностью это 3,8 сигма, и это звучит как пятёрка в школе. Но при 1000 действий в день это 100 ошибок ежедневно, 36 500 в год. В контексте обработки документов это терпимо. В контексте медицинских решений или финансовых транзакций это катастрофа. Six Sigma показывает, что «90% правильно» это уровень, который производство не приняло бы для критических процессов.

Как повысить Data Sigma, если корпоративные данные плохие?

Начните с аудита: измерьте полноту (какой процент обязательных полей заполнен?), точность (какой процент значений верен при ручной проверке выборки?), актуальность (какой средний возраст данных?), согласованность (совпадают ли одни и те же данные в разных системах?). Типичный корпоративный результат 2 сигма, то есть около 308 000 дефектов на миллион записей. Это не значит, что данные «плохие»: это значит, что каждый процесс, построенный на этих данных, ограничен этим потолком.

Чем этот подход отличается от существующих AI evaluation frameworks?

Большинство AI-eval фреймворков (OpenAI Evals, LangSmith, Arize Phoenix) фокусируются на точности модели: правильный ли ответ на бенчмарке? Six Sigma-подход шире: он включает качество данных, воспроизводимость процесса и координацию между агентами. Бенчмарк отвечает «насколько умна модель». Sigma-метрики отвечают «насколько надёжна система в целом» и показывают, где именно находится узкое место.

Итог

ИИ-индустрия измеряет прогресс бенчмарками и демо. Но бенчмарк это лабораторный тест. Реальность это агент, который работает 16 часов в день на данных, которые никто не чистил, в пайплайне из четырёх агентов, где каждый передаёт результат следующему с потерями. Если вы хотите знать, насколько хороша ваша система: перестаньте спрашивать «прошли ли мы governance» и начните спрашивать «на каком мы сигма». Ответ, скорее всего, вас удивит.

← Все записи