Мой блог
AutoSynthData: генерация тренировочных данных для корпоративных ИИ-агентов
Подробности изложены в материале первоисточника. Современным компаниям требуются ИИ-агенты, способные эффективно функционировать в специализированных корпоративных средах. Успех таких систем напрямую зависит от применяемых регламентов, структуры данных и используемых инструментов. Однако даже мощная базовая модель может испытывать трудности с конкретными рабочими сценариями. Чтобы преодолевать подобные барьеры, я изучил новую разработку ServiceNow CoreAI под названием AutoSynthData, которая автоматизирует создание качественных датасетов.
Как отмечает Сергей Багров, главная сложность заключается в трансформации выявленных слабостей модели в эффективный обучающий материал. Обычный сбой фиксирует лишь единичную ошибку, тогда как для дообучения нейросети требуется множество разнообразных сценариев. Платформа AutoSynthData использует промахи целевой модели и успешные действия более сильного учителя, чтобы формировать и проверять актуальные тренировочные задачи.
Что делает агентную задачу полезной
Агентная среда определяет цифровой мир, в котором действует ИИ: доступные для изменения состояния, интерфейсы API, инструменты и системные переходы. Конкретное задание разворачивается внутри этой экосистемы и состоит из трех ключевых компонентов.
Системная спецификация
Данный блок описывает жесткие рамки функционирования агента, включая инструкции, корпоративные политики и начальное состояние — например, предварительно заполненную базу данных или набор справочных материалов. Все требования должны корректно сочетаться с имеющимися инструментами без искусственного усложнения.
Задача для агента
Запрос пользователя задает конечную цель и сопутствующие ограничения. Сгенерированное задание обязано соответствовать трем критериям: осуществимости (наличие хотя бы одной рабочей траектории в среде), реалистичности (правдоподобность запроса) и целевой сложности (задача должна обнажать текущие слабости модели, а не решаться слишком просто).
Верификатор
Проверка успешности выполнения строится на верификаторе, который должен обладать тремя свойствами: согласованностью с исходным запросом, надежностью (отсевом ошибочных траекторий) и полнотой (принятием любых валидных решений, а не только эталонного пути).
Обзор архитектуры AutoSynthData
Платформа анализирует поведение целевой модели с помощью диагностических тестов, выявляя паттерны сбоев. Более сильная модель-учитель помогает охарактеризовать успешное поведение, после чего система генерирует новые упражнения, валидирует их и направляет на этап пост-тренировки.
От сбоев модели к учебной программе
Анализ прогонов в тестовой среде позволяет выделить проблемные зоны, типы задействованных инструментов, а также параметры корректного состояния. Полученные данные преобразуются в обобщенные карточки спецификаций способностей, которые передаются генератору задач без раскрытия исходных промптов.

Генерация и масштабирование задач
Обнаружив пробел в навыках, система приступает к созданию множества вариативных заданий. Генератор варьирует начальные условия, формулировки и комбинации инструментов, а учитель демонстрирует эталонное прохождение для последующего обучения с учителем (SFT).

Целевой этап
Параллельно запускаются независимые рабочие процессы, формирующие базовый набор тренировочных примеров. Кандидаты проходят жесткую проверку, выполнение, оценку решателем и процедуру исправления.

Этап мультипликации
На этой стадии датасет расширяется за счет создания новых вариантов уже одобренных образцов. Каждый из них обладает уникальными параметрами запроса и верификатором, но не может служить основой для дальнейшего размножения во избежание деградации данных.

Детали реализации
Архитектура разделяет контроллер генерации и исполнительный адаптер среды. Это позволяет эффективно координировать контроль качества и управление состоянием задач в промышленных масштабах.

Качественные синтетические данные требуют большего
Простая правдоподобность запроса недостаточна: сгенерированная задача может оказаться невыполнимой, а верификатор — выдать ложную награду. Поэтому AutoSynthData внедряет многоуровневый контроль.

Верификация на уровне сэмплов и исправление
Каждый кандидат оценивается решателем на предмет оптимальной сложности: целевая модель должна справляться не более чем с одной попытки из трех, а сильный учитель — как минимум с двух.

Позитивная верификация
Тестирование проверяет, действительно ли эталонное решение приводит к успешному результату в целевой среде и соответствует ли оно критериям успеха.

Негативная верификация
Специальный шлюз проверяет отбраковку заведомо некорректных исходов, мутируя ожидаемые результаты для выявления слабых мест в логике верификатора.

Критика и исправление
Забракованные образцы поступают к критику, который диагностирует системные ошибки, несоответствия логики или некорректные траектории, после чего отправляет задачу на точечную доработку.

Проверка на уровне батчей
Мета-анализ оценивает качество целых пакетов данных, выявляя перекосы в сторону слишком простых семейств задач или повторяющиеся дефекты генерации, корректируя общую стратегию.
Сдвиг тренировочного рубежа
По мере совершенствования модели граница ее возможностей смещается. Система ищет задачи на самом краю текущей компетенции нейросети — достаточно сложные для выявления новых изъянов, но решаемые для учителя. Такой подход применим как для SFT, так и для будущих алгоритмов обучения с подкреплением (RL).
Эксперименты в среде EnterpriseOps Gym
Для проверки эффективности подхода разработчики использовали среды Hybrid и ITSM в рамках бенчмарка EnterpriseOps Gym.
Гибридный домен
В качестве целевой модели выступала Gemma-4-26B-A4B-it, а роль учителя выполняла Qwen3.8-27B. Система за 18 часов сгенерировала 2000 синтетических образцов для дообучения.
Результаты гибридного тестирования
Синтетический SFT-чекпоинт улучшил средний показатель Pass@1 на 7.2 процентных пункта (относительный рост на 35%) и закрыл 59% изначального разрыва между целевой моделью и эталонным решением.
ИТСМ-домен
В домене ITSM в качестве учителя применялась модель DeepSeek-V4.1-Flash. Генерация почти 2000 задач заняла около 66 часов из-за большего размера учительского модуля и отсутствия ранних оптимизаций конвейера.
Заключение
Опыт применения AutoSynthData доказал высокую результативность использования модельных сбоев для генерации адаптивных тренировочных данных в контролируемых корпоративных условиях.
