Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

AutoSynthData: генерация тренировочных данных для корпоративных ИИ-агентов

AutoSynthData: генерация тренировочных данных для корпоративных ИИ-агентов

Подробности изложены в материале первоисточника. Современным компаниям требуются ИИ-агенты, способные эффективно функционировать в специализированных корпоративных средах. Успех таких систем напрямую зависит от применяемых регламентов, структуры данных и используемых инструментов. Однако даже мощная базовая модель может испытывать трудности с конкретными рабочими сценариями. Чтобы преодолевать подобные барьеры, я изучил новую разработку ServiceNow CoreAI под названием AutoSynthData, которая автоматизирует создание качественных датасетов.

Как отмечает Сергей Багров, главная сложность заключается в трансформации выявленных слабостей модели в эффективный обучающий материал. Обычный сбой фиксирует лишь единичную ошибку, тогда как для дообучения нейросети требуется множество разнообразных сценариев. Платформа AutoSynthData использует промахи целевой модели и успешные действия более сильного учителя, чтобы формировать и проверять актуальные тренировочные задачи.

Что делает агентную задачу полезной

Агентная среда определяет цифровой мир, в котором действует ИИ: доступные для изменения состояния, интерфейсы API, инструменты и системные переходы. Конкретное задание разворачивается внутри этой экосистемы и состоит из трех ключевых компонентов.

Реклама

Системная спецификация

Данный блок описывает жесткие рамки функционирования агента, включая инструкции, корпоративные политики и начальное состояние — например, предварительно заполненную базу данных или набор справочных материалов. Все требования должны корректно сочетаться с имеющимися инструментами без искусственного усложнения.

Задача для агента

Запрос пользователя задает конечную цель и сопутствующие ограничения. Сгенерированное задание обязано соответствовать трем критериям: осуществимости (наличие хотя бы одной рабочей траектории в среде), реалистичности (правдоподобность запроса) и целевой сложности (задача должна обнажать текущие слабости модели, а не решаться слишком просто).

Верификатор

Проверка успешности выполнения строится на верификаторе, который должен обладать тремя свойствами: согласованностью с исходным запросом, надежностью (отсевом ошибочных траекторий) и полнотой (принятием любых валидных решений, а не только эталонного пути).

Реклама

Обзор архитектуры AutoSynthData

Платформа анализирует поведение целевой модели с помощью диагностических тестов, выявляя паттерны сбоев. Более сильная модель-учитель помогает охарактеризовать успешное поведение, после чего система генерирует новые упражнения, валидирует их и направляет на этап пост-тренировки.

От сбоев модели к учебной программе

Анализ прогонов в тестовой среде позволяет выделить проблемные зоны, типы задействованных инструментов, а также параметры корректного состояния. Полученные данные преобразуются в обобщенные карточки спецификаций способностей, которые передаются генератору задач без раскрытия исходных промптов.

Рабочее окружение корпоративных ИИ-агентов
Схема взаимодействия агента со специфической корпоративной средой.

Генерация и масштабирование задач

Обнаружив пробел в навыках, система приступает к созданию множества вариативных заданий. Генератор варьирует начальные условия, формулировки и комбинации инструментов, а учитель демонстрирует эталонное прохождение для последующего обучения с учителем (SFT).

Диагностические тесты AutoSynthData
Процесс оценки целевой модели с помощью диагностических задач.

Целевой этап

Параллельно запускаются независимые рабочие процессы, формирующие базовый набор тренировочных примеров. Кандидаты проходят жесткую проверку, выполнение, оценку решателем и процедуру исправления.

Переход от сбоев к учебной программе
Схема трансформации ошибок модели в структурированный учебный план.

Этап мультипликации

На этой стадии датасет расширяется за счет создания новых вариантов уже одобренных образцов. Каждый из них обладает уникальными параметрами запроса и верификатором, но не может служить основой для дальнейшего размножения во избежание деградации данных.

Генерация и масштабирование задач
Алгоритм создания вариативных заданий на базе спецификаций.

Детали реализации

Архитектура разделяет контроллер генерации и исполнительный адаптер среды. Это позволяет эффективно координировать контроль качества и управление состоянием задач в промышленных масштабах.

Создание успешных траекторий учителем
Демонстрация правильного поведения сильной модели-учителя.

Качественные синтетические данные требуют большего

Простая правдоподобность запроса недостаточна: сгенерированная задача может оказаться невыполнимой, а верификатор — выдать ложную награду. Поэтому AutoSynthData внедряет многоуровневый контроль.

Контроль качества синтетических данных
Многоуровневая система проверки сгенерированных датасетов.

Верификация на уровне сэмплов и исправление

Каждый кандидат оценивается решателем на предмет оптимальной сложности: целевая модель должна справляться не более чем с одной попытки из трех, а сильный учитель — как минимум с двух.

Позитивная верификация решений
Проверка корректности выполнения эталонной траектории.

Позитивная верификация

Тестирование проверяет, действительно ли эталонное решение приводит к успешному результату в целевой среде и соответствует ли оно критериям успеха.

Механизмы обучения с подкреплением
Применение пайплайна AutoSynthData для RL-стратегий.

Негативная верификация

Специальный шлюз проверяет отбраковку заведомо некорректных исходов, мутируя ожидаемые результаты для выявления слабых мест в логике верификатора.

Результаты в среде EnterpriseOps Gym
Тестирование улучшенной модели в гибридном домене.

Критика и исправление

Забракованные образцы поступают к критику, который диагностирует системные ошибки, несоответствия логики или некорректные траектории, после чего отправляет задачу на точечную доработку.

Замкнутый цикл обучения агентов
Итоговая схема циклического улучшения ИИ-агентов.

Проверка на уровне батчей

Мета-анализ оценивает качество целых пакетов данных, выявляя перекосы в сторону слишком простых семейств задач или повторяющиеся дефекты генерации, корректируя общую стратегию.

Сдвиг тренировочного рубежа

По мере совершенствования модели граница ее возможностей смещается. Система ищет задачи на самом краю текущей компетенции нейросети — достаточно сложные для выявления новых изъянов, но решаемые для учителя. Такой подход применим как для SFT, так и для будущих алгоритмов обучения с подкреплением (RL).

Эксперименты в среде EnterpriseOps Gym

Для проверки эффективности подхода разработчики использовали среды Hybrid и ITSM в рамках бенчмарка EnterpriseOps Gym.

Гибридный домен

В качестве целевой модели выступала Gemma-4-26B-A4B-it, а роль учителя выполняла Qwen3.8-27B. Система за 18 часов сгенерировала 2000 синтетических образцов для дообучения.

Результаты гибридного тестирования

Синтетический SFT-чекпоинт улучшил средний показатель Pass@1 на 7.2 процентных пункта (относительный рост на 35%) и закрыл 59% изначального разрыва между целевой моделью и эталонным решением.

ИТСМ-домен

В домене ITSM в качестве учителя применялась модель DeepSeek-V4.1-Flash. Генерация почти 2000 задач заняла около 66 часов из-за большего размера учительского модуля и отсутствия ранних оптимизаций конвейера.

Заключение

Опыт применения AutoSynthData доказал высокую результативность использования модельных сбоев для генерации адаптивных тренировочных данных в контролируемых корпоративных условиях.

01.