Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Holo4: линейка мультиинтерфейсных ИИ-агентов для реальных задач

Подробности изложены в материале первоисточника. Я подготовил подробный разбор новой линейки агентных моделей Holo4, созданных для полноценного взаимодействия с программным обеспечением через самые разные интерфейсы. Линейка включает две конфигурации — плотную модель на 27 млрд параметров и Mixture of Experts на 35 млрд с активными 3 млрд, доступные через H Models API, а также обновленную компактную версию Holotron4 Nano.

Как отмечает разработчик, эти решения создавались не просто для сдачи академических тестов, а для решения реальных бизнес-задач. Модели обучались с применением методов обучения с подкреплением и контролируемого обучения на огромном массиве пользовательских сред.

Модели, созданные для работы с любыми интерфейсами

Новые агенты способны кликать мышкой и вводить текст в графических интерфейсах, писать и исполнять собственный программный код, а также задействовать API и протоколы MCP. В отличие от узкоспециализированных систем, которые привязаны исключительно к экрану или строго к программным инструментам, Holo4 адаптируется под требования конкретной задачи. Я обратил внимание, что модель одинаково эффективно функционирует в веб-среде, на ПК, в операционной системе Android, песочницах кода и при обращении к корпоративным API без необходимости переключаться между разными архитектурами.

Реклама

Базируясь на архитектуре Qwen, новые решения демонстрируют колоссальный прирост производительности. На сложном бенчмарке OSWorld 2.0 версия Holo4 27B набирает 61,7%, уступая лишь закрытым флагманам вроде Opus 5.5, но при этом оперирует значительно меньшим количеством параметров и требует существенно меньших затрат на вычисления.

Конкуренция с лидерами рынка при минимальных затратах

В ходе тестов на наиболее требовательных бенчмарках для управления рабочим столом (OSWorld 2.0) и использования API (AutomationBench) семейство Holo4 навязывает борьбу ведущим моделям индустрии. При этом экономическая эффективность выполнения задач выходит на первый план благодаря оптимизированному потреблению токенов.

При оценке затрат учитываются входные и выходные токены каждого запуска агента. В то время как классические закрытые системы требуют огромных бюджетов, открытые веса и продуманная инфраструктура H Models API позволяют существенно снизить порог входа для бизнеса.

Искусственный интеллект, который выполняет реальную работу

Благодаря тренировке на окружениях из Agentic Task Factory, модели демонстрируют выдающиеся результаты в профессиональном софте. Я изучил несколько показательных примеров сравнения базовой Qwen3.8 27B и новой Holo4 27B в одинаковых условиях.

3D-моделирование: Эйфелева башня

Перед ИИ ставилась задача построить точную трехмерную модель Эйфелевой башни в среде FreeCAD в масштабе 1 к 1, соблюдая строгие геометрические параметры: квадратную форму сечения на всех уровнях, сужение четырех ног к центру, наличие трех платформ и специальной мачты на вершине. При этом конструкция должна оставаться открытой и полой внутри. В ходе выполнения Holo4 27B затратил 84 вызова и 1,3 млн токенов, тогда как базовая Qwen3.8 27B справилась за 60 вызовов и 1,0 млн токенов, однако итоговая стабильность и точность построения у новой специализированной модели оказались выше.

3D-моделирование: логотип компании H

Вторая задача заключалась в создании объемного логотипа в FreeCAD, состоящего из сплошного плоского диска и заглавной буквы H без засечек, выровненных по толщине и высоте без наложения друг на друга. Здесь Holo4 27B потребовалось 94 вызова и 1,5 млн токенов, в то время как базовая версия израсходовала 118 вызовов и 1,9 млн токенов, показав меньшую эффективность в управлении контекстом.

Реклама

Геймдизайн: создание Pac-Man

В рамках симуляции разработки игры в движке Godot агент должен был запрограммировать классический аркадный лабиринт с движущимися призраками, съедобными точками, логикой подсчета жизней и автономным поведением главного героя по простому эвристическому алгоритму. Holo4 27B успешно завершила задачу за 68 вызовов, обработав 2,4 млн токенов и написав 268 строк кода, в то время как базовая Qwen3.8 27B совершила 197 вызовов, потратила 11,4 млн токенов и сгенерировала 327 строк кода.

Архитектура модельного ряда Holo4
Технические характеристики плотной модели 27B и Mixture of Experts версии 35B.
График производительности Holo4 на OSWorld 2.0
Сравнительный анализ точности моделей Holo4 и закрытых систем на длинных рабочих процессах.
Пример выполнения задач ИИ-агентом
Демонстрация автоматизированного процесса выполнения рабочих сценариев.
Оценка затрат на токены для Holo4
Оценка затрат на основе входных и выходных токенов при единичном запуске агента.

Как создавались модели Holo4

Инженеры компании разработали собственную фабрику агентных задач, которая автоматически формирует интерактивные среды и проверяемые задания исключительно на основе документации, скриншотов или открытого кода. На данный момент создано порядка 10 000 таких сценариев.

Процесс тренировки ИИ моделей
Этап тренировки агентных систем на виртуальных окружениях.
Тестирование управляющей петли harness
Модернизированный цикл выполнения действий агента и управления контекстом.
Сравнение с закрытыми моделями OpenAI
Сопоставление результатов с флагманскими решениями конкурентов.
Метрики прироста производительности Holotron4 Nano
Абсолютный прирост процентных пунктов базовой модели после применения стека.

Обучение и улучшение рабочего цикла

Параллельно с тренировкой весов была полностью переработана управляющая петля (harness), отвечающая за выполнение действий агента и удержание контекста на протяжении сотен шагов. Эксперты проанализировали тысячи неудачных запусков на OSWorld 2.0. Главными нововведениями стали внедрение надежной долговременной памяти и предоставление агенту полноценного доступа к командной строке десктопного окружения.

Дополнительные разработки команды авторов
Список других инновационных проектов и мультимодальных энкодеров исследователей.

Holotron4 Nano

Посттренировочный стек разработчиков адаптирован под новые базовые архитектуры. Воспользовавшись статусом участника коалиции NVIDIA Nemotron, создатели применили свой метод к модели Nemotron 3 Nano Omni, получив в результате универсального агента Holotron4 Nano.

Полученные улучшения наглядно доказывают универсальность созданного пайплайна: рецепт обучения успешно переносится на сторонние архитектуры, превращая обычную базовую модель в специализированного эксперта по работе с графическими интерфейсами, API и кодом независимо от исходного размера сети.

Как запустить модели самостоятельно

Обе конфигурации семейства уже доступны разработчикам через H Models API. Веса моделей опубликованы на Hugging Face в форматах BF16, FP8, NVFP4 и 4-битном GGUF рядом с компактным решением Holotron4 Nano.

В ближайшие дни команда также планирует выпустить оптимизированные чекпойнты DSpark drafter, которые позволят дополнительно ускорить генерацию и снизить задержки при инференсе.

01.