Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Институт Ai2 выпустил открытую модель AstaBrief 8B для научных отчетов

Институт Ai2 выпустил открытую модель AstaBrief 8B для научных отчетов

Институт искусственного интеллекта Allen Institute for AI (Ai2) представил модель AstaBrief 8B, предназначенную для автоматического создания структурированных научных отчетов со ссылками на литературу. Разработчики полностью открыли веса модели и тренировочные датасеты, интегрировав новинку в свою платформу для исследователей Asta в качестве быстрого режима обработки данных.

Новый инструмент призван существенно ускорить подготовку обзорных материалов, сохраняя при этом высокую точность цитирования и качество фактологического наполнения, сопоставимое с закрытыми коммерческими системами.

Интерфейс научной платформы Asta
Интерфейс платформы Asta, где доступен новый быстрый режим генерации отчетов.

Быстрый режим в генерации отчетов Asta

В интерфейсе платформы Asta новая модель функционирует под названием Fast mode, дополняя уже привычный режим Thinking mode, который работает на базе технологий Claude. По заявлению создателей, главная цель эксперимента заключалась в проверке гипотезы: сможет ли компактная открытая модель, специализированная под научные задачи, приблизиться по уровню к передовым проприетарным аналогам, но при этом радикально сократить время ожидания и снизить затраты на вычисления.

Реклама

Согласно внутренней статистике Ai2, полный цикл формирования отчета в быстром режиме занимает в среднем 51,1 секунды. Для сравнения, стандартный режим Thinking mode требует около 178,5 секунды. Таким образом, новинка оказалась примерно в 3,5 раза быстрее и продемонстрировала почти десятикратное сокращение задержек относительно некоторых других коммерческих стандартов.

Лицензия и аппаратные требования

Карточка модели AstaBrief 8B подтверждает, что архитектура построена на базе Qwen3-8B и распространяется по лицензии Apache 2.0. Продукт предназначен исключительно для образовательных и исследовательских целей в строгом соответствии с принципами ответственного использования Ai2. Поскольку веса открыты, научные организации и лаборатории могут развернуть нейросеть на собственной инфраструктуре, в том числе за корпоративным файрволлом. Подобная изолированность критически важна при работе с закрытыми или еще не опубликованными исследовательскими данными.

Реклама

Одновременно с публикацией весов команда проекта выложила в репозиторий GitHub готовый демонстрационный рабочий процесс. Исследователи могут адаптировать эти скрипты для генерации автоматических обзоров непосредственно из собственных коллекций PDF-документов.

Обучение и фильтрация датасетов

Базовым фундаментом для AstaBrief послужила модель Qwen3-8B, которую дообучали методом контролируемой точной настройки (supervised fine-tuning), после чего применили оптимизацию прямых предпочтений (direct preference optimization). Изначально команда рассматривала полноценное обучение с подкреплением, которое ранее успешно применялось в проекте DR Tulu для улучшения генерации длинных текстов. Тем не менее, от этой идеи отказались из-за высокой стоимости и нестабильности процесса, отдав предпочтение более простой, прозрачной и легкой в отладке схеме.

Процесс подготовки данных

Для достижения максимальной скорости AstaBrief натренировали писать готовый отчет за один проход на основе пользовательского запроса и извлеченных фрагментов текстов. Это позволило полностью отказаться от промежуточных этапов кластеризации и суммирования сниппетов, а также от пошагового написания разделов, которые задействованы в режиме Thinking mode.

Обучающий массив сформировали на базе реальных запросов пользователей, поступавших через инфраструктуру ScholarQA. Журналы платформы прошли жесткую фильтрацию по критериям качества, релевантности и конфиденциальности. Разработчики удалили мусорный трафик ботов, слишком короткие бессмысленные фразы, а также пропустили запросы через фильтр на базе языковой модели для отсеивания неанглоязычных материалов, бытовых тем и персональных данных. В итоге осталась база из 90 тысяч качественных исследовательских запросов.

Реклама

На этапе supervised-настройки целевые эталоны отчетов генерировались с помощью многошагового пайплайна ScholarQA с привлечением различных проприетарных систем, включая Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini и GPT-4.1. После фильтрации осталось 47 тысяч пригодных примеров. Для этапа DPO использовался отдельный пул запросов: одна версия отчета бралась из конвейера ScholarQA, а вторая генерировалась альтернативными моделями. Две судейские модели (GPT-4.1 и DeepSeek-R1) выбирали победителя. В 95% случаев их мнения совпадали с оценками людей, а в итоговый датасет вошло около 6 тысяч самых чистых пар.

Результаты оценок и тестирования

Главным испытательным стендом для разработчиков стал бенчмарк SQABench-CS2, состоящий из 200 компьютерно-научных вопросов от реальных пользователей. Эксперты отслеживали четыре ключевые метрики: охват необходимого контента по рубрикатору, точность абзацев относительно заданного вопроса, корректность цитирования утверждений и полноту охвата фактов источниками.

Тестирование статистических фильтров синтетических отчетов показало, что наибольший прирост качества дает отсеивание документов с низкой плотностью цитирования. Это доказывает важный практический вывод: научная специализация модели зависит не столько от объема поглощенного при претренере текста, сколько от качества и тщательной компоновки данных на этапе посттренинга.

Сравнение показателей эффективности

Ранние контрольные точки SFT-модели улучшили общий уровень контента, но уступали конвейеру Claude в точности ответов и оформлении ссылок. Проведенная процедура DPO позволила AstaBrief вплотную приблизиться к показателям систем на базе Claude и DR Tulu.

На тестовом наборе ScholarQA-CS2 модель набрала в среднем 87 баллов по всем метрикам (для сравнения, SFT-версия имела 83,7 балла, а исходный базовый Qwen3-8B — 77,3). В рамках независимого экспертного исследования три научных сотрудника ранжировали отчеты по пяти критериям. В результате модель DR Tulu победила по общей привлекательности, однако два из трех исследователей отдали предпочтение именно AstaBrief за максимальную точность цитирования.

Создатели делают оговорку, что большинство тестов и процесс сбора обучающих данных завершились еще в течение 2025 года, поэтому сравнения производились с тогдашними флагманами без повторного прогона тестов против актуальных актуальных моделей текущего периода.

Раннее использование и дальнейшие шаги

Анализ первых недель работы Fast mode показал обнадеживающую статистику: среди 374 пользователей платформы около 29,1% применяли быстрый режим на протяжении двух и более дней. В среднем каждый пользователь сгенерировал 3,67 тематических треда. При этом 23% аудитории полностью отказались от возврата к режиму Thinking mode, а еще 18% комбинировали оба инструмента в зависимости от текущих задач, используя быстрый режим примерно в 40% случаев.

Позитивные отзывы зафиксированы на уровне 84,2% для Fast mode и 85,2% для Thinking mode, что свидетельствует о сопоставимом пользовательском опыте. В планах команды Ai2 — внедрение более тонких алгоритмов обучения с предпочтениями, развитие гибридных подходов RAG-плюс-RL, расширение многошаговых мультиинструментальных возможностей, подключение новых научных баз данных и улучшение декомпозиции сложных поисковых запросов.

01.