Мой блог
Paper2Agent от Стэнфорда: как превратить научную статью и код в автономного ИИ-агента
Специфика современной цифровой науки заключается в том, что к большинству статей по вычислительной биологии или машинному обучению прилагается исходный код. Однако для обычного исследователя или инженера запуск этого кода превращается в настоящую рутину: нужно клонировать репозиторий, развернуть виртуальное окружение, установить зависимости, исправить устаревшие библиотечные вызовы и настроить конфигурацию. В итоге множество полезных алгоритмов остаются заблокированными внутри статичных PDF-документов.
Команда исследователей из Стэнфордского университета под руководством Цзячэна Мяо (Jiacheng Miao) и Джеймса Цзоу (James Zou) предложила кардинальное решение этой проблемы. Их разработка под названием Paper2Agent, опубликованная в журнале Nature в сентябре 2026 года, автоматизирует процесс превращения научной статьи и связанного с ней кода в полноценный сервер на базе протокола Model Context Protocol (MCP). По сути, система создает виртуального «соавтора», с которым любой MCP-совместимый ИИ-агент (например, Claude Code) может взаимодействовать через обычные текстовые запросы на естественном языке.
Проект уже полностью готов к практическому использованию. Исходный код распространяется под лицензией MIT и может быть установлен как плагин (skill) для Claude Code или Codex. Готовые серверы для популярных биологических библиотек и моделей — AlphaGenome, Scanpy и TISSUE — уже доступны на платформе Hugging Face Spaces, а также через публичный веб-интерфейс paper2agent.ai.
Как устроена архитектура и пайплайн Paper2Agent
Архитектура Paper2Agent построена на базе Agent SDK от Anthropic (Claude Code). В основе системы лежит центральный оркестратор, который пошагово координирует работу специализированных субагентов. Весь процесс преобразования научной публикации в автономный сервис разделен на шесть последовательных этапов:
- Поиск и загрузка: обнаружение и скачивание исходного кода репозитория, привязанного к публикации.
- Изоляция среды: автоматическое развертывание изолированного виртуального окружения менеджером среды.
- Индексирование: сканирование и каталогизация имеющихся туториалов и примеров кода.
- Тестовый запуск: выполнение примеров «от и до» с фиксацией эталонных результатов и выходных данных.
- Извлечение функций: превращение туториалов в параметризованные MCP-инструменты с их последующей верификацией.
- Финишая сборка: объединение всех валидированных инструментов в единый MCP-сервер.
Особого внимания заслуживает жесткий шлюз валидации (validation gate). Инструмент считается успешно пройденным только в том случае, если в процессе его работы создаются все ожидаемые файлы, а численные показатели совпадают с эталонными с точностью до 3%. Для графических результатов и диаграмм используется сравнение по перцептивному хэшу: хэш-расстояние Хэмминга между сгенерированным изображением и оригиналом не должно превышать 20. Модуль проверки (test verifier) получает до 6 попыток на отладку и исправление каждой функции. Если за эти попытки инструмент не проходит критерии качества, он исключается из итогового сервера.
Каждый сформированный MCP-сервер содержит три ключевых компонента:
- MCP-инструменты (tools): исполняемые функции, оборачивающие алгоритмы из статьи;
- MCP-ресурсы (resources): хранилище текста рукописи, ссылок на репозитории, датасетов и оригинальных иллюстраций;
- MCP-промпты (prompts): многошаговые сценарии работы, фиксирующие правильный порядок вызова функций (например, корректную последовательность предобработки данных в Scanpy).
В качестве базовой языковой модели для работы всей системы Paper2Agent авторы использовали Claude Sonnet 4.
Результаты работы агента AlphaGenome
Для оценки эффективности системы исследователи запустили Paper2Agent на сложной модели AlphaGenome. За 45 минут работы и с суммарными затратами порядка 14 долларов США система автоматически сгенерировала 22 MCP-инструмента. Все 22 функции успешно прошли автоматический шлюз валидации без какого-либо участия человека.
Производительность полученного агента была протестирована в сравнении с двумя альтернативными подходами: стандартным Claude Code с доступом к репозиторию (Claude + Repo) и специализированной системой Biomni. Оценка проводилась по пяти независимым прогонам двумя экспертами-биологами (уровень согласия экспертов составил 96.7%).
- Запросы на основе туториалов (15 тестов): Paper2Agent показал точность 98.7 ± 1.3%, Claude + Repo — 82.7 ± 3.4%, Biomni — 37.3 ± 4.0%.
- Совершенно новые исследовательские запросы (15 тестов): Paper2Agent показал 100.0 ± 0.0%, Claude + Repo — 78.7 ± 4.4%, Biomni — 56.0 ± 3.4%.
- Задачи с открытым концом (30 тестов): Paper2Agent показал 82.7 ± 2.4%, Claude + Repo — 56.7 ± 2.3%, Biomni — 72.2 ± 2.2%.
Медианное время выполнения запросов по туториалам у Paper2Agent оказалось в 1.9 раза быстрее по сравнению с Claude + Repo и в 3.1 раза быстрее, чем у Biomni. Преимущество сохранилось даже при обновлении базовой модели сравнения до Claude Opus 4.6.
Применяя созданного агента к реальным научным задачам, исследователи повторно проанализировали генетический вариант chr1:109274968:G>T, связанный с уровнем холестерина ЛПНП. Агент Paper2Agent определил SORT1 как наиболее вероятный причинный ген, тогда как в оригинальной статье по AlphaGenome основное внимание уделялось генам CELSR2 и PSRC1. База данных GTEx подтверждает наличие значимых eQTL в печени для всех трех генов, что наглядно демонстрирует способность ИИ-агента находить точные функциональные взаимосвязи в сложных генетических локусах.
Тестирование на Scanpy, TISSUE и масштабируемость системы
Агент для популярных инструментов анализа одноклеточных данных Scanpy был создан за 45 минут и 13 долларов США, получив 7 валидированных инструментов. В испытаниях на четырех открытых датасетах агент полностью совпал с выводами экспертов-людей по подсчету клеток, числу генов и ключевым маркерным генам. Аналогичным образом агент TISSUE успешно воспроизвел результаты исследований в области пространственной транскриптомики.
Масштабное тестирование охватило три крупных массива публикаций без предварительной ручной очистки кода:
- Корпус из 100 статей по вычислительной биологии с bioRxiv: для 74 публикаций удалось успешно создать MCP-серверы, при этом 593 из 599 сгенерированных инструментов успешно прошли автоматическую валидацию.
- Бенчмарк из 300 вопросов: Paper2Agent показал точность 91.2%, против 80.3% у Sonnet 4 и 86.3% у Sonnet 4.6 в связке Claude + Repo. Средняя стоимость запроса составила $0.20 против $0.38, а время выполнения — 1.6 минуты против 4.3 минут.
- 10 статей из смежных областей (включая TabPFN, SAM 2 и SAELens): точность составила 98.1% на 42 задачах исполнения кода.
- 26 статей с фокусом на данные: слой ресурсов MCP показал точность 89.0% против 82.0% при использовании браузера, оказавшись в 34 раза дешевле и в 15 раз быстрее.
Кроме того, Paper2Agent продемонстрировал 100% точность отклонения нерелевантных запросов вне контекста, а также способность автоматически восстанавливаться после ошибок, связанных с поломкой зависимостей, неверными путями к файлам, опечатками и устаревшим API.
Совместная работа нескольких ИИ-агентов
Отдельной вехой исследования стала демонстрация взаимодействия трех развернутых MCP-агентов: AlphaGenome, экрана scCRISPRi с MPRA и датасета Perturb-seq для CD4+ T-клеток.
Совместными усилиями агенты проанализировали локус псориаза rs887314 и выделили ген GPR137 со значением квантиля RNA-seq 0.997. ИИ-ассистент предложил 10 стратегий валидации, из которых исследователи выбрали анализ корреляции сигнатур. Лишь нокаут GPR137 совпал с сигнатурой пертурбации CRE в условиях стимуляции (коэффициент Спирмена 0.613 через 8 часов и 0.630 через 48 часов), в то время как BAD и три других кандидата не показали корреляции. В другом эксперименте связка AlphaGenome и GWAS по СДВГ позволила выделить вариант rs1626703 среди 209 кандидатов.
Главные выводы и перспективы
Разработка Стэнфордского университета наглядно показывает, как открытый протокол MCP и автономные ИИ-агенты трансформируют работу с научными материалами. Перевод сухих алгоритмов из статей в исполняемые микросервисы экономит сотни часов работы исследователей и инженеров.
Среди основных итогов проекта:
- Автоматическое превращение репозиториев и PDF в протестированные MCP-серверы.
- Высокая скорость и экономичность: создание агента AlphaGenome заняло 45 минут при затратах $14.
- Высокая точность: 98.1%–100% успешных ответов на новые исследовательские задачи.
- Масштабируемость на сотни публикаций без ручной адаптации кода.
- Возможность интеграции нескольких независимых агентов для решения сложных междисциплинарных гипотез.
Код проекта Paper2Agent полностью открыт под лицензией MIT, а готовыми серверами можно воспользоваться прямо сейчас через Hugging Face Spaces и платформу paper2agent.ai.
Источник: www.marktechpost.com
