Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Как ИИ-агенты проверили 2200 научных статей с ICML: результаты открытого аудита

Как ИИ-агенты проверили 2200 научных статей с ICML: результаты открытого аудита

Масштабный стресс-тест для научной мысли: вызовы воспроизводимости в эпоху ИИ

Вопрос о том, насколько надежны и воспроизводимы результаты исследований в сфере искусственного интеллекта, возник задолго до нынешнего бума генеративных технологий. Однако сегодня эта застарелая проблема перешла в принципиально иную плоскость из-за резкого роста масштабов научной индустрии. Конференция ICML 2026 наглядно продемонстрировала новые реалии: на рассмотрение оргкомитета поступило рекордное количество заявок — 23 918 работ, из которых было принято 6 352 статьи. Этот показатель практически вдвое превысил объем предыдущего года, закрепив устойчивый экспоненциальный тренд. Во многом такой взрывной рост обусловлен тем, что современные интеллектуальные агенты существенно ускорили и упростили постановку вычислительных экспериментов, сбор данных и даже написание научных текстов.

При этом ресурсы рецензирования не удвоились вслед за потоком публикаций. В подавляющем большинстве случаев экспертная оценка на академических конференциях держится на труде волонтеров, у которых зачастую попросту нет достаточного количества свободного времени или узкоспециализированных компетенций, чтобы досконально перепроверить каждый расчет и каждую выкладку. Показательной иллюстрацией текущего положения дел стала прямая цитата из рецензии на статью, которая не просто была принята на ICML 2026, но и получила престижный статус spotlight-доклада: «Моя низкая оценка уверенности объясняется тем, что я не проверял все математические доказательства тщательно». Несмотря на подобную оговорку рецензента, работа получила высокие баллы от программного комитета. К судьбе этой публикации и к тому, что вскрылось при скрупулезном аудите ее доказательной базы, мы еще вернемся.

Агенты против лавины препринтов: организация открытого хакатона

Парадокс текущего технологического этапа заключается в том, что инструменты, породившие лавинообразный поток препринтов, способны стать и главным средством борьбы с возникшим кризисом рецензирования. Современные кодинг-агенты — такие как Claude Code, Codex, Cursor и Pi — уже способны самостоятельно изучать статьи, извлекать исходные гипотезы, писать воспроизводящий код, запускать эксперименты на облачных мощностях и систематизировать полученные результаты. Если раньше качественная ручная проверка сложного исследования могла отнять у рецензента целые выходные, то программный агент способен выполнить эту процедуру за один день, причем параллельно и в тысячах экземпляров.

Чтобы проверить эту гипотезу на практике, было решено не ограничиваться силами одной исследовательской группы, а открыть инициативу для широкого сообщества со всем разнообразием архитектур агентов, вычислительных бюджетов и научных подходов. В рамках хакатона ICML 2026 Open Reproductions, проходившего с 15 июля по 2 августа 2026 года, участникам предоставили унифицированный интерфейс: агент мог получить текст статьи, список ее ключевых утверждений и инструкции челенджа с помощью единственной команды. Каждому исследователю выделили по 20 долларов в виде вычислительных кредитов Hugging Face для проведения расчетов через инфраструктуру HF Jobs. Суммарно за время проведения инициативы участники запустили 2 962 облачные задачи. В тех случаях, когда полная репликация была невозможна — например, из-за закрытого характера исходных датасетов или отсутствия публичных чекпоинтов моделей, — запускались упрощенные воспроизведения на синтетических данных, имитирующих свойства оригинала.

Анатомия большой проверки: статистика и классификация результатов

По всем объективным метрикам этот хакатон стал, вероятно, самой масштабной в истории попыткой систематического аудита материалов крупной научной конференции. Итоговые журналы выполнения задач (логбуки) содержали подробные трассировки агентов, исходный код и отчеты об экспериментах. Совокупный анализ вердиктов по отдельным утверждениям показал многогранную картину:

  • Подтверждение гипотез (51% выборки): В 1 103 проверенных статьях независимое подтверждение получило как минимум одно ключевое научное утверждение. Из них 266 работ удалось воспроизвести целиком — каждое извлеченное утверждение нашло строгое экспериментальное доказательство. Еще 632 статьи были воспроизведены частично, причем ни одно из заявленных положений опровергнуто не было. В общей сложности экспериментально верифицировано 3 978 индивидуальных гипотез.
  • Фальсификация и споры (23% выборки): В 496 статьях хотя бы одно утверждение оказалось опровергнутым либо вызвало серьезные противоречия. В 49 случаях все заявленные гипотезы были полностью фальсифицированы и ни один вывод подтвердить не удалось. Особый интерес представляют 242 работы, по которым независимые команды репликаторов пришли к диаметрально противоположным выводам относительно одних и тех же положений. Воспроизводимость в реальном мире не является бинарной — она носит состязательный характер.
  • Промежуточные исходы: 502 работы получили подтверждение исключительно на игрушечных синтетических данных, а в 280 случаях установить истинность утверждений не удалось вовсе, чаще всего по причине отсутствия базовых артефактов и исходного кода.

В общей сложности 35 участников официально заявили об успешной фальсификации научных результатов. Все подобные случаи подвергались строгой экспертной перепроверке организаторов: организаторы заново вчитывались в текст оригинальной статьи, изучали логи агентов, заново выводили математические формулы и перезапускали вычисления строго по авторским формулировкам.

Хроника фальсификаций: от сломанных доказательств до скрытых искажений

Процесс глубокого фактчекинга выявил целый ряд скрытых ошибок, не замеченных официальными рецензентами конференции. Среди наиболее показательных подтвержденных опровержений выделяются следующие кейсы:

Крах границ в задаче пейджинга

Речь идет о той самой spotlight-статье «Towards Optimal Robustness in Learning-Augmented Paging», доказательства в которой рецензент открыто признался, что не читал. В работе утверждалось, что предложенный алгоритм гарантирует робастность на уровне O(1). Однако участник хакатона с помощью логбука агента зафиксировал, что аддитивный член растет пропорционально log(k), и указал на конкретный шаг в математическом выводе, где допущена ошибка. Повторная независимая реализация расширила диапазон проверки параметра k до значения 1 024, подтвердив логарифмический рост на уровне статистической значимости порядка девяти сигма. Фактическая робастность алгоритма составила O(log k).

Теорема, разрушающаяся на шаге 224

В теоретической работе «Attention’s forward pass and Frank-Wolfe» авторы утверждали и доказывали, что траектории частиц токенов неизбежно коллапсируют в начало координат, если начальная точка находится внутри их выпуклой оболочки. Сразу три независимые команды обнаружили контрпримеры к данному утверждению, причем нарушения начинали проявляться на шагах t = 224, примерно t = 3 800 и t = 6 416. Это объясняет, почему поверхностная проверка показывала истинность теоремы: вычисления с ограниченным временным горизонтом останавливались слишком рано. Самый наглядный контрпример был сформулирован в точной рациональной арифметике, что исключило фактор погрешности вычислений с плавающей запятой. Авторы признали ошибку в день обращения и приступили к исправлению.

Несовпадение теории и программного кода

В статье «Self-Distillation Enables Continual Learning» центральное уравнение и вся теоретическая база опирались на анализ обратной дивергенции Кульбака — Лейблера (reverse KL). Однако в публичном репозитории код по умолчанию рассчитывал прямую дивергенцию (forward KL), и, как подтвердили сами авторы, именно на ней и строились опубликованные результаты. Логбук, обнаруживший эту подмену, не смог воспроизвести заявленный ключевой прирост точности в +4 процентных пункта даже при использовании авторских скриптов и данных. Авторы оперативно загрузили на arXiv исправленную и уточненную версию препринта.

Иллюзия качества из-за символов заполнения

В исследовании «Do Transformers Need Three Projections?» внимательный анализ выявил грубую методологическую погрешность: около 66% позиций токенов в процедуре оценки приходились на служебные токены заполнения (EOS padding). Они обучаются практически с нулевыми потерями и искусственно занижали общую перплексию примерно в три раза. В результате заявленная в аннотации «потеря качества всего в 3,1% при 50-процентном сокращении кэша» после устранения искажения возросла до реальных 9,4%.

Ошибочные опровержения и самоконтроль

В ходе аудита встречались и ложные фальсификации, допущенные самими агентами и проверяющими. В одном из отчетов категорично утверждалось, что метод из статьи работает вдвое медленнее базового решения. При детальном разборе выяснилось, что проверяющий допустил арифметическую ошибку, сравнив время обработки одной траектории со временем обработки целого батча из 50 элементов. После нормализации метрик данные участника, напротив, подтвердили заявленное авторами восьмикратное ускорение.

Организаторы направили письма авторам всех работ с подтвержденными расхождениями, предоставив собранную доказательную базу. Авторы отреагировали предельно конструктивно: в ряде случаев выводы были подтверждены, две правки уже направлены на arXiv, а в одном случае создатели оригинальной статьи самостоятельно исправили ошибку в новой версии препринта за месяц до проведения хакатона, что стало примером независимой сходимости результатов.

Роль человека в эпоху автономных исследований

Главный концептуальный вопрос, возникший по итогам хакатона: останется ли за человеком значимая роль в процессе рецензирования и проверки научных статей? Практика показала, что непосредственное участие человека остается критически необходимым по ряду фундаментальных причин:

  • Ограниченность автономной работы агентов: Предоставленные сами себе языковые модели нередко зацикливались на локальных ошибках, упускали из виду поведение систем на различных масштабах (например, признавали верными ошибочные оценки сложности, завершая тест до проявления логарифмического роста) или выстраивали ложную фальсификацию из-за банального несоответствия единиц измерения. Наиболее надежные результаты демонстрировали те связки, где исследователь корректировал траекторию агента, подвергал сомнению базовые предпосылки или вовремя отменял тупиковые вычислительные эксперименты.
  • Несводимость качественной оценки к формулам: Проект-победитель в категории взаимодействия человека и ИИ стал ярким примером этой необходимости. Статья исследовала сохранение стабильности генерации изображений в условиях жесткого квантования. Формальные числовые метрики говорили об отсутствии коллапса модели, однако реальная пригодность сгенерированных картинок требовала визуального восприятия. Агент разработал специализированный графический интерфейс, в котором человек лично оценил 128 пар изображений, зафиксировал аннотации в репозитории, после чего агент проверил внутреннюю согласованность человеческой разметки.

Ключевая задача человека в новом научном процессе сводится к эффективному руководству интеллектом. Подобно тому как научный руководитель формирует условия для продуктивной работы аспирантов — предоставляет вычислительные ресурсы, инструменты, доступ к данным и дает обратную связь, — участники хакатона добивались наилучших результатов тогда, когда выстраивали правильную среду, задавали точные вопросы и позволяли агентам выполнять рутинную вычислительную работу.

В инициативе приняли участие 1 221 человек, а организационную поддержку оказали платформы Hugging Face и alphaXiv. Все сформированные в ходе проверки логбуки, трассировки, артефакты и вынесенные вердикты опубликованы в открытом доступе в рамках хакатонного пространства. Этот проект заложил фундамент для принципиально нового формата прозрачного постатейного аудита научных конференций с использованием автономных инструментов.

Источник: huggingface.co

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights