Мой блог
ChatGPT, Claude и Gemini придумывают факты: тест на суммаризацию отчетов

ИИ-аналитика: почему слепое доверие к суммаризации документов опасно
Современные языковые модели достигли впечатляющих успехов в сжатии объемных документов. Это крайне полезный навык для большинства из нас, ведь тратить время на чтение стостраничного отчета ради поиска ключевых выводов готов далеко не каждый. Однако возникает серьезная проблема: если вы сами не ознакомились с оригиналом документа, у вас нет надежного способа верифицировать точность полученного резюме. Чтобы проверить, как часто нейросети ошибаются при работе с серьезными данными, я решил протестировать возможности доступных сегодня моделей. Я предложил ChatGPT, Claude и Gemini проанализировать один и тот же отчет Института Рейтер. Я потребовал от каждой модели выделить десять важнейших тезисов, включить соответствующие статистические данные, подробно описать методологию, отделить результаты измерений от прогнозов автора и указать страницу с подтверждением для каждой цифры. Несмотря на то что отчет содержал всего 47 страниц, а инструкции были максимально четкими и не оставляли места для двусмысленности, все три системы допустили искажения.

Детали эксперимента и специфика материала
Для проверки я выбрал отчет «Журналистика, медиа и технологические тренды: прогнозы на 2026 год», написанный Ником Ньюманом. Этот документ глубоко исследует, как издатели планируют адаптироваться к генеративному ИИ, снижению поискового трафика, развитию экономики авторов и изменению приоритетов платформ. Поскольку я прочитал этот отчет целиком и хорошо понимал его основные выводы, мне было достаточно легко заметить моменты, когда суммаризация искажала факты из источника. Несмотря на небольшой объем в 47 страниц, задача оказалась сложной для современных ИИ. Документ содержит результаты закрытого опроса 280 руководителей медиа из 51 страны и региона, данные по реферальному трафику с 2 576 веб-сайтов, отслеживаемых сервисом Chartbeat, реальные примеры из практики редакций, а также прогнозы самого Ньюмана.


Я загрузил PDF-файл в каждую модель и дал абсолютно одинаковый промпт: суммировать отчет примерно в 800 словах, выделив десять ключевых выводов, включив актуальную статистику, объяснив методологию и ее ограничения, а также четко разделив измеренные результаты, ожидания респондентов и личные прогнозы автора. Я потребовал цитировать страницу для каждого численного утверждения и настоял на том, чтобы модели использовали исключительно приложенный отчет, явно уведомляя меня, если информация в нем отсутствует. Таким образом, я задал специфические рамки, запретив моделям опираться на сторонние допущения или внешние данные.
Ошибки в интерпретации фактов
Чаще всего ошибки скрывались за внешне точными цифрами, которые в контексте ответов нейросетей меняли свой изначальный смысл. ChatGPT выдал наиболее качественное резюме: большинство статистических выкладок и ссылок на страницы соответствовали отчету. Тем не менее модель все же размыла некоторые границы, которые я требовал сохранить. Например, в методологическом разделе ChatGPT объединил концепцию «агентных систем» с прогнозами Ньюмана, хотя в отчете это представлено как ожидание респондентов: 75% участников опроса ожидают, что такие инструменты окажут большое или очень большое влияние на медиа в ближайшие три года. Кроме того, ChatGPT ссылался на источники, не упомянутые в документе, и добавлял факты, которых в тексте не было, хотя они и не были ложными.

Claude сработал хуже: модель заявила, что «каждый процент в этом отчете отражает то, что ожидают или во что верят руководители медиа, а не измерение того, что произойдет на самом деле». Это утверждение напрямую противоречит тексту отчета. На страницах 10–12 приведена статистика Chartbeat по 2 576 сайтам, включая фактическое измерение 33-процентного падения глобальных рефералов из Google Search и 38-процентного снижения в США. Многие статистические данные, представленные Claude, также оказались неверными. Gemini же допустил наибольшее число ошибок. Модель классифицировала данные о том, что 67% издателей не сокращали штат из-за ИИ, как «Измеренные результаты». На самом деле эта цифра взята из вопроса опроса, на который ответили 263 руководителя, то есть это была самооценка опыта организаций, а не независимые данные по рынку труда. Gemini также описал интеграцию ИИ как «повсеместную», опираясь на показатель, что 97% респондентов считают автоматизацию бэкенда важной для 2026 года. Однако эта цифра измеряла лишь субъективное восприятие важности, а не уровень внедрения. Отчет указывает, что многие издатели интегрировали пилотные системы, но не приводит цифру 97% как показатель реальной адаптации. Кроме того, Gemini проигнорировал одну из моих главных инструкций, оставив большинство числовых утверждений без ссылок на страницы.






Рекомендации по работе с ИИ
Я не использовал топовые платные версии моделей, полагая, что задача по плечу «вторым по силе» инструментам, но это оказалось ошибкой. Если вам нужны готовые к работе резюме, я рекомендую использовать самые мощные модели и давать им больше «времени на раздумья». Для ChatGPT стоит выбирать режимы с повышенным уровнем рассуждения, для Claude — версию Opus с высоким или максимальным усилием. В Gemini я бы предпочел версию Pro с функцией Deep Think, если она доступна. Это наиболее глубокий вариант параллельных рассуждений Google, хотя он часто требует подписки Ultra. Еще лучший результат я увидел, загрузив отчет в NotebookLM (недавно переименованный в Gemini Notebook). В отличие от обычного чата, NotebookLM «привязывает» ответы к загруженным источникам, что значительно снижает риск появления посторонних фактов.



В конечном счете, несмотря на постоянные восхваления прогресса нейросетей, я бы назвал результат их работы посредственным. ИИ может написать код, построить приложение, сделать краткую выжимку или составить черновик статьи. Полученный продукт будет рабочим и пройдет поверхностную проверку, но он редко становится чем-то выдающимся. Мы продолжаем полагаться на инструменты, которые склонны к галлюцинациям даже при наличии строгих ограничений.
Источник: xda-developers.com

