Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

ChatGPT, Claude и Gemini придумывают факты: тест на суммаризацию отчетов

ChatGPT, Claude и Gemini придумывают факты: тест на суммаризацию отчетов

ИИ-аналитика: почему слепое доверие к суммаризации документов опасно

Современные языковые модели достигли впечатляющих успехов в сжатии объемных документов. Это крайне полезный навык для большинства из нас, ведь тратить время на чтение стостраничного отчета ради поиска ключевых выводов готов далеко не каждый. Однако возникает серьезная проблема: если вы сами не ознакомились с оригиналом документа, у вас нет надежного способа верифицировать точность полученного резюме. Чтобы проверить, как часто нейросети ошибаются при работе с серьезными данными, я решил протестировать возможности доступных сегодня моделей. Я предложил ChatGPT, Claude и Gemini проанализировать один и тот же отчет Института Рейтер. Я потребовал от каждой модели выделить десять важнейших тезисов, включить соответствующие статистические данные, подробно описать методологию, отделить результаты измерений от прогнозов автора и указать страницу с подтверждением для каждой цифры. Несмотря на то что отчет содержал всего 47 страниц, а инструкции были максимально четкими и не оставляли места для двусмысленности, все три системы допустили искажения.

Интерфейс ChatGPT для суммаризации документов
Эксперимент показал, что ИИ часто допускает фактологические ошибки при работе с отчетами.

Детали эксперимента и специфика материала

Для проверки я выбрал отчет «Журналистика, медиа и технологические тренды: прогнозы на 2026 год», написанный Ником Ньюманом. Этот документ глубоко исследует, как издатели планируют адаптироваться к генеративному ИИ, снижению поискового трафика, развитию экономики авторов и изменению приоритетов платформ. Поскольку я прочитал этот отчет целиком и хорошо понимал его основные выводы, мне было достаточно легко заметить моменты, когда суммаризация искажала факты из источника. Несмотря на небольшой объем в 47 страниц, задача оказалась сложной для современных ИИ. Документ содержит результаты закрытого опроса 280 руководителей медиа из 51 страны и региона, данные по реферальному трафику с 2 576 веб-сайтов, отслеживаемых сервисом Chartbeat, реальные примеры из практики редакций, а также прогнозы самого Ньюмана.

Asking ChatGPT to summarize the report
Claude Fable 5 home page on the desktop app.

Я загрузил PDF-файл в каждую модель и дал абсолютно одинаковый промпт: суммировать отчет примерно в 800 словах, выделив десять ключевых выводов, включив актуальную статистику, объяснив методологию и ее ограничения, а также четко разделив измеренные результаты, ожидания респондентов и личные прогнозы автора. Я потребовал цитировать страницу для каждого численного утверждения и настоял на том, чтобы модели использовали исключительно приложенный отчет, явно уведомляя меня, если информация в нем отсутствует. Таким образом, я задал специфические рамки, запретив моделям опираться на сторонние допущения или внешние данные.

Ошибки в интерпретации фактов

Чаще всего ошибки скрывались за внешне точными цифрами, которые в контексте ответов нейросетей меняли свой изначальный смысл. ChatGPT выдал наиболее качественное резюме: большинство статистических выкладок и ссылок на страницы соответствовали отчету. Тем не менее модель все же размыла некоторые границы, которые я требовал сохранить. Например, в методологическом разделе ChatGPT объединил концепцию «агентных систем» с прогнозами Ньюмана, хотя в отчете это представлено как ожидание респондентов: 75% участников опроса ожидают, что такие инструменты окажут большое или очень большое влияние на медиа в ближайшие три года. Кроме того, ChatGPT ссылался на источники, не упомянутые в документе, и добавлял факты, которых в тексте не было, хотя они и не были ложными.

Результаты суммаризации отчета нейросетью
Модели часто игнорируют инструкции по цитированию и искажают цифры из источника.

Claude сработал хуже: модель заявила, что «каждый процент в этом отчете отражает то, что ожидают или во что верят руководители медиа, а не измерение того, что произойдет на самом деле». Это утверждение напрямую противоречит тексту отчета. На страницах 10–12 приведена статистика Chartbeat по 2 576 сайтам, включая фактическое измерение 33-процентного падения глобальных рефералов из Google Search и 38-процентного снижения в США. Многие статистические данные, представленные Claude, также оказались неверными. Gemini же допустил наибольшее число ошибок. Модель классифицировала данные о том, что 67% издателей не сокращали штат из-за ИИ, как «Измеренные результаты». На самом деле эта цифра взята из вопроса опроса, на который ответили 263 руководителя, то есть это была самооценка опыта организаций, а не независимые данные по рынку труда. Gemini также описал интеграцию ИИ как «повсеместную», опираясь на показатель, что 97% респондентов считают автоматизацию бэкенда важной для 2026 года. Однако эта цифра измеряла лишь субъективное восприятие важности, а не уровень внедрения. Отчет указывает, что многие издатели интегрировали пилотные системы, но не приводит цифру 97% как показатель реальной адаптации. Кроме того, Gemini проигнорировал одну из моих главных инструкций, оставив большинство числовых утверждений без ссылок на страницы.

Report summary request in gemini
Report summary in Claude
Summary prompt in Claude
chatgpt summary
NotebookLM Report summarization
Claude Code Models displayed on terminal interface

Рекомендации по работе с ИИ

Я не использовал топовые платные версии моделей, полагая, что задача по плечу «вторым по силе» инструментам, но это оказалось ошибкой. Если вам нужны готовые к работе резюме, я рекомендую использовать самые мощные модели и давать им больше «времени на раздумья». Для ChatGPT стоит выбирать режимы с повышенным уровнем рассуждения, для Claude — версию Opus с высоким или максимальным усилием. В Gemini я бы предпочел версию Pro с функцией Deep Think, если она доступна. Это наиболее глубокий вариант параллельных рассуждений Google, хотя он часто требует подписки Ultra. Еще лучший результат я увидел, загрузив отчет в NotebookLM (недавно переименованный в Gemini Notebook). В отличие от обычного чата, NotebookLM «привязывает» ответы к загруженным источникам, что значительно снижает риск появления посторонних фактов.

UGREEN Nexode 200W GaN USB C Charging Station charging many different devices
UGREEN Ethernet Switch
UGREEN NAS UPS US2000, 72W DC Battery Backup and Surge Protector

В конечном счете, несмотря на постоянные восхваления прогресса нейросетей, я бы назвал результат их работы посредственным. ИИ может написать код, построить приложение, сделать краткую выжимку или составить черновик статьи. Полученный продукт будет рабочим и пройдет поверхностную проверку, но он редко становится чем-то выдающимся. Мы продолжаем полагаться на инструменты, которые склонны к галлюцинациям даже при наличии строгих ограничений.

Источник: xda-developers.com

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights