Мой блог
Большой тест-драйв GigaChat 3.5: результаты проверки модели по реальным кейсам
В начале сентября Сбер открыл веса новой крупной языковой модели GigaChat 3.5, предоставив российским разработчикам и компаниям возможность развертывать ее на собственных серверах при наличии подходящей аппаратной базы. Масштабное тестирование GigaChat 3.5 по реальным кейсам позволяет оценить практические возможности этой российской разработки при выполнении сложных офисных, правовых и расчетных задач в составе автоматизированных ИИ-агентов. Подробнее по теме: Как подключить GigaChat к n8n в Docker и решить проблему с сертификатами Минцифры.

В рамках сравнительного исследования модель прошла серию из десяти различных практических заданий, результаты которых сопоставлялись с показателями других актуальных нейросетей, включая решения от Yandex Cloud.



Юридические и текстовые задачи
Первое практическое испытание касалось составления юридического документа — договора аренды гаража с заданными реквизитами сторон и конкретным сроком действия. Модель успешно справилась с задачей за 43 секунды в рамках одного запроса, опередив альтернативные решения, которые затратили значительно больше токенов и времени. Подробнее по теме: LLM и 152-ФЗ: как легально использовать нейросети с данными клиентов.


Во втором задании нейросеть должна была подготовить претензию продавцу о возврате денежных средств за неисправный товар с корректными ссылками на действующее законодательство. Документ был сформирован за 31 секунду с минимумом внутренних токенов и корректным указанием статей закона.



Проверка источников и фактов
Третье задание предполагало написание трехстраничного реферата по исторической тематике с перечнем из пяти источников литературы. Модель успешно справилась со структурой текста, однако проверка показала типичные для генеративных систем нюансы: часть библиографии потребовала жесткой верификации, а заключение содержало излишне обобщенные формулировки.



В качестве ловушки исследователи запросили справку о несуществующей научной конференции. Как и другие протестированные системы, модель приняла ложную вводную за чистую монету и сгенерировала подробные вымышленные данные об участниках и темах докладов.



Работа с документами и таблицами Excel
В задаче на пересказ реального документа формата PDF объемом в несколько страниц нейросеть продемонстрировала высокую точность, не добавив от себя лишней информации и подготовив сжатое изложение за один запрос.


Значительная часть тестов была посвящена работе с электронными таблицами Excel:


- Финансовый отчёт с расчетом выручки, себестоимости, налогов и операционных расходов был выполнен с корректным применением формул и построением графика.
- При простом переносе исходной номенклатуры товаров модель точно сформировала таблицу, добавив итоговые значения и столбец суммы без искажения исходных данных.
- В задаче на составление табеля рабочего графика модель корректно выдержала логику чередования смен для сотрудников.
- При заполнении итогового свода на основе нескольких листов Excel система успешно перенесла все массивы данных и проставила необходимые формулы суммирования.
Выводы и перспективы использования
Проведенный тест-драйв показал, что новая версия российской модели демонстрирует высокую скорость работы и способна успешно справляться со структурированными офисными и расчетными задачами. Тем не менее, склонность к генерации недостоверных деталей в ряде сценариев требует внедрения обязательных этапов проверки результатов при построении комплексных ИИ-агентов. Подробнее по теме: Как ThinkingBox оценивает ИИ-агентов по реальным изменениям в базе данных.
