Тэг
тестирование
Большой тест-драйв GigaChat 3.5: результаты проверки модели по реальным кейсам
Большой тест-драйв GigaChat 3.5 по реальным кейсам: проверка модели на договорах, рефератах, формулах Excel и сложных таблицах.
Читать далееКак мы автоматизировали тестирование в ELMA365 с помощью ИИ: три итерации и гибридный подход
Опыт автоматизации регрессионного и функционального тестирования в ELMA365 с помощью ИИ и Playwright: три итерации, гибридный подход и снижение нагрузки на аналитиков на 30%.
Читать далееТестирование ИИ-агентов с вызовом функций: как находить скрытые ошибки и неназванные условия
Разбор методологии тестирования ИИ-агентов с вызовом функций. Узнайте, почему модели нарушают скрытые условия, как работают стандартные защиты и как строить карту срывов для безопасного внедрения LLM.
Читать далееКак новый объектив Sony 600mm f/6.3 справляется с быстрыми птицами в полете
Обзор нового компактного супертелеобъектива Sony 600mm f/6.3: полевые испытания в дикой природе, использование телеконвертеров и особенности съемки птиц.
Читать далееОбзор электросушилки Redmond FD1108: тестируем дегидратор для дома
Подробный обзор электросушилки Redmond FD1108: изучаем характеристики, конструкцию, управление, проводим практические тесты и замеры.
Читать далееОбзор видеокарты MSI GeForce RTX 5060 Ti Ventus 2x OC Plus 8GB
Подробный обзор видеокарты MSI GeForce RTX 5060 Ti Ventus 2x OC Plus 8GB: изучаем характеристики памяти GDDR7, особенности охлаждения, уровень шума и игровую производительность.
Читать далееЭтот тест должен пройти каждый новый жесткий диск перед установкой в NAS
Узнайте, почему новый жесткий диск для NAS нельзя устанавливать без предварительного тестирования и как защитить свои данные от внезапного отказа.
Читать далееОбзор Acer Aspire 7 A715-50G: доступный ноутбук для креатива и игр
Подробный обзор ноутбука Acer Aspire 7 A715-50G: характеристики, тесты производительности в приложениях и играх, оценка экрана и автономности.
Читать далееСравнение ИИ-моделей в повседневных задачах: стоит ли платить за флагманы
Провел эксперимент с четырьмя ИИ-моделями на пяти задачах по программированию. Выясняем, где можно сэкономить, а где младшие нейросети допускают критические ошибки.
Читать далееКак проверяющий ИИ испортил правильные ответы: разбор архитектуры и багов LLM-as-a-judge
Разбор архитектурного сбоя при использовании нейросети в роли арбитра. Рассказываю, почему ИИ нельзя давать право перезаписи ответов, как внедрить детерминированную проверку кодом и защититься от галлюцинаций.
Читать далее









