Тэг
бенчмарки ИИ
Насыщение бенчмарков ИИ: почему привычные тесты перестают работать и как с этим бороться
Разбираем феномен насыщения бенчмарков ИИ: почему современные нейросети легко набирают высшие баллы в тестах, но сбоят в реальных задачах, и как построить объективную систему оценки.
Читать далееCompletion gate для локальных моделей: как отделить завершённый ответ от оценки качества
Как корректно оценивать локальные нейросети: разделяем завершённость ответа, корректность JSON, авторемонт и экспертную оценку качества с помощью Completion Gate.
Читать далееОбзор GPT-6 Astra: тестируем новую модель OpenAI, агента Computer Use и бенчмарки
Детальный разбор флагманской модели GPT-6 Astra от OpenAI: автономная работа с ПК, рекордные результаты в ARC-AGI-3, критические тесты кибербезопасности и реальная эффективность.
Читать далееOpenAI представила GPT-6 Astra: первая модель с критическим уровнем риска в кибербезопасности
3 сентября 2026 года OpenAI официально выпустила GPT-6 Astra — флагманскую модель, получившую критический уровень риска в сфере кибербезопасности, рекордные результаты в бенчмарках и обновленные тарифы API.
Читать далееКак метод BenchMIRT раскрывает реальные способности языковых моделей: аудит бенчмарков на уровне промптов
Разбираем новый метод BenchMIRT от Allen Institute for AI: как психометрика и многомерная IRT помогают проверять бенчмарки языковых моделей и точно измерять их реальные возможности.
Читать далее







