Тэг
бенчмарк
Datalab представила OmniExtractBench для структурированного извлечения данных
Datalab выпустила открытый бенчмарк OmniExtractBench для стандартизированной оценки извлечения данных из документов в JSON-схемы.
Читать далееКак я создал винный бенчмарк OenoBench для LLM с помощью агентов
Опыт создания винного бенчмарка OenoBench на 3266 вопросов с помощью LLM: сбор данных, агентный аудит, ошибки генерации и результаты эвала 16 моделей.
Читать далееЧто думают сами LLM насчет наличия у себя сознания?
2026-09-27 Нейросети и AI
Провожу эксперимент с языковыми моделями: создаю специальный бенчмарк, чтобы проверить, как нейросети оценивают наличие у себя сознания и субъективного опыта.
Читать далееGradium AI представила новую стандартную TTS-модель: 81% точности на сложных текстах и задержка 216 мс
2026-09-01 Нейросети и AI
Gradium AI представила обновленную TTS-модель по умолчанию: точность 81,0% на сложных текстах и задержка первого аудиотега 216 мс.
Читать далее 01.








