Тэг
vLLM
Contrastive-LM выпустила модель CLM-8B: открытая система оценки действий агентов
Обзор открытой модели CLM-8B от Contrastive-LM, которая оценивает действия ИИ-агентов без генерации текста и работает до 9 раз быстрее аналогов.
Читать далееАсинхронный GRPO с LoRA на Hugging Face Jobs: настройка vLLM, прокси и Storage Buckets
Разбор архитектуры асинхронного обучения с подкреплением (AsyncGRPO) с использованием LoRA-адаптеров в библиотеке TRL v1.14. Показываем, как организовать взаимодействие узлов без межсерверного NCCL через Hugging Face Storage Buckets и умный прокси-маршрутизатор, ускоряющий процесс обучения почти в 4 раза.
Читать далееLLM зацикливается в продакшене: как локализовать петлю повтора без слепой смены параметров
Полный разбор причин зацикливания LLM в продакшене: почему слепое увеличение repetition_penalty вредит системе, как работать с vLLM, анализировать logprobs и оптимизировать промпты.
Читать далееИнтеграция бэкенда transformers в vLLM достигла нативной скорости работы
Библиотека transformers теперь обеспечивает нативную скорость инференса в vLLM для сложных моделей благодаря динамической оптимизации графов и слиянию операторов на лету.
Читать далее






