Мой блог
LFM2.5-2.6B: компактная нейросеть для локальных агентов

Производительность и архитектурные особенности LFM2.5-2.6B
Модель LFM2.5-2.6B представляет собой эталонное решение в своем классе, демонстрируя эффективность, сопоставимую с моделями, которые в 4 раза превышают её по количеству параметров. Она показывает выдающиеся результаты в следовании инструкциям, использовании инструментов и выполнении сложных многошаговых агентских задач. Основой её успеха стало агентское обучение с подкреплением (Agentic RL), которое проводилось внутри популярных агентских сред для обеспечения глубокой совместимости и функциональности. Модель предварительно обучена на колоссальном массиве в ~34 триллиона токенов, при этом промежуточный этап обучения позволил расширить контекстное окно до 128 000 токенов, что значительно улучшило работу с длинными последовательностями.
Процесс пост-обучения, превращающий базовую модель в высокоэффективного агента, включает четыре последовательных этапа:
- Контролируемое дообучение (SFT): два полных раунда SFT с акцентом на агентские данные, такие как использование инструментов (tool use), работа с веб-поиском и изучение траекторий в различных средах.
- Специализация преподавателей: подготовка отдельных экспертов-учителей для каждой узкой области, включая математику, программирование, работу с инструментами и другие дисциплины.
- Многодоменная дистилляция (MOPD): перенос накопленных знаний от специализированных учителей в единую модель-студент для консолидации навыков.
- Агентское обучение с подкреплением (Agentic RL): многоходовое обучение внутри реальных агентских сред, где модель учится эффективно координировать действия, работать с системными промптами и ориентироваться в динамических многоходовых задачах.
Механизм обучения и инфраструктура
Конвейер Agentic RL разделяет оптимизацию модели, логику инференса и исполнение среды на четко определенные компоненты. Training Engine занимается оптимизацией параметров модели, в то время как Rollout Engine генерирует действия, используя актуальную стратегию (policy). RL-фреймворк выступает в роли оркестратора, управляя циклом обучения: он запускает итерации, собирает траектории и вознаграждения, а также обновляет веса модели. Исполнение действий происходит в безопасном Sandbox Service, где такие инструменты, как OpenClaw или Hermes Agent, координируют взаимодействие с задачей. Harness Proxy позволяет воспринимать сторонние агентские среды как «черные ящики» без необходимости их модификации, прозрачно фиксируя данные на уровне токенов, которые впоследствии используются для реконструкции и валидации обучающих выборок RL.
Сравнительный анализ и бенчмарки
Мы протестировали LFM2.5-2.6B против моделей, чей размер доходит до ~10 млрд параметров, на задачах STEM, следовании инструкциям, использовании инструментов и агентской логике. Модель является самой компактной в группе, но при этом уверенно конкурирует с лидерами, а зачастую и превосходит их. Результаты тестирования:
| Бенчмарк | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|---|
| AA Omniscience | -29.50 | -74.47 | -49.03 | -54.30 | -50.43 |
| AIME25 | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| LiveCodeBenchv6 | 59.41 | 54.92 | 63.77 | 60.85 | 69.86 |
| IFBench | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi-IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| IFStruct | 85.49 | 64.85 | 76.65 | 36.25 | 78.50 |
| BFCLv4 | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
| ToolSandbox | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| τ³-Bench Banking | 5.67 | 3.35 | 4.12 | 5.45 | 5.15 |
| Claw-Eval average (EN) | 62.85 | 53.14 | 58.02 | 62.28 | 66.53 |
| PinchBench | 68.22 | 44.24 | 55.09 | 71.26 | 71.45 |
| BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
Для вашего приложения главными сильными сторонами являются следование инструкциям и использование инструментов. LFM2.5-2.6B лидирует во всех бенчмарках на следование инструкциям и во всех тестах на использование инструментов, за исключением BFCLv4, где её лишь немного опережает модель Qwen 9.7B. В агентских задачах модель обходит оба решения Gemma и держится наравне с Qwen. Она также опережает конкурентов в знаниях и остается близкой к ним в математике. Программирование — единственный аспект, где более крупные модели сохраняют явное преимущество, поэтому для подобных задач лучше использовать более масштабные решения.
Эффективность инференса и практическое применение
Модель LFM2.5-2.6B обеспечивает поддержку экосистемы инференса с первого дня, включая llama.cpp, MLX, vLLM, SGLang и ONNX. Благодаря своей эффективной архитектуре, она является быстрейшей моделью в своем классе. При использовании CPU она выдает 220 токенов/с на Apple M5 Max и 113 токенов/с на AMD Ryzen AI Max+ 395, потребляя при этом менее 2,5 ГБ оперативной памяти. При 30 токенов/с модель позволяет запускать функциональных агентов даже на смартфонах. На GPU достигается почти 15 000 выходных токенов в секунду при высокой параллельной нагрузке, что эквивалентно примерно 1,3 млрд токенов в день на одном ускорителе H100.
Для работы установите библиотеку pip install -U transformers (версия 5.0.0 и выше). Пример загрузки: model = AutoModelForCausalLM.from_pretrained("LiquidAI/LFM2.5-2.6B", device_map="auto", dtype="bfloat16"). Используйте apply_chat_template для подготовки промптов. LFM2.5-2.6B и версия Base доступны на Hugging Face. Вы можете запустить WebGPU-демо прямо в браузере без дополнительной настройки. Мы стремимся к созданию ИИ, работающего везде.
Цитирование: Liquid AI, “LFM2.5-2.6B: Deploy Agents Everywhere”, Liquid AI Blog, Aug 2026. BibTeX: @article{liquidAI202626B, author = {Liquid AI}, title = {LFM2.5-2.6B: Deploy Agents Everywhere}, journal = {Liquid AI Blog}, year = {2026}, note = {www.liquid.ai/blog/lfm2-5-2-6b}}
Источник: huggingface.co

