Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

LFM2.5-2.6B: компактная нейросеть для локальных агентов

LFM2.5-2.6B: компактная нейросеть для локальных агентов

Производительность и архитектурные особенности LFM2.5-2.6B

Модель LFM2.5-2.6B представляет собой эталонное решение в своем классе, демонстрируя эффективность, сопоставимую с моделями, которые в 4 раза превышают её по количеству параметров. Она показывает выдающиеся результаты в следовании инструкциям, использовании инструментов и выполнении сложных многошаговых агентских задач. Основой её успеха стало агентское обучение с подкреплением (Agentic RL), которое проводилось внутри популярных агентских сред для обеспечения глубокой совместимости и функциональности. Модель предварительно обучена на колоссальном массиве в ~34 триллиона токенов, при этом промежуточный этап обучения позволил расширить контекстное окно до 128 000 токенов, что значительно улучшило работу с длинными последовательностями.

Процесс пост-обучения, превращающий базовую модель в высокоэффективного агента, включает четыре последовательных этапа:

  • Контролируемое дообучение (SFT): два полных раунда SFT с акцентом на агентские данные, такие как использование инструментов (tool use), работа с веб-поиском и изучение траекторий в различных средах.
  • Специализация преподавателей: подготовка отдельных экспертов-учителей для каждой узкой области, включая математику, программирование, работу с инструментами и другие дисциплины.
  • Многодоменная дистилляция (MOPD): перенос накопленных знаний от специализированных учителей в единую модель-студент для консолидации навыков.
  • Агентское обучение с подкреплением (Agentic RL): многоходовое обучение внутри реальных агентских сред, где модель учится эффективно координировать действия, работать с системными промптами и ориентироваться в динамических многоходовых задачах.

Механизм обучения и инфраструктура

Конвейер Agentic RL разделяет оптимизацию модели, логику инференса и исполнение среды на четко определенные компоненты. Training Engine занимается оптимизацией параметров модели, в то время как Rollout Engine генерирует действия, используя актуальную стратегию (policy). RL-фреймворк выступает в роли оркестратора, управляя циклом обучения: он запускает итерации, собирает траектории и вознаграждения, а также обновляет веса модели. Исполнение действий происходит в безопасном Sandbox Service, где такие инструменты, как OpenClaw или Hermes Agent, координируют взаимодействие с задачей. Harness Proxy позволяет воспринимать сторонние агентские среды как «черные ящики» без необходимости их модификации, прозрачно фиксируя данные на уровне токенов, которые впоследствии используются для реконструкции и валидации обучающих выборок RL.

Сравнительный анализ и бенчмарки

Мы протестировали LFM2.5-2.6B против моделей, чей размер доходит до ~10 млрд параметров, на задачах STEM, следовании инструкциям, использовании инструментов и агентской логике. Модель является самой компактной в группе, но при этом уверенно конкурирует с лидерами, а зачастую и превосходит их. Результаты тестирования:

БенчмаркLFM2.5-2.6B (2.6B)gemma-4-E2B-it (5.1B)gemma-4-E4B-it (8B)Qwen3.5-4B (4.7B)Qwen3.5-9B (9.7B)
AA Omniscience-29.50-74.47-49.03-54.30-50.43
AIME2551.8726.3334.2749.3356.07
LiveCodeBenchv659.4154.9263.7760.8569.86
IFBench59.1734.0839.2448.4056.47
Multi-IF80.0769.4477.3555.6762.55
IFStruct85.4964.8576.6536.2578.50
BFCLv456.8836.9846.3950.5660.13
ToolSandbox77.8352.4065.0075.5576.44
τ³-Bench Banking5.673.354.125.455.15
Claw-Eval average (EN)62.8553.1458.0262.2866.53
PinchBench68.2244.2455.0971.2671.45
BrowseComp+ (OpenClaw)26.898.3115.9024.4627.23

Для вашего приложения главными сильными сторонами являются следование инструкциям и использование инструментов. LFM2.5-2.6B лидирует во всех бенчмарках на следование инструкциям и во всех тестах на использование инструментов, за исключением BFCLv4, где её лишь немного опережает модель Qwen 9.7B. В агентских задачах модель обходит оба решения Gemma и держится наравне с Qwen. Она также опережает конкурентов в знаниях и остается близкой к ним в математике. Программирование — единственный аспект, где более крупные модели сохраняют явное преимущество, поэтому для подобных задач лучше использовать более масштабные решения.

Эффективность инференса и практическое применение

Модель LFM2.5-2.6B обеспечивает поддержку экосистемы инференса с первого дня, включая llama.cpp, MLX, vLLM, SGLang и ONNX. Благодаря своей эффективной архитектуре, она является быстрейшей моделью в своем классе. При использовании CPU она выдает 220 токенов/с на Apple M5 Max и 113 токенов/с на AMD Ryzen AI Max+ 395, потребляя при этом менее 2,5 ГБ оперативной памяти. При 30 токенов/с модель позволяет запускать функциональных агентов даже на смартфонах. На GPU достигается почти 15 000 выходных токенов в секунду при высокой параллельной нагрузке, что эквивалентно примерно 1,3 млрд токенов в день на одном ускорителе H100.

Для работы установите библиотеку pip install -U transformers (версия 5.0.0 и выше). Пример загрузки: model = AutoModelForCausalLM.from_pretrained("LiquidAI/LFM2.5-2.6B", device_map="auto", dtype="bfloat16"). Используйте apply_chat_template для подготовки промптов. LFM2.5-2.6B и версия Base доступны на Hugging Face. Вы можете запустить WebGPU-демо прямо в браузере без дополнительной настройки. Мы стремимся к созданию ИИ, работающего везде.

Цитирование: Liquid AI, “LFM2.5-2.6B: Deploy Agents Everywhere”, Liquid AI Blog, Aug 2026. BibTeX: @article{liquidAI202626B, author = {Liquid AI}, title = {LFM2.5-2.6B: Deploy Agents Everywhere}, journal = {Liquid AI Blog}, year = {2026}, note = {www.liquid.ai/blog/lfm2-5-2-6b}}

Источник: huggingface.co

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights