Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Локальный ИИ и экономика токенов: свежий выпуск обзора индустрии

Локальный ИИ и экономика токенов: свежий выпуск обзора индустрии

Приветствую читателей сайта Sergey Bagrov. Меня зовут Сергей Багров, и сегодня мы разбираем актуальные тренды мира нейросетей, где главным вопросом становится экономика токенов. Бесплатные или дешевые флагманские модели подходят к концу, а локальный ИИ и специализированные инструменты уверенно выходят на первый план.

Поговорим о том, почему эпоха щедрых бонусов от разработчиков подходит к завершению, какие интересные инструменты появились на этой неделе и как грамотно проверять запуск моделей на видеокарте.

Панель мониторинга системных ресурсов при работе ИИ
Графики использования графического адаптера при обработке запросов нейросетью.

Экономика токенов и переосмысление расходов на ИИ

Многие пользователи уже заметили определенную закономерность в работе современных облачных сервисов. Сначала пользователям предоставляют масштабные кредиты и щедрые подписки, чтобы приучить к регулярному использованию нейросетей. Затем модели постепенно начинают отвечать проще, выделенные лимиты сгорают значительно быстрее, а итоговая стоимость подписок возрастает. Те компании, которые перестроили свои рабочие процессы вокруг этой искусственной щедрости, могут столкнуться с серьезными трудностями при росте цен на токены. Именно поэтому локальный искусственный интеллект становится столь актуальным направлением.

Реклама

Далеко не каждая задача требует привлечения тяжелых флагманских моделей. Во многих сценариях отлично справляются компактные нейросети, запущенные на собственном железе и упакованные в удобные для конкретных задач обертки. Интересным примером инструментария является проект Monid, который работает по принципу OpenRouter, но ориентирован на агентские инструменты. Имея один базовый URL и единственный ключ, ИИ-агент получает доступ к тысячам инструментов от множества провайдеров, а открытый уровень коннекторов позволяет легко интегрировать новые API.

Инструменты для агентов и новые почтовые клиенты

Среди свежих релизов выделяется коммуникационная платформа Buzz, созданная для совместной работы людей и автономных агентов. Она поддерживает мобильные приложения, обеспечивая постоянную связь и потенциально заменяя привычные командные чаты.

Почтовые клиенты нового поколения для ИИ-агентов

Интересно, что сразу две крупные платформы независимо друг от друга пришли к концепции автономной почты для агентов, работающих в фоновом режиме. Обычный чат оказывается не слишком удобным интерфейсом для задач, выполняющихся в период отсутствия пользователя.

Решения от Cloudflare и AWS

Проект agentic-inbox от Cloudflare представляет собой саморазворачивающийся почтовый клиент со встроенным ИИ-агентом, функционирующий на базе Cloudflare Workers в облаке. Входящие письма распределяются через маршрутизацию, каждая учетная запись работает в изолированном объекте с базой SQLite, а вложения отправляются в хранилище R2. Агент самостоятельно анализирует почту и подготавливает черновики ответов для последующего подтверждения человеком.

В свою очередь, компания AWS предложила проект Pizza Bot. Это локальный почтовый клиент с открытым исходным кодом под лицензией Apache 2.0, ориентированный на длительную работу агентов на локальном компьютере. Вся информация, включая журналы, контрольные точки и историю, сохраняется в локальной папке в виде файлов SQLite. Система поддерживает работу с провайдерами вроде Ollama, что позволяет запускать весь процесс полностью автономно и даже без подключения к интернету.

Реклама

Интересные ИИ-утилиты и альтернативный софт

Среди новых находок выделяются два проекта, занимающие диаметрально противоположные позиции в вопросах применения нейросетей. Первый — это OpenPencil, дизайн-редактор с открытым исходным кодом, который поддерживает работу с нативными файлами Figma и позволяет копировать элементы между ними. Приложение работает на базе Tauri, не требует создания учетной записи и предлагает сервер протокола Model Context Protocol для удобного взаимодействия с кодинг-агентами.

Второй инструмент можно назвать в определенной степени анти-ИИ решением. Утилита Kalypta запускает небольшую локальную модель на устройстве пользователя и в режиме реального времени изменяет звуковой поток так, чтобы сторонние боты-транскрипторы на встречах не могли распознать речь, оставаясь при этом абсолютно понятной для присутствующих людей.

Новости открытых моделей и технологические тренды

Среди релизов открытых моделей внимание привлекает Qwen-Image-2.1 — компактная модель для генерации изображений по текстовому описанию. Ее веса распространяются под некоммерческой лицензией Qwen Research License, что в очередной раз напоминает о разнице между открытыми весами и подлинным открытым исходным кодом. Также стоит отметить проект laya-mlx — нативный порт типизированной модели принятия решений для устройств на базе Apple Silicon.

Крупные технологические проекты и экономика кэширования

Интересный прецедент продемонстрировала компания Microsoft, переписав среду выполнения агентов GitHub Copilot с TypeScript на язык Rust. Проект потребовал около 128 запросов и обошелся в круглую сумму, причем решающую роль сыграло кэширование промптов.

Каждое обращение к модели заставляет систему считывать весь запрос целиком. Технология кэширования позволяет сохранять промежуточные вычисления для уже обработанных префиксов, предоставляя существенные скидки на повторные запросы. В локальных условиях аналогичным оптимизационным инструментом выступает повторное использование кэша KV, что позволяет выигрывать в скорости отклика.

Практический совет: проверка использования GPU в Ollama

Продолжая тему эффективной работы с локальным ПО, я рекомендую периодически контролировать запуск моделей. Если вы используете локальный сервер Ollama, я настроил и регулярно проверяю выполнение команды ollama ps в момент активности модели. В столбце PROCESSOR отображается информация о том, задействован ли графический чип, центральный процессор или их комбинация в процентном соотношении.

Если модель не помещается целиком в видеопамять, Ollama автоматически переносит часть слоев в системную оперативную память, что приводит к падению производительности. Убедитесь, что показатель загрузки GPU составляет 100%, а при необходимости используйте более компактную квантованную версию или уменьшайте размер контекстного окна для стабильной работы оборудования.

01.