Мой блог
Создание ИИ-моделей своими руками: опыт работы с ИИ-агентом ML-intern
создание ИИ-моделей — Часто стандартных нейросетевых моделей недостаточно для решения специфических задач: они могут быть слишком требовательными к ресурсам или лишенными узкопрофильных знаний. В таких ситуациях решением становится разработка собственных специализированных версий. В материале на примере использования ИИ-агента для создания моделей под названием ML-intern показано, как автоматизировать этот процесс без глубокого погружения в написание кода обучения, уложившись в минимальный бюджет.
Инструмент берет на себя планирование работы, запрашивает лимит расходов перед началом платных вычислений, запускает предварительные тесты, после чего проводит обучение, оценивает результат и публикует готовую модель на платформе Hugging Face.
Принцип работы и составление промптов для ML-intern
Разработка моделей с помощью агента ML-intern, доступного в интерфейсе HuggingChat, строится на отправке текстовых инструкций (промптов). По мере усложнения задач объем таких запросов может вырасти со стартовых 450 слов до 2000 слов. Автор эксперимента собрал свои шаблоны на GitHub, чтобы упростить старт для других пользователей.


Эффективный промпт для ИИ-агента должен содержать четкую структуру:
- Краткое описание идеи и причин ее реализации в одну строку.
- Точное указание используемых компонентов: набора данных (датасета), базовой модели и скрипта для обучения.
- Раздел «Проверенные факты» (Verified facts, do not re-derive), где перечисляются известные ограничения или готовые настройки, чтобы агент не тратил время и бюджет на повторные тесты.
Критически важными являются две инструкции внутри запроса. Первая требует провести оценку базовой модели (zero-shot score) до начала обучения — без этого шага невозможно точно измерить полученный прирост эффективности. Вторая задает быстрый тестовый запуск (smoke test), например на 50 шагов обучения, с обязательной проверкой того, что веса модели действительно начали изменяться.
В финальной части промпта устанавливается жесткий лимит на расходы (например, не более 12 долларов США). Так как агент по умолчанию начинает работу с нулевым бюджетом и требует подтверждения перед запуском платных вычислений, этот лимит строго контролируется. Если ограничение не задано, инструмент предлагает несколько вариантов стоимости в зависимости от масштаба проекта.
Практические кейсы: шесть созданных моделей: 1. Специализированное зрение: диагностика цитрусовых
Универсальные мультимодальные модели способны распознать пожелтевший лист растения, но затрудняются с точным определением причин — будь то поражение клещом или дефицит магния, а также не могут предложить конкретные методы лечения. Для решения этой проблемы был подготовлен специализированный датасет citrus-disease-vlm-instruct, содержащий 3017 размеченных изображений по 21 виду вредителей, болезней и дефицита питательных веществ.
Агент выполнил тонкую настройку модели Qwen3.5-2B на основе собранных данных. На тестовой выборке из 335 снимков базовая модель правильно определяла проблему лишь в 14,9% случаев. После двух эпох обучения на видеокарте A10G точность распознавания специализированной версии выросла до 52,8%. Весь процесс вычислений обошелся примерно в 1,90 доллара.
2. Генерация фирменных персонажей (Huggy LoRA)
Популярные генераторы изображений хорошо знакомы со стандартными персонажами, но не умеют рисовать специфических маскотов, таких как Huggy (символ платформы Hugging Face). Для обучения была создана LoRA для модели FLUX.2 klein base 4B на базе датасета из 84 иллюстрированных изображений с текстовыми описаниями.
В процессе обучения ИИ-агент сохранял контрольные точки (чекпоинты) каждые 100 шагов и генерировал проверочные изображения по одним и тем же промптам. Это позволило наглядно оценить прогресс: на 200-м шаге персонаж стал полностью соответствовать оригинальному стилю, а после 500-го шага фирменный стиль начал избыточно влиять на генерации, не связанные с маскотом. Обученная LoRA стабильно работает и на дистиллированной 4-шаговой модели, а затраты на вычисления составили около 7,60 доллара.
3. Добавление новых возможностей (Угол камеры и дорисовка)
Для реализации контроля ракурса камеры была создана модель Viewpoint Orbit LoRA. Сначала агент сгенерировал 24 722 прозрачных изображения (1030 бытовых объектов, отснятых под 24 разными углами) на базе процессора за минимальную стоимость. Для финального обучения использовалось 1844 пары снимков «до и после» для 23 команд изменения ракурса. Обучение заняло 2000 шагов (около 90 минут на GPU A100) и стоило 3,75 доллара. Суммарный бюджет проекта с учетом исправления ошибок путей и пакетов составил 16 долларов.
Вторым экспериментом стала модель Doodle-in LoRA, которая позволяет загрузить фотографию с розовой пометкой-наброском и текстовым запросом, чтобы заменить эту область нужным объектом с сохранением оригинального освещения. Датасет создавался автоматически: из исходных картинок Open Images удалялись объекты с помощью модели LaMa, а на их месте рисовался контур. Всего было создано 6042 обучающие пары. Процесс обучения занял 1 час 38 минут на A100 (стоимость около 4 долларов). Использование модели совместно с Viggle turbo LoRA позволило сократить время генерации до 4,7 секунды на операцию с точностью позиционирования объектов 67,5%. Общие затраты составили 24,30 доллара за 59 итераций задач.
4. Сжатие моделей под мобильные устройства и браузеры
Для создания компактного инструмента перефразирования промптов (Pocket Rewriter) была проведена дистилляция крупной 9B-модели Qwen-Image 2.1, требующей 20 ГБ оперативной памяти. Сначала с помощью легковесной модели было сгенерировано 8797 простых запросов разного типа, которые затем были обработаны исходной 9B-версией на видеокарте A100 за 2,5 часа. После фильтрации осталось 1840 качественных примеров. На их основе были обучены студенческие модели размером 0.8B и 2B (время обучения на A10G составило 12 и 18 минут соответственно). Версия 0.8B доступна в формате GGUF размером 812 МБ для запуска на обычных процессорах. Расходы на проект составили 16,05 доллара.
Второй задачей в этой категории стала оптимизация text-to-image модели Agate Preview 002 (260 млн параметров), которой стандартно требуется 50 шагов генерации. Агенту была поставлена задача сократить процесс до 4 шагов. Первый этап включал кэширование 155 000 изображений и поэтапное снижение числа шагов с 16 до 4. На втором этапе модель дополнительно улучшили с помощью 24 000 пар изображений, сгенерированных учителем. В итоге 4-шаговая модель показала метрику GenEval на уровне 0.536 (при 0.563 у оригинальной 50-шаговой версии) и была экспортирована в ONNX для работы прямо в браузере. Суммарные затраты на два запуска составили 37 долларов.
Сводные затраты на обучение моделей
В таблице ниже приведены затраты на вычислительные ресурсы (GPU и CPU), зафиксированные в ходе выполнения описанных проектов:
| Проект / Название приложения | Базовая модель | Стоимость вычислений (USD) |
|---|---|---|
| Citrus Doctor (Диагностика цитрусовых) | Qwen3.5-2B | 1.90 |
| Huggy LoRA (Фирменный персонаж) | FLUX.2 klein base 4B | 7.60 |
| Pocket Rewriter (Оптимизатор промптов) | Qwen3.5-0.8B и 2B | 16.05 |
| Viewpoint Orbit LoRA (Управление ракурсом) | Qwen-Image 2.1 | 16.00 |
| Doodle-in LoRA (Дорисовка по наброску) | Qwen-Image 2.1 | 24.30 |
| Agate 4-step (Быстрая генерация картинок) | Agate Preview 002 | 37.00 |
| Итого | – | ~103.00 |
Как запустить собственный процесс обучения
Для использования ИИ-агента ML-intern необходимо открыть HuggingChat, переключить режим на соответствующий инструмент и отправить подготовленный промпт. В качестве основы можно взять бесплатные шаблоны запросов из репозитория GitHub.
Рекомендуется начинать с формулирования гипотезы, подбора имеющегося или создания нового описательного датасета. Обязательно ограничивайте бюджет на ранних этапах, запрашивайте предварительное тестирование (smoke test) и проводите замер базовых показателей модели до старта полноценного обучения. Полученными результатами и готовыми моделями разработчики предлагают делиться в профильных сообществах, отмечая команды Gradio и Hugging Face.
