Как создать эффективные модели с помощью ML-Intern: пошаговое руководство


Недавно я столкнулся с задачей создания компактной версии переписывающего запроса, который поставляется с Qwen-Image 2.1. Официальная версия модели имеет 9 миллиардов параметров и требует около 20 ГБ памяти, а также обрабатывает тысячи токенов перед тем, как написать хотя бы один абзац. На платформе Hub я нашел только сжатые копии этой же 9B модели. Я описал свои требования ML Intern, и на следующий день получил версию с 0.8 миллиарда параметров, которая работает на CPU. Она возвращает корректный результат в 99.7% случаев и использует около четверти токенов учителя. Общие вычислительные затраты на весь проект, включая разметку 8,797 примеров запросов 9B моделью, составили 16 долларов США. В течение следующих нескольких дней я создал еще пять моделей аналогичным образом. Каждая из них начиналась с сообщения в HuggingChat с включенным ML-intern и заканчивалась как публичная модель на Hub с ее оценкой в карточке модели. ML-intern планирует работу, запрашивает у меня бюджет перед тем, как потратить что-либо, проводит небольшой тест перед основной работой, а затем обучает, оценивает и публикует на оборудовании Hugging Face.

Как я взаимодействую с ML Intern

Первое сообщение — это то, на чем я сосредотачиваюсь. Мой первый запрос для модели цитрусовых содержал около 450 слов. К шестому проекту он увеличился до 2000 слов, так как каждый проект научил меня чему-то новому, что я хотел использовать в следующем. Все семь запросов доступны на GitHub по адресу yvrjsharma/ml-intern-prompts, точно так, как я их написал. Запрос начинается с идеи в одной строке и объяснения, зачем она нужна. Затем перечисляются конкретные компоненты: набор данных, базовая модель, скрипт обучения. Все, что я уже проверил, попадает под заголовок "Проверенные факты, не переопределять", чтобы агент тратил свой бюджет на работу, а не на повторное открытие того, что я знаю. В разделе о LoRA для угла камеры я указал, какой тренер только что добавил поддержку прозрачных изображений и какие открытые проблемы на GitHub делают резервный тренер рискованным. Две строки в запросе критически важны. Первая — это запрос на базовую оценку до начала обучения. Например, в запросе для цитрусовых я указал: "Также сообщите о нулевом показателе базовой модели по той же метрике до обучения, чтобы мы могли увидеть прирост". Без этого вы получаете обученную модель и не имеете представления о том, лучше ли она, чем то, с чего вы начали. Вторая строка — это дымовой тест с прикрепленной проверкой. Для LoRA изображений я запросил 50 шагов обучения, а затем проверку, что сохраненные веса действительно изменились, прежде чем платить за полный запуск. В конце запроса я описываю ожидаемые результаты и ограничиваю стоимость. Я определяю, что должно быть в карточке модели, и добавляю инструкцию, например: "Ограничьте общие расходы до 12 долларов и спросите меня перед превышением этой суммы". Поскольку ML-intern начинает каждую задачу с нулевым бюджетом и нуждается в разрешении перед выполнением оплаченных работ, это ограничение расходов строго соблюдается.

Шесть моделей, созданных с помощью ML-Intern

1. Модель, которая знает вашу область. Общая модель зрения может описать желтеющий цитрусовый лист. Однако определить, является ли это проблемой с паутинным клещом или дефицитом магния, а также предложить биологические и небилогические методы лечения растения, очень сложно. Используя Claude, я собрал обучающий набор данных, объединенный из трех источников, размещенных организацией Project-AgML на Hub. В результате получилась модель citrus-disease-vlm-instruct, содержащая 3,017 аннотированных изображений по 21 различным вредителям, заболеваниям, дефицитам питательных веществ и методам лечения. ML-intern справился с дообучением Qwen3.5-2B, используя эти примеры, убедившись, что базовая модель была оценена заранее. На 335 тестовых фотографиях базовая модель правильно определила проблему в 14.9% случаев. После двух эпох на одном A10G дообученная модель достигла 52.8%. Затраты на вычисления составили около 1.90 долларов США. 2. Модель, которая рисует вашего персонажа. Изображенческие модели знают множество персонажей. Однако Huggy, нарисованный в плоском стиле активов Hugging Face, не был одним из них. Я попросил ML-Intern создать LoRA на базе FLUX.2 klein 4B, обученной на 84 аннотированных рисунках из набора данных Chunte/huggy_for_training. Агент сохранял контрольные точки каждые 100 шагов и рисовал один и тот же набор запросов с каждой из них, что облегчало выбор. На 200 шаге Huggy был полностью в модели. С 500 шага стиль Huggy начал просачиваться в запросы, которые не имели ничего общего с Huggy! Обученная LoRA также работает на дистиллированной klein модели при 4 шагах. Затраты на вычисления составили около 7.60 долларов США. 3. Модель, которая делает новый трюк. LoRA для угла камеры — одна из самых популярных надстроек сообщества для предыдущих моделей Qwen-Image. Вы можете показать модели изображение объекта и попросить увидеть его под углом 45 градусов слева. Когда я проверил несколько дней спустя после выпуска модели Qwen-Image 2.1, никто еще не создал такую модель, поэтому я поручил ML-intern построить ее. ML-intern обработал 1,030 отсканированных бытовых объектов из Google Scanned Objects под 24 угла, создав 24,722 прозрачных изображения, что стоило несколько центов. Позже он завершил 461 объект для обучения и 40 для тестирования, а также 1,844 пар до и после обучения, равномерно распределенных по 23 инструкциям по камере. Обучение проходило 2,000 шагов за примерно 90 минут на одном A100 (~3.75 долларов США). 4. Модель, которая подходит для вашего устройства. Pocket Rewriter — это первая модель, о которой я упомянул в начале. ML-intern начал с генерации 8,797 коротких запросов изображений с помощью небольшой модели инструкций через Inference Providers, следуя смешанному набору в моем запросе: фотографии, постеры, логотипы, инфографика и многое другое, около трети из которых запрашивали точный текст в кавычках, и многие на языках, отличных от английского. Модель 9B затем переписала все эти запросы на одном A100 за 2 часа 37 минут (~6.50 долларов США). После фильтрации по качеству было выбрано 1,840 примеров для обучающего набора данных. Обучение моделей 0.8B и 2B заняло 12 и 18 минут на A10G (0.75 долларов США за обе). Модель 0.8B также поставляется как файл GGUF размером 812 МБ для работы на CPU. Проект занял около 11 часов и 24 работы. Общие затраты на вычисления составили около 16 долларов США. 5. Agate-Preview-002-4step — вторая модель. Logolabs' Agate Preview 002 — это текстово-изображенческая модель с 260 миллионами параметров, достаточно маленькая для браузера, но требующая 50 шагов с направлением, что составляет 100 проходов сети на изображение. Я попросил ML-intern уменьшить это до всего 4 проходов! Это заняло два запуска. Первый кэшировал 155,000 обучающих изображений как латенты, встраивал руководство в модель, а затем сокращал количество шагов поэтапно с 16 до 8 и до 4, все на A100. Модель с 4 шагами превзошла модель учителя при тех же 4 шагах по GenEval и FID, после чего ML-intern экспортировал ее в ONNX для браузера. Этот запуск занял около 13 часов и 22 долларов. Я провел второй запуск, попросив ML-Intern немного улучшить модель с 4 шагами. Затем она создала 24,000 дополнительных пар изображений с учителем на 16 шагах и дообучила модель с 4 шагами против них в течение примерно часа. GenEval повысился с 0.509 до 0.536, против 0.563 у учителя при 50 шагах, всего за 4 шага (в одну четверть вычислений). ML-intern повторно экспортировал версию для браузера. Второй запуск занял около 8 часов. Общие затраты на вычисления за оба запуска составили около 37 долларов.

Общие затраты на проекты

| Модель | Базовая модель | Затраты на вычисления | | --- | --- | --- | | Citrus Doctor | Qwen3.5-2B | 1.90 долларов США | | Huggy LoRA | FLUX.2 klein 4B | 7.60 долларов США | | Pocket rewriter (0.8B и 2B) | Qwen3.5-0.8B и 2B | 16.05 долларов США | | Viewpoint Orbit LoRA | Qwen-Image 2.1 | 16 долларов США | | Doodle-in LoRA | Qwen-Image 2.1 | 24.30 долларов США | | Agate 4-step (два запуска) | Agate Preview 002 | 37 долларов США | | Итого | | около 103 долларов США | Эти расходы на GPU и CPU работы были зафиксированы для каждой сессии.

Как начать

ML-intern доступен в HuggingChat. Включите режим ML-intern и вставьте запрос. Если вам нужен отправной пункт, мои примерные запросы доступны для свободного копирования. Начните с модели, которая, по вашему мнению, должна существовать, и набора данных, который у вас есть, или который вы можете описать. Установите небольшой бюджет, запросите базу и дымовой тест, а затем ознакомьтесь с ответами, прежде чем увеличивать лимит. Если вы создадите что-то с его помощью, поделитесь этим в X и отметьте @Gradio и @HuggingFace. Нам было бы интересно увидеть модели, которые вы создаете и которые никто другой не подумал бы построить для вас.

Комментарии (0)

Войдите, чтобы оставлять комментарии.
Пока нет комментариев. Будьте первым!