
В мире искусственного интеллекта произошел значимый прорыв: компания Moonshot AI представила свою новую мультимодальную модель Kimi K3, обладающую колоссальными 2,8 трлн параметров. Эта модель не только демонстрирует впечатляющие результаты в тестах, но и привносит инновационные подходы в архитектуру и обучение. Давайте подробнее рассмотрим, что стоит за этим релизом.
Спецификация Kimi K3
Модель Kimi K3 обладает следующими характеристиками:
Всего параметров: 2,78 трлн
Активных параметров: 104,2 млрд
Слоёв: 93
Слои внимания: 69 KDA + 24 Gated MLA
Размер скрытого состояния: 7 168
Голов внимания: 96
Маршрутизируемых экспертов: 896
Активных экспертов на токен: 16
Контекст: 1 048 576 токенов
Эти параметры подтверждены конфигурацией на платформе Hugging Face, где веса модели разбиты на 96 файлов safetensors общим объёмом около 1,56 ТБ. Однако стоит отметить, что доступ к модели может требовать отдельного соглашения для крупных поставщиков услуг.
Архитектура Kimi K3
Moonshot описывает K3 как систему, которая смешивает информацию по трем осям: последовательности, глубине и каналам. Это деление позволяет более точно масштабировать каждое направление с помощью отдельных механизмов.
Последовательность
Архитектура K3 включает три Kimi Delta Attention (KDA) на один глобальный Gated MLA. KDA представляет собой рекуррентный вариант линейного внимания, который поддерживает фиксированное состояние и обновляет его по дельта-правилу. Это позволяет избежать проблем с растущими кешами и улучшает производительность.
Глубина
Для повышения глубины модели используется Attention Residuals, который заменяет фиксированное суммирование вниманием по выходам предыдущих слоёв. Это позволяет каждому слою выбирать, какое представление ему нужно, что значительно снижает объем живых состояний и межстадийной передачи.
Каналы
LatentMoE (разреженная модель) сначала сжимает маршрутизируемую ветвь до ширины 3 584, что позволяет эффективно использовать ресурсы и избегать перегрузок. Moonshot внедрила метод квантильной балансировки для распределения нагрузки между экспертами, что улучшает производительность.
Мультимодальность и обучение
Модель MoonViT-V2, зрительный энкодер K3, обучался с нуля вместе с языковой моделью. Это позволяет K3 эффективно обрабатывать как текстовые, так и визуальные данные. В процессе обучения контекст расширялся поэтапно, что обеспечивало более качественное усвоение дальних зависимостей.
Дообучение и специализированные политики
После начального обучения K3 прошла через несколько этапов дообучения с использованием подкрепляющего обучения. Это позволило создать девять специализированных политик, охватывающих различные задачи, от разработки ПО до глубокого поиска.
Инфраструктура и эксплуатация
Для эффективного обучения K3 использовались конвейерный, экспертный, тензорный и контекстный параллелизм. Однако самостоятельное развёртывание модели потребует значительных вычислительных ресурсов, включая суперузел с 64 и более ускорителями.
Поиск уязвимостей
Moonshot также провела исследование по кибербезопасности, выявив множество уязвимостей в актуальном коде. Однако детали поиска и подтверждения этих уязвимостей остаются недостаточно прозрачными.
Заключение
Kimi K3 представляет собой значительный шаг вперёд в области мультимодальных моделей. Несмотря на впечатляющие характеристики и результаты, некоторые аспекты, такие как воспроизводимость и прозрачность данных, требуют дальнейшего изучения. Moonshot открывает новые горизонты в AI, но остается много вопросов, на которые необходимо ответить.
Комментарии (0)