NVIDIA активно использует Palantir Foundry и cuOpt для автоматизации процессов распределения аппаратных ресурсов в своей глобальной цепочке поставок. Компания измеряет эффективность доставки от момента выхода кремниевых пластин до получения первых токенов. Этот процесс делится на два ключевых этапа: время до установки (time-to-rack), которое охватывает период с момента выхода из фабрики до сборки системы в дата-центре, и время до токена (time-to-token), включающее подготовку к работе, охлаждение, сетевую инфраструктуру и готовность программного обеспечения на день запуска.
Управление потоками компонентов NVL72 и Vera Rubin
С увеличением масштабов производства NVIDIA столкнулась с серьезными ограничениями в поставках. Например, в стойке NVIDIA Grace Blackwell содержится 18 вычислительных отсеков, каждый из которых требует два процессора Grace, четыре графических процессора Blackwell и 32 пакета памяти HBM3e, которые поставляются от тысяч поставщиков, производителей оригинального оборудования (OEM) и контрактных проектировщиков. Предстоящая цепочка поставок для архитектуры Vera Rubin будет в два раза больше, чем сеть, поддерживающая Grace Blackwell.
Сборка не может начаться, пока не поступят детали из трех определенных каналов: прямых запасов, консигнационного склада и внешних поставщиков. Ранние отгрузки вынуждены ожидать задержанных компонентов, что увеличивает метрику, которую NVIDIA называет «временем владения» (Time of Ownership) — это период с момента получения материалов на заводе до отправки готовых подсборок.
Еженедельное перераспределение заводских allocations
Каждую неделю перерабатываются заводские allocations с учетом доступности деталей, ограничений по производительности и графиков выполнения заказов клиентов. Для координации этих зависимостей команда NVIDIA создала центр управления «Цифровой интеллектуальной цепочкой поставок» на базе Palantir Foundry. Модели Ontology от Foundry связывают объекты, такие как производственные мощности, обязательства поставщиков, запасы компонентов и производственные цели, в единую взаимосвязанную структуру.
NVIDIA cuOpt, библиотека с открытым исходным кодом для оптимизации решений с использованием GPU, напрямую считывает этот операционный уровень. Формулируя распределение как задачу смешанного целочисленного линейного программирования, направленную на минимизацию времени владения, решатель оценивает ограничения по компонентам на каждом уровне спецификации материалов.
Обучение Nemotron на качественных операционных данных
Однако математическая оптимизация не смогла учесть неструктурированные операционные переменные, которые наблюдали планировщики, такие как транскрипты звонков поставщиков, прогнозы погоды, переписка с партнерами и геополитические события. NVIDIA решила эту проблему, проведя постобучение модели Nemotron 3.5 Lightning, которая представляет собой модель с открытыми весами и 30 миллиардами параметров, из которых около трех миллиардов активны за один проход.
Процесс инженерной подготовки включает в себя обработку исторических данных с помощью NeMo Anonymizer для удаления конфиденциальной информации, NeMo Data Designer для балансировки обучающих примеров с синтетическими сценариями нарушений мощностей и NeMo AutoModel для применения параметров низкоранговой адаптации (LoRA) при сохранении весов базовой модели замороженными. Palantir Autopilot управляет отслеживанием данных, отслеживанием моделей и доставкой рекомендаций.
Производственные показатели и будущее с использованием обучения с подкреплением
Модель Nemotron 3.5 Lightning, прошедшая постобучение, продемонстрировала 86.7% точности решений на основе исторических данных о распределении, что значительно выше, чем 55.5% для более крупной модели Nemotron 3 Ultra и 17.5% для неоткалиброванной базовой модели Lightning. Она также достигла 58.6% сбалансированной точности и 57.5% макро-F1, что также превышает показатели Nemotron 3 Ultra, равные 42% и 39.5% соответственно. Тонкая настройка завершалась на двух графических процессорах NVIDIA B200 за считанные минуты.
Хотя улучшение решений по распределению было достигнуто, прогнозирование производственных рисков на более дальние сроки остается сложной задачей. Операционные решения, пересмотры планировщиков, переопределения и наблюдаемые выходы с заводов постоянно записываются обратно в Ontology Palantir. NVIDIA подтвердила, что этот набор данных будет использоваться для формирования пар предпочтений для рутин обучения с подкреплением — оценка рекомендаций по точности распределения, соблюдению политик и обоснованию доказательств, при этом производственные модели остаются строго изолированными от живого и неконтролируемого переобучения.
Комментарии (0)