
С 2024 по 2026 год мир видеогенерации претерпел значительные изменения благодаря стремительному развитию нейросетевых технологий. Если в начале 2024 года пользователи могли лишь создавать короткие видеоролики с низкой консистентностью и неестественным движением объектов, то к 2026 году нейросети научились генерировать высококачественные видео, сопоставимые с работами крупных студий. Рассмотрим ключевые этапы этого развития и его влияние на рынок.
2024 год: Начало эры видеогенерации
2024 год стал знаковым для индустрии, когда нейросети начали активно внедряться в процесс создания видео. Основными игроками на рынке стали компании, такие как OpenAI, с их моделью Sora, а также Luma, Runway Gen-2 и Pika 1.0. Эти модели использовали диффузионные технологии, которые позволили генерировать видео, но с рядом ограничений:
Длительность роликов не превышала четырех секунд.
Низкая консистентность персонажей.
Слабая физика объектов и неестественное движение.
Несмотря на эти недостатки, интерес к новым технологиям был огромным. Модель Sora, выпущенная в конце 2024 года, стала прорывной благодаря архитектуре Diffusion Transformer (DiT), что позволило обрабатывать видео как трёхмерные объекты. Это дало возможность создавать видео длиной до 20 секунд с улучшенной физикой и динамикой камеры, хотя и с некоторыми недочётами, такими как путаница между левой и правой сторонами.
2025 год: Увеличение возможностей и контроль над процессом
В 2025 году наблюдался рост конкуренции среди разработчиков. Появление DiT-моделей с открытым кодом позволило компаниям улучшать свои технологии. Основные достижения года включали:
Увеличение длительности видео до 15 секунд в 720p и 1080p.
Возможность добавления визуальных референсов и настройки стиля без необходимости обучения модели.
Улучшение синхронизации губ и физики объектов.
Ключевым нововведением стало внедрение модели Kling Motion Control 2.6, которая позволяла загружать статичные изображения и видео-референсы для точного воспроизведения движений персонажей. Это привело к резкому росту спроса на видеокарты, так как обучение моделей требовало значительных вычислительных ресурсов. Разработчики начали оптимизировать свои модели, создавая Turbo-версии, которые обеспечивали более быструю и дешевую генерацию видео.
2026 год: Мультимодальность и гибкое редактирование
К 2026 году нейросети достигли новых высот в создании видео. Теперь они могли генерировать мультфильмы и короткометражные фильмы, сопоставимые с работами Disney, используя всего одно изображение и хорошо продуманный промпт. В этом году основными задачами стали:
Снижение порога входа для пользователей.
Интеграция нейросетей в цифровые продукты и социальные сети.
Увеличение контроля над процессом генерации.
На конференции в Пекине 23 июня 2026 года компания ByteDance анонсировала модель Seedance 2.5, которая могла использовать до 50 комбинированных изображений, видео и аудио для более точной координации персонажей и локаций. Разработчики LumaLabs выпустили модель Ray 3.2, способную фиксировать мимику до восьми человек в одном кадре. Также появилась возможность генерировать видео в 16-битном HDR, что значительно улучшило цветопередачу.
Проблемы и вызовы
Несмотря на достижения, современные видеомодели всё ещё сталкиваются с рядом проблем. По данным T2VPhysBench, многие модели не достигают даже 0.60 баллов из 1.0 по точности соблюдения физических законов. Основные проблемы включают:
Нарушение причинно-следственной связи, когда действия происходят в неправильной последовательности.
Искажение постоянства объектов из-за окклюзии.
Эффект неуместного успеха, когда модели исправляют неудачные действия.
Будущее видеогенерации
Рынок видеогенерации продолжает развиваться. Ассоциации голливудских актёров выражают опасения по поводу авторских прав, в то время как в Китае рассматривают AI как способ снижения затрат на производство контента. В ближайшие годы можно ожидать дальнейшего улучшения моделей, увеличения их доступности и интеграции в рабочие процессы. Прогресс в этой области может привести к созданию автономных AI-агентов, способных самостоятельно выполнять задачи от идеи до реализации.
Комментарии (0)