Как нейросеть создаёт видео по текстовому описанию?
- Показывает подряд отдельные изображения, каждое из которых сгенерировано независимо
- Подбирает и склеивает подходящие фрагменты из видеозаписей, на которых обучалась
- Отрисовывает первый кадр, а затем математически определяет траекторию и отображение каждого объекта
- Строит всю последовательность кадров сразу, согласуя их между собой
Разберём варианты.
-
Если кадры генерировать независимо, объекты будут «прыгать» и меняться от кадра к кадру. Видео получится несвязным. Вариант не подходит.
-
Нейросеть не хранит готовые видеофрагменты и не склеивает их. Она генерирует новое содержимое, изученное при обучении. Вариант не подходит.
-
Нейросеть не рассчитывает траектории объектов по физическим формулам, как в программе-симуляторе. Вариант не подходит.
-
Видеомодели (диффузионные) обрабатывают сразу всю последовательность кадров как единое целое. Кадры согласуются между собой по времени, поэтому объекты ведут себя непрерывно и последовательно. Вариант подходит.
Современные генераторы видео создают кадры не по отдельности, а совместно, учитывая связь между ними во времени. Благодаря этому движение получается плавным и согласованным.
