№ Как нейросеть создаёт видео по описанию
Как нейросеть создаёт видео по текстовому описанию?
- Показывает подряд отдельные изображения, каждое из которых сгенерировано независимо
- Подбирает и склеивает подходящие фрагменты из видеозаписей, на которых обучалась
- Отрисовывает первый кадр, а затем математически определяет траекторию и отображение каждого об… (конец варианта обрезан на фото)
- Строит всю последовательность кадров сразу, согласуя их между собой
Решение
Современные генеративные модели видео (диффузионные модели, в том числе трансформеры) не хранят готовых видеофрагментов и не рисуют кадры независимо.
- Независимые изображения дали бы мерцание: объекты менялись бы от кадра к кадру. Вариант неверен.
- Модель не склеивает куски из обучающих видео, а генерирует новое содержимое. Вариант неверен.
- Покадровое вычисление траекторий по первому кадру — не принцип работы таких моделей. Вариант неверен (конец текста на фото обрезан, но по видимой части он описывает именно такой подход).
- Модель обрабатывает видео как единое целое (пространственно-временной массив данных) и генерирует все кадры сразу, согласуя их между собой по объектам, движению и освещению. Вариант верен.
💡 Почему так
Диффузионная модель видео постепенно убирает шум сразу из всей последовательности кадров, поэтому объекты и движение остаются согласованными по времени.
Ответ
✓ dzmen.ru
Помогло?
