Исследователи из нескольких университетов совместно с Microsoft Research представили Mirage — модель генерации видео, которая поддерживает пространственную целостность сцены без затратного промежуточного этапа через пиксельную память. По словам авторов, это ускоряет генерацию и помогает сохранять стабильную геометрию даже при длинных движениях камеры.
Видео-модели такого типа строят правдоподобные движущиеся сцены по стартовому кадру и траектории камеры. Их можно использовать для симуляций и виртуальных сред. Проблема в том, что без памяти даже сильные генераторы со временем теряют представление о пространстве: при возврате камеры уже пройденные части сцены могут выглядеть иначе, объекты смещаются, а текстуры меняются.
В системах вроде Voyager, WonderWorld и Spatia для этого применяют 3D-облако точек с цветовой информацией. На каждом шаге генерации такую структуру нужно визуализировать, а затем снова переводить результат во внутреннее представление модели. В работе Microsoft этот подход назван «двойным узким местом»: он требует много вычислений, а часть данных теряется при каждом проходе через пиксельное представление.
Mirage решает задачу иначе. Вместо хранения видимых цветных точек модель сохраняет внутренние признаки изображения, которые уже использует диффузионная сеть. Каждый такой признак получает координаты в 3D-пространстве и становится элементом пространственной памяти.
При генерации нового ракурса модель сразу проецирует это хранилище на целевую камеру и передаёт результат генератору. Этап с рендерингом облака точек и повторным кодированием пропускается. Авторы пишут, что это также заметно снижает расход памяти, поскольку данные хранятся во внутреннем компактном разрешении модели, а не в полном размере изображения.
Mirage строит видео по сегментам и сначала заполняет пространственную память данными из стартового кадра. Для каждого следующего сегмента система извлекает нужные данные из памяти, создаёт новые кадры, а затем записывает их содержимое обратно. По мере работы объём памяти растёт.
Чтобы в долговременную память не попадали нестабильные элементы, перед записью система удаляет движущиеся объекты и небо. Так в памяти остаётся в основном устойчивая геометрия сцены. Исследователи взяли за основу открытую видеомодель Alibaba Wan2.2, добавили небольшой модуль для работы с новой памятью и затем дообучили систему с помощью адаптеров LoRA.
На бенчмарке WorldScore Mirage обошла ближайшего конкурента Spatia, который всё ещё использует память в виде цветных точек, и заметно превзошла универсальные видеогенераторы вроде Wan2.1 и CogVideoX. Лучше всего модель показала себя в задачах, где важно сохранять геометрию сцены и постоянство поверхностей на длинной последовательности кадров.
На датасете RealEstate10K в замкнутом тесте, где камера возвращается в начальную точку, Mirage лидировала по двум из трёх метрик. Такой сценарий считается особенно жёсткой проверкой, потому что малейшие ошибки накапливаются по всей траектории.
Главное преимущество Mirage — эффективность. У систем с цветовой памятью затраты быстро растут на длинных проходах, как и требования к видеопамяти. У Mirage вычислительная стоимость на кадр после первого сегмента почти не меняется. Исследователи оценивают выигрыш как до 10,57 раза по скорости генерации и до 55 раз по снижению потребления памяти по сравнению с системами на цветных точках.
Авторы также описали ограничение подхода. На границах сегментов движущиеся объекты отбрасываются, потому что их геометрию нельзя считать стабильной, и фильтр специально исключает такие данные из памяти. Поэтому сцены с большим количеством движения получают меньше пользы от пространственной памяти, чем спокойные интерьеры. Следующим очевидным шагом команда считает хранение динамического контента.
В материале также отмечается, что видео-модели среды сейчас считаются одним из самых активных направлений в ИИ-видео. В отличие от моделей вроде Veo, которые обычно создают отдельные согласованные клипы, такие системы пытаются сделать сцену пригодной для навигации и сохранять её согласованность во времени. В качестве примеров упомянуты Genie 3 от Google DeepMind и Gemini Omni, который Google на I/O представила как модель этого класса и потенциального преемника Veo.
Источник: The Decoder.






















