World Labs представила Atlas — 3D-сцены из нескольких фото, но без статьи и цены

2 мин. чтения
BYBIT · СПОТ И ФЬЮЧЕРСЫ
Крипта с нуля
Комиссия 0,1%, торги 24/7, старт с $10
Открыть счёт

Что произошло

1 сентября 2026 года World Labs — стартап, сооснованный исследовательницей Фей-Фей Ли, — представила Atlas. Это одна модель, которая по нескольким обычным фотографиям и генерирует новую сцену, и восстанавливает её геометрию, и позволяет двигать по ней камеру. Обычно под каждую из трёх задач берут отдельный инструмент. Atlas выдаёт видео длиной до одной минуты в разрешении 1440p и умеет собирать 360-градусные панорамы.

Детали

По описанию компании, Atlas — мультимодальный авторегрессионный диффузионный трансформер, обученный с нуля работать сразу с текстом, изображениями, видео, положениями камеры и картами глубины, а не склеенный из отдельных моделей.

На восстановлении трёхмерной геометрии World Labs приводит среднюю ошибку AbsRel 25,3 против 28,7 у лучшего из специализированных конкурентов; на наборе ETH3D разрыв больше — 9,3 против 18,7. В слепом сравнении генерации с управлением камерой люди выбирали Atlas в 75% случаев против MiniMax H3, в 81% против Gemini Omni Flash и в 93% против FLUX 3.

Чего в анонсе нет: технической статьи, цены и списка партнёров. Модель находится в раннем доступе «с отдельными партнёрами», записаться можно только через форму заявки.

Что это значит

Практический смысл сейчас касается узкой аудитории — команд, которые делают симуляции для робототехники, 3D-контент для игр и кино, виртуальные туры по недвижимости. Для них ценна не картинка, а геометрия: если из десятка фото объекта получается сцена, по которой можно свободно ездить камерой, отпадает этап ручного моделирования. Цифра, на которую стоит смотреть скептически, — те самые 75–93% предпочтений: это внутреннее сравнение самой World Labs, без опубликованной методики и без независимой проверки.

Горизонт неопределённый ровно потому, что нет ни цены, ни открытого доступа. Пока модель раздают по заявкам, посчитать себестоимость минуты 1440p и сравнить её с текущими генераторами видео невозможно — а без этого числа выбирать инструмент под задачу не из чего.

Контекст

Похожий подход мы разбирали в новости про модель мира Qwen AgentWorld от Alibaba. Сколько на практике стоит получить один удачный ролик из фотографии и что при этом ломается в кадре — в материале про видео из фото нейросетью.

Bybit
$30,100 + $5,030
100 USDT в подарок
Получить →
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.