Odyssey-3 вышла в открытое превью: сцена по тексту, по которой можно ходить

3 мин. чтения

Что произошло

8 октября 2026 года калифорнийский стартап Odyssey открыл публичное исследовательское превью Odyssey-3 — генеративной «модели мира» (world model). Так называют нейросеть, которая не пишет текст, а предсказывает, как изменится сцена в следующий момент: куда покатится предмет, что увидит камера после поворота. Odyssey-3 по текстовому запросу создаёт окружение и дорисовывает его в реальном времени, пока вы по нему ходите. Попробовать можно в браузере бесплатно — это компания подтвердила в анонсе в X.

Детали

  • Версии. Базовая Odyssey-3 выдаёт картинку 832×480, Odyssey-3 Pro — 1280×720. В превью работает Odyssey-3 Flash: облегчённая модель с малым числом шагов генерации, за счёт которой и получается реальное время.
  • Размер. По данным The Decoder, у базовой модели 14 млрд параметров. На странице анонса Odyssey это число не приводит, как и частоту кадров с задержкой.
  • Управление. Вид от первого и третьего лица плюс свободная камера; по ходу генерации можно вызывать события и смотреть, как модель на них реагирует.
  • Бенчмарки — по заявлению компании. На Physics-IQ Verified (тест Anates Labs и DeepMind: модель продолжает видео реальных физических опытов, ответ сверяют с тем, что произошло на самом деле) Odyssey-3 Pro набрала 66,1 в режиме video-to-video. Это результат с отбором лучшего из восьми роликов за один прогон; в среднем по четырём прогонам без отбора — 63,4. The Decoder напоминает, что для заявки на рекорд правила требуют четыре прогона со стандартным отклонением. В WorldMark модель первая в трёх категориях из четырёх, но этот замер Odyssey провела сама.
  • Роботы и игры. По словам компании, на базе Odyssey-3 обучили управление роборукой (десятки часов демонстраций), гуманоидами партнёра Flexion и автомобилем на дорогах Индии (20 часов данных). Политика, обученная примерно на двух часах записей GTA V, показала перенос навыков и в другие игры. Независимых проверок пока нет.
  • Доступ. Открытых весов в анонсе нет, API разработчикам дают по заявке. Нужна ли регистрация и есть ли лимит сессии, Odyssey не уточняет.

Что это значит

Касается прежде всего разработчиков игр и симуляторов, команд робототехники и любопытных: посмотреть, как нейросеть удерживает физику сцены, можно за несколько минут и без затрат. Главная заявка Odyssey — новому устройству хватает десятков часов данных вместо огромного датасета под каждую задачу. Если это подтвердят независимые замеры, обучение роботов заметно подешевеет.

Оговорки весомые. Цифры вендорские, рекорд 66,1 получен с отбором одного ролика из восьми, а базовое разрешение — 480p: это демонстрация, а не инструмент для продакшена. Горизонт для любопытных — сегодня, превью уже открыто. Для бизнеса — когда появятся сторонние тесты и условия API.

Контекст

Гонка моделей мира ускоряется: Google DeepMind развивает похожий подход в Genie 3. В сентябре мы писали про Atlas от World Labs — модель, которая строит 3D-сцены по нескольким фото. А Qwen-AgentWorld от Alibaba предсказывает не картинку, а ответы терминала и браузера для ИИ-агентов.

Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.