Что произошло
8 октября 2026 года калифорнийский стартап Odyssey открыл публичное исследовательское превью Odyssey-3 — генеративной «модели мира» (world model). Так называют нейросеть, которая не пишет текст, а предсказывает, как изменится сцена в следующий момент: куда покатится предмет, что увидит камера после поворота. Odyssey-3 по текстовому запросу создаёт окружение и дорисовывает его в реальном времени, пока вы по нему ходите. Попробовать можно в браузере бесплатно — это компания подтвердила в анонсе в X.
Детали
- Версии. Базовая Odyssey-3 выдаёт картинку 832×480, Odyssey-3 Pro — 1280×720. В превью работает Odyssey-3 Flash: облегчённая модель с малым числом шагов генерации, за счёт которой и получается реальное время.
- Размер. По данным The Decoder, у базовой модели 14 млрд параметров. На странице анонса Odyssey это число не приводит, как и частоту кадров с задержкой.
- Управление. Вид от первого и третьего лица плюс свободная камера; по ходу генерации можно вызывать события и смотреть, как модель на них реагирует.
- Бенчмарки — по заявлению компании. На Physics-IQ Verified (тест Anates Labs и DeepMind: модель продолжает видео реальных физических опытов, ответ сверяют с тем, что произошло на самом деле) Odyssey-3 Pro набрала 66,1 в режиме video-to-video. Это результат с отбором лучшего из восьми роликов за один прогон; в среднем по четырём прогонам без отбора — 63,4. The Decoder напоминает, что для заявки на рекорд правила требуют четыре прогона со стандартным отклонением. В WorldMark модель первая в трёх категориях из четырёх, но этот замер Odyssey провела сама.
- Роботы и игры. По словам компании, на базе Odyssey-3 обучили управление роборукой (десятки часов демонстраций), гуманоидами партнёра Flexion и автомобилем на дорогах Индии (20 часов данных). Политика, обученная примерно на двух часах записей GTA V, показала перенос навыков и в другие игры. Независимых проверок пока нет.
- Доступ. Открытых весов в анонсе нет, API разработчикам дают по заявке. Нужна ли регистрация и есть ли лимит сессии, Odyssey не уточняет.
Что это значит
Касается прежде всего разработчиков игр и симуляторов, команд робототехники и любопытных: посмотреть, как нейросеть удерживает физику сцены, можно за несколько минут и без затрат. Главная заявка Odyssey — новому устройству хватает десятков часов данных вместо огромного датасета под каждую задачу. Если это подтвердят независимые замеры, обучение роботов заметно подешевеет.
Оговорки весомые. Цифры вендорские, рекорд 66,1 получен с отбором одного ролика из восьми, а базовое разрешение — 480p: это демонстрация, а не инструмент для продакшена. Горизонт для любопытных — сегодня, превью уже открыто. Для бизнеса — когда появятся сторонние тесты и условия API.
Контекст
Гонка моделей мира ускоряется: Google DeepMind развивает похожий подход в Genie 3. В сентябре мы писали про Atlas от World Labs — модель, которая строит 3D-сцены по нескольким фото. А Qwen-AgentWorld от Alibaba предсказывает не картинку, а ответы терминала и браузера для ИИ-агентов.
