Что произошло
21 августа 2026 года DeepSeek открыл доступ к DeepSeek-V4-Flash-Vision-Exp — экспериментальной версии модели V4-Flash, которая дополнительно принимает изображения. Текстовые способности базовой модели сохранены полностью, сверху добавлено понимание картинок. Компания заявляет, что на мультимодальных агентских тестах модель вплотную подошла к Opus 4.8 от Anthropic. Работает она пока только через API: весов в открытом доступе нет.
Детали
Как выглядят заявленные результаты:Тест V4-Flash-Vision-Exp V4-Flash Opus 4.8 Terminal Bench 2.1 83,9 82,7 85,0 ApexBench 36,5 — 39,4
На двух визуальных наборах — Agents’ Last Exam и ZeroBench — новая модель Opus 4.8 обходит. Речь о собственных замерах DeepSeek, независимых проверок пока нет.
Технические рамки: до 600 изображений на один запрос, максимальная сторона 8 192 пикселя (4 096, если картинок 15 и больше), форматы JPEG, PNG, GIF и WebP. Одна картинка расходует не больше 384 токенов независимо от разрешения, а передавать изображения можно только в сообщениях пользователя.
Цена не изменилась относительно текстовой версии: $0,44 за миллион входных токенов мимо кеша и $1,32 за миллион выходных в часы пиковой нагрузки, вне пика вдвое дешевле — $0,22 и $0,66 (тарифы на 22 августа 2026 года). Попадание в кеш стоит $0,014 за миллион в непиковые часы. Модель доступна и через OpenRouter, вместе с релизом вышел DeepSeek Harness 0.1.1 с её нативной поддержкой.
Что это значит
Касается это тех, кто строит агентов на скриншотах и документах: разбор интерфейса, извлечение текста с картинки, чтение схем. Возможность здесь измеряется не баллами, а тарифом — зрение добавили, а цена осталась ровно та же, что у текстовой V4-Flash, при отставании от Opus 4.8 на 1,1 балла на Terminal Bench 2.1. Главное ограничение прямое: экспериментальный статус означает, что интерфейс и поведение могут поменяться без предупреждения, а отсутствие весов лишает возможности поднять модель у себя. У предыдущих V4-Flash и V4-Pro веса опубликованы на Hugging Face по лицензии MIT, так что вопрос, скорее всего, во времени, а не в принципе. Горизонт для тех, кому нужна локальная мультимодальность: сейчас её закрывают открытые vision-модели вроде LLaVA и Qwen2.5-VL, а не эта новинка.
Контекст
Это второй за лето шаг DeepSeek в сторону дешёвых агентских моделей: июльская сборка V4-Flash 0731 уже показала, что младшая модель может обходить старшую Pro на агентских задачах. Vision-версия продолжает ту же линию — наращивать возможности без роста цены за токен.



