Що сталося
21 серпня 2026 року DeepSeek відкрив доступ до DeepSeek-V4-Flash-Vision-Exp — експериментальної версії моделі V4-Flash, яка додатково приймає зображення. Текстові здібності базової моделі збережено повністю, зверху додано розуміння картинок. Компанія заявляє, що на мультимодальних агентських тестах модель впритул підійшла до Opus 4.8 від Anthropic. Працює вона поки що лише через API: ваг у відкритому доступі немає.
Деталі
Як виглядають заявлені результати:Тест V4-Flash-Vision-Exp V4-Flash Opus 4.8 Terminal Bench 2.1 83,9 82,7 85,0 ApexBench 36,5 — 39,4
На двох візуальних наборах — Agents’ Last Exam та ZeroBench — нова модель Opus 4.8 обходить. Ідеться про власні заміри DeepSeek, незалежних перевірок поки немає.
Технічні рамки: до 600 зображень на один запит, максимальна сторона 8 192 пікселі (4 096, якщо картинок 15 і більше), формати JPEG, PNG, GIF та WebP. Одна картинка витрачає не більше 384 токенів незалежно від роздільності, а передавати зображення можна лише в повідомленнях користувача.
Ціна не змінилася відносно текстової версії: $0,44 за мільйон вхідних токенів повз кеш і $1,32 за мільйон вихідних у години пікового навантаження, поза піком удвічі дешевше — $0,22 і $0,66 (тарифи на 22 серпня 2026 року). Влучання в кеш коштує $0,014 за мільйон у непікові години. Модель доступна і через OpenRouter, разом із релізом вийшов DeepSeek Harness 0.1.1 з її нативною підтримкою.
Що це означає
Стосується це тих, хто будує агентів на скриншотах і документах: розбір інтерфейсу, витягування тексту з картинки, читання схем. Можливість тут вимірюється не балами, а тарифом — зір додали, а ціна лишилася рівно та сама, що й у текстової V4-Flash, за відставання від Opus 4.8 на 1,1 бала на Terminal Bench 2.1. Головне обмеження пряме: експериментальний статус означає, що інтерфейс і поведінка можуть змінитися без попередження, а відсутність ваг позбавляє змоги підняти модель у себе. У попередніх V4-Flash та V4-Pro ваги опубліковано на Hugging Face за ліцензією MIT, тож питання, найпевніше, у часі, а не в принципі. Горизонт для тих, кому потрібна локальна мультимодальність: зараз її закривають відкриті vision-моделі на кшталт LLaVA та Qwen2.5-VL, а не ця новинка.
Контекст
Це другий за літо крок DeepSeek у бік дешевих агентських моделей: липнева збірка V4-Flash 0731 уже показала, що молодша модель може обходити старшу Pro на агентських завданнях. Vision-версія продовжує ту саму лінію — нарощувати можливості без зростання ціни за токен.


