benchmarks

Moonshot выпустила Kimi K3 на 2,8 трлн параметров — и снова напугала рынок чипов

Moonshot AI выпустила Kimi K3 — крупнейшую открытую модель (2,8 трлн параметров). Она возглавила Frontend Code Arena и оживила споры об экономике ИИ-стройки.

2 мин. чтения

Sol, Terra и Luna: чем на самом деле различаются три уровня GPT-5.6 и где Sol оказывается переплатой

Разбор трёх уровней GPT-5.6: общие спеки, цены за токены, порог 272K, независимые бенчмарки и честный ответ, когда Terra и Luna хватает вместо Sol.

17 мин. чтения

DeepSeek V4 Pro и DSpark: что это на самом деле, сколько стоит и можно ли запустить дома

Разбираем DeepSeek V4 Pro и ускоритель DSpark: что это за модель, цены API, бенчмарки вендора против аудита NIST и реально ли запустить локально.

16 мин. чтения

Mistral открыла Leanstral 1.5: 100% на формальной математике и 5 найденных багов

Mistral выпустила open-source модель Leanstral 1.5 (Apache 2.0) для формальной верификации в Lean 4: 100% на miniF2F и 5 ранее неизвестных багов в 57 репозиториях.

2 мин. чтения

Claude Sonnet 5: возможности уровня Opus за цену Sonnet

30 июня Anthropic выпустила Claude Sonnet 5 — самую агентную модель линейки. Окно 1 млн токенов, стартовая цена $2/$10 за миллион токенов до 31 августа.

3 мин. чтения

Unlimited-OCR от Baidu: компактная открытая модель для распознавания текста

Baidu открыла Unlimited-OCR — модель на 3 млрд параметров для распознавания текста и парсинга PDF под лицензией MIT. Уже 45 тыс. загрузок на Hugging Face.

2 мин. чтения

Зачем Alibaba научила Qwen не действовать, а предсказывать среду

Alibaba открыла Qwen-AgentWorld — модель, которая предсказывает реакцию среды для ИИ-агентов. Версия 397B обошла GPT-5.4 в общем зачёте бенчмарка.

2 мин. чтения

Weibo выпустила VibeThinker-3B — крошечную ризонинг-модель, спорящую с системами в сотни раз больше

WeiboAI выложила VibeThinker-3B под MIT в середине июня 2026: всего 3 млрд параметров, но на матбенчмарках спорит с моделями в сотни раз крупнее. Коротко о модели.

2 мин. чтения