benchmarks

Вчетверо меньше — на один балл слабее: Thinking Machines выложила веса Inkling-Small

Thinking Machines открыла веса Inkling-Small на 276 млрд параметров. Модель отстала от старшей Inkling на один балл индекса, а памяти требует в разы меньше.

3 мин. чтения

Microsoft поставила узкую модель против фронтирных в поиске уязвимостей — и вдвое срезала счёт за вычисления

Microsoft представила MAI-Cyber-1-Flash и платформу Project Perception: 96% на бенчмарке CyberGym и вдвое меньшая стоимость прогона против прежней конфигурации.

3 мин. чтения

Корея выложила в открытый доступ модель на 250 миллиардов параметров, которая считает как модель на 15 миллиардов

22 июля 2026 года Upstage опубликовала Solar Open 2 — открытую модель на 250 млрд параметров с 15 млрд активных и контекстом в миллион токенов.

3 мин. чтения

Solar Open 2 на 250 млрд параметров: работает как маленькая

Обзор Solar Open2 250B от Upstage: гибридная MoE-архитектура, бенчмарки, реальная скорость на DGX Spark, ловушки лицензии и квантования, поддержка языков.

20 мин. чтения

Claude Opus 5 стоит как Opus 4.8 — а в независимом рейтинге обошла даже Fable 5

Claude Opus 5 стоит как Opus 4.8, но обошла Fable 5 в независимом рейтинге. Разбираем цену, контекст, эффорт, бенчмарки и сравнение четырёх моделей Anthropic.

30 мин. чтения

Moonshot выпустила Kimi K3 на 2,8 трлн параметров — и снова напугала рынок чипов

Moonshot AI выпустила Kimi K3 — крупнейшую открытую модель (2,8 трлн параметров). Она возглавила Frontend Code Arena и оживила споры об экономике ИИ-стройки.

2 мин. чтения

GPT-5.6 Sol, Terra и Luna: чем различаются три уровня модели

Разбор трёх уровней GPT-5.6: общие спеки, цены за токены, порог 272K, независимые бенчмарки и честный ответ, когда Terra и Luna хватает вместо Sol.

17 мин. чтения

DeepSeek V4 Pro и DSpark: сколько стоит и можно ли запустить дома

Разбираем DeepSeek V4 Pro и ускоритель DSpark: что это за модель, цены API, бенчмарки вендора против аудита NIST и реально ли запустить локально.

16 мин. чтения