benchmarks

Moonshot випустила Kimi K3 на 2,8 трлн параметрів — і знову налякала ринок чипів

Moonshot AI випустила Kimi K3 — найбільшу відкриту модель (2,8 трлн параметрів). Вона очолила Frontend Code Arena й пожвавила суперечки про економіку ШІ-будівництва.

2 хв. читання

Sol, Terra і Luna: чим насправді різняться три рівні GPT-5.6 і де Sol стає переплатою

Розбір трьох рівнів GPT-5.6: спільні характеристики, ціни за токени, поріг 272K, незалежні бенчмарки та чесна відповідь, коли досить Terra чи Luna.

17 хв. читання

DeepSeek V4 Pro і DSpark: що це насправді, скільки коштує й чи можна запустити вдома

Розбираємо DeepSeek V4 Pro та прискорювач DSpark: що це за модель, ціни API, бенчмарки вендора проти аудиту NIST і чи реально запустити локально.

16 хв. читання

Mistral відкрила Leanstral 1.5: 100% на формальній математиці та 5 знайдених багів

Mistral випустила open-source модель Leanstral 1.5 (Apache 2.0) для формальної верифікації в Lean 4: 100% на miniF2F і 5 раніше невідомих багів у 57 репозиторіях.

2 хв. читання

Claude Sonnet 5: можливості рівня Opus за ціною Sonnet

30 червня Anthropic випустила Claude Sonnet 5 — найагентнішу модель лінійки. Вікно 1 млн токенів, стартова ціна $2/$10 за мільйон токенів до 31 серпня.

3 хв. читання

Unlimited-OCR від Baidu: компактна відкрита модель для розпізнавання тексту

Baidu відкрила Unlimited-OCR — модель на 3 млрд параметрів для розпізнавання тексту й парсингу PDF під ліцензією MIT. Уже 45 тис. завантажень на Hugging Face.

2 хв. читання

Навіщо Alibaba навчила Qwen не діяти, а передбачати середовище

Alibaba відкрила Qwen-AgentWorld — модель, що передбачає реакцію середовища для ШІ-агентів. Версія 397B обійшла GPT-5.4 у загальному заліку бенчмарку.

2 хв. читання

Weibo випустила VibeThinker-3B — крихітну ризонінг-модель, що сперечається із системами в сотні разів більшими

WeiboAI виклала VibeThinker-3B під MIT у середині червня 2026: лише 3 млрд параметрів, та на матбенчмарках сперечається з моделями в сотні разів більшими.

2 хв. читання