benchmarks

RTX 5090, 4090 і 3090 у локальних LLM: чужі заміри в одній таблиці

Три відеокарти під локальні LLM: tok/s на промті та генерації окремо, паспорт методики кожного заміру, реальні вати і ціна одного tok/s на 15 серпня 2026.

38 хв. читання

Grok 4.6 набрав 61 бал урівень з GPT-5.6 Sol — за ціною $2 за мільйон токенів

SpaceXAI випустила Grok 4.6: 61 бал у рейтингу Artificial Analysis, удвічі менше кроків на агентських задачах і колишня ціна $2 і $6 за млн токенів.

3 хв. читання

Nvidia RTX Spark N1X обійшов Ryzen AI Max+ 395 у багатопотоці Geekbench

У базі Geekbench 7 знайшли дві системи на ARM-чипі Nvidia RTX Spark N1X. Що показали 18- і 20-ядерна версії та що ці бали означають для локального ШІ.

3 хв. читання

Qwen 3.8-Max: більше зусиль — гірший результат, а бали не дорівнюють рахунку

Незалежний прогін VulcanBench: Qwen 3.8-Max бере 81,2% завдань на низькому зусиллі і 55,1% на заводському налаштуванні. Провали — не помилки, а незакінчені прогони.

3 хв. читання

DeepSeek виклала V4 Flash під MIT: модель не виросла, але обійшла власну старшу Pro на агентських тестах

DeepSeek 31 липня випустила фінальну V4 Flash 0731: ваги під MIT, 284 млрд параметрів, контекст 1 млн токенів і ціна втричі нижча за медіану по класу.

3 хв. читання

DeepSeek V4 Flash 0731: модель не виросла, а обійшла старшу Pro

Огляд DeepSeek V4 Flash 0731: що реально змінилося, ціни API, чесний розбір бенчмарків і вимоги до заліза, якщо запускати ваги в себе.

20 хв. читання

OpenAI назвала наступне сімейство моделей Astra і виклала розвʼязання десяти відкритих математичних задач із доведеннями в Lean

OpenAI 1 серпня опублікувала розвʼязання десяти нерозвʼязаних математичних задач від внутрішньої версії Astra. Кожне доведення формалізовано в Lean.

3 хв. читання

Вчетверо менша — на один бал слабша: Thinking Machines виклала ваги Inkling-Small

Thinking Machines відкрила ваги Inkling-Small на 276 млрд параметрів. Модель відстала від старшої Inkling на один бал індексу, а памʼяті потребує значно менше.

3 хв. читання