benchmarks

DGX Spark, Mac Studio и Strix Halo: 120B держат все три, 70B буксует у двух

Сводим замеры DGX Spark, Mac Studio M3 Ultra и Strix Halo к одной методике: кто тянет 70B и 120B, где ломается длинный промпт и сколько это стоит.

35 мин. чтения

RTX 5090, 4090 и 3090 в локальных LLM: чужие замеры в одной таблице

Три видеокарты под локальные LLM: tok/s на промте и генерации раздельно, паспорт методики каждого замера, реальные ватты и цена одного tok/s на 15 августа 2026.

38 мин. чтения

Grok 4.6 набрал 61 балл вровень с GPT-5.6 Sol — по цене $2 за миллион токенов

SpaceXAI выпустила Grok 4.6: 61 балл в рейтинге Artificial Analysis, вдвое меньше шагов на агентских задачах и прежняя цена $2 и $6 за млн токенов.

3 мин. чтения

Nvidia RTX Spark N1X обошёл Ryzen AI Max+ 395 в многопотоке Geekbench

В базе Geekbench 7 нашли две системы на ARM-чипе Nvidia RTX Spark N1X. Что показали 18- и 20-ядерная версии и что эти баллы значат для локального запуска ИИ.

3 мин. чтения

Qwen 3.8-Max: чем больше усилия, тем хуже результат — и почему баллы не равны счёту

Независимый прогон VulcanBench: Qwen 3.8-Max берёт 81,2% задач на низком усилии и 55,1% на заводской настройке. Провалы — не ошибки, а незаконченные прогоны.

3 мин. чтения

DeepSeek выложила V4 Flash под MIT: модель не выросла, но обошла собственную старшую Pro на агентских тестах

DeepSeek 31 июля выпустила финальную V4 Flash 0731: веса под MIT, 284 млрд параметров, контекст 1 млн токенов и цена втрое ниже медианы по классу.

3 мин. чтения

DeepSeek V4 Flash 0731: модель не выросла, а обошла старшую Pro

Обзор DeepSeek V4 Flash 0731: что реально изменилось, цены API, честный разбор бенчмарков и требования к железу, если запускать веса у себя.

20 мин. чтения

OpenAI назвала следующее семейство моделей Astra и выложила решения десяти открытых задач с доказательствами в Lean

OpenAI 1 августа опубликовала решения десяти нерешённых математических задач от внутренней версии Astra. Каждое доказательство формализовано в Lean.

3 мин. чтения