benchmarks

Claude Fable 5.1 подешевела на бумаге — и подорожала на 20% за задачу

Обзор Claude Fable 5.1: реальная цена с учётом кэша, вендорские и независимые бенчмарки, три ломающих изменения API, доступ по тарифам Claude и кому модель не нужна.

27 мин. чтения

Anthropic: Claude в роли автоисследователя закрыл 10 типов сбоев выравнивания

Anthropic опубликовала работу об автоматическом исследователе выравнивания: Claude сам нашёл методы против всех десяти типов сбоев и обошёл людей на обмане.

3 мин. чтения

DeepSeek V4-Flash-Vision-Exp обходит Opus 4.8 на двух тестах, но весов нет

DeepSeek выпустил экспериментальную мультимодальную модель V4-Flash-Vision-Exp: цена как у V4-Flash, но весов в открытом доступе пока нет — только API.

3 мин. чтения

GLM-5.3 нашла 1097 критических багов — Z.ai придержала веса на две недели

GLM-5.3 от Z.ai набрала 60 баллов Artificial Analysis и делит первое место среди открытых моделей. Открытые веса задержаны из-за киберспособностей.

3 мин. чтения

Квантование локальных LLM: Q8 даёт запас, а обрыв качества начинается ниже Q4

Сколько качества съедает квантование модели и сколько прибавляет скорости: таблицы потерь по уровням GGUF, замеры llama.cpp и научных работ, где потеря заметна.

34 мин. чтения

Ollama, LM Studio и llama.cpp на одной модели: от 0,3% разницы до трёх раз

Ollama, LM Studio и llama.cpp на одной модели: сколько забирает обёртка, почему чужие замеры расходятся в разы и какие настройки решают больше выбора программы.

33 мин. чтения

DGX Spark, Mac Studio и Strix Halo: 120B держат все три, 70B буксует у двух

Сводим замеры DGX Spark, Mac Studio M3 Ultra и Strix Halo к одной методике: кто тянет 70B и 120B, где ломается длинный промпт и сколько это стоит.

35 мин. чтения

RTX 5090, 4090 и 3090 в локальных LLM: чужие замеры в одной таблице

Три видеокарты под локальные LLM: tok/s на промте и генерации раздельно, паспорт методики каждого замера, реальные ватты и цена одного tok/s на 15 августа 2026.

38 мин. чтения