Claude Fable 5.1 подешевела на бумаге — и подорожала на 20% за задачу
Обзор Claude Fable 5.1: реальная цена с учётом кэша, вендорские и независимые бенчмарки, три ломающих изменения API, доступ по тарифам Claude и кому модель не нужна.
Anthropic: Claude в роли автоисследователя закрыл 10 типов сбоев выравнивания
Anthropic опубликовала работу об автоматическом исследователе выравнивания: Claude сам нашёл методы против всех десяти типов сбоев и обошёл людей на обмане.
DeepSeek V4-Flash-Vision-Exp обходит Opus 4.8 на двух тестах, но весов нет
DeepSeek выпустил экспериментальную мультимодальную модель V4-Flash-Vision-Exp: цена как у V4-Flash, но весов в открытом доступе пока нет — только API.
GLM-5.3 нашла 1097 критических багов — Z.ai придержала веса на две недели
GLM-5.3 от Z.ai набрала 60 баллов Artificial Analysis и делит первое место среди открытых моделей. Открытые веса задержаны из-за киберспособностей.
Квантование локальных LLM: Q8 даёт запас, а обрыв качества начинается ниже Q4
Сколько качества съедает квантование модели и сколько прибавляет скорости: таблицы потерь по уровням GGUF, замеры llama.cpp и научных работ, где потеря заметна.
Ollama, LM Studio и llama.cpp на одной модели: от 0,3% разницы до трёх раз
Ollama, LM Studio и llama.cpp на одной модели: сколько забирает обёртка, почему чужие замеры расходятся в разы и какие настройки решают больше выбора программы.
DGX Spark, Mac Studio и Strix Halo: 120B держат все три, 70B буксует у двух
Сводим замеры DGX Spark, Mac Studio M3 Ultra и Strix Halo к одной методике: кто тянет 70B и 120B, где ломается длинный промпт и сколько это стоит.
RTX 5090, 4090 и 3090 в локальных LLM: чужие замеры в одной таблице
Три видеокарты под локальные LLM: tok/s на промте и генерации раздельно, паспорт методики каждого замера, реальные ватты и цена одного tok/s на 15 августа 2026.
