Квантование локальных LLM: Q8 даёт запас, а обрыв качества начинается ниже Q4
Сколько качества съедает квантование модели и сколько прибавляет скорости: таблицы потерь по уровням GGUF, замеры llama.cpp и научных работ, где потеря заметна.
Ollama, LM Studio и llama.cpp на одной модели: от 0,3% разницы до трёх раз
Ollama, LM Studio и llama.cpp на одной модели: сколько забирает обёртка, почему чужие замеры расходятся в разы и какие настройки решают больше выбора программы.
DGX Spark, Mac Studio и Strix Halo: 120B держат все три, 70B буксует у двух
Сводим замеры DGX Spark, Mac Studio M3 Ultra и Strix Halo к одной методике: кто тянет 70B и 120B, где ломается длинный промпт и сколько это стоит.
RTX 5090, 4090 и 3090 в локальных LLM: чужие замеры в одной таблице
Три видеокарты под локальные LLM: tok/s на промте и генерации раздельно, паспорт методики каждого замера, реальные ватты и цена одного tok/s на 15 августа 2026.
OpenAI запустила Ultrafast: GPT-5.6 Sol быстрее в 14 раз на чипах Cerebras
OpenAI открыла превью Ultrafast: GPT-5.6 Sol работает до 14 раз быстрее и выдаёт до 750 токенов в секунду. Считают пластины Cerebras, цены пока не названы.
Стартап Tensordyne представил ИИ-ускоритель Napier на логарифмической математике — и обещает обойти Blackwell
Tensordyne анонсировала 3-нм инференс-чип Napier: вместо умножений — сложения по логарифмам. Заявлено до 13× токенов/с против Blackwell, но цифры пока вендорские.