tokens-per-second

Квантование локальных LLM: Q8 даёт запас, а обрыв качества начинается ниже Q4

Сколько качества съедает квантование модели и сколько прибавляет скорости: таблицы потерь по уровням GGUF, замеры llama.cpp и научных работ, где потеря заметна.

34 мин. чтения

Ollama, LM Studio и llama.cpp на одной модели: от 0,3% разницы до трёх раз

Ollama, LM Studio и llama.cpp на одной модели: сколько забирает обёртка, почему чужие замеры расходятся в разы и какие настройки решают больше выбора программы.

33 мин. чтения

DGX Spark, Mac Studio и Strix Halo: 120B держат все три, 70B буксует у двух

Сводим замеры DGX Spark, Mac Studio M3 Ultra и Strix Halo к одной методике: кто тянет 70B и 120B, где ломается длинный промпт и сколько это стоит.

35 мин. чтения

RTX 5090, 4090 и 3090 в локальных LLM: чужие замеры в одной таблице

Три видеокарты под локальные LLM: tok/s на промте и генерации раздельно, паспорт методики каждого замера, реальные ватты и цена одного tok/s на 15 августа 2026.

38 мин. чтения

OpenAI запустила Ultrafast: GPT-5.6 Sol быстрее в 14 раз на чипах Cerebras

OpenAI открыла превью Ultrafast: GPT-5.6 Sol работает до 14 раз быстрее и выдаёт до 750 токенов в секунду. Считают пластины Cerebras, цены пока не названы.

3 мин. чтения

Стартап Tensordyne представил ИИ-ускоритель Napier на логарифмической математике — и обещает обойти Blackwell

Tensordyne анонсировала 3-нм инференс-чип Napier: вместо умножений — сложения по логарифмам. Заявлено до 13× токенов/с против Blackwell, но цифры пока вендорские.

2 мин. чтения