tokens-per-second

Квантизація локальних LLM: Q8 дає запас, а обрив якості починається нижче Q4

Скільки якості з'їдає квантизація моделі та скільки додає швидкості: таблиці втрат за рівнями GGUF, заміри llama.cpp і наукових робіт, де втрата помітна.

34 хв. читання

Ollama, LM Studio і llama.cpp на одній моделі: від 0,3% різниці до трьох разів

Ollama, LM Studio і llama.cpp на одній моделі: скільки забирає обгортка, чому чужі заміри розходяться в рази і які налаштування важать більше за вибір програми.

33 хв. читання

DGX Spark, Mac Studio і Strix Halo: 120B тримають усі три, 70B буксує у двох

Зводимо заміри DGX Spark, Mac Studio M3 Ultra і Strix Halo до однієї методики: хто тягне 70B і 120B, де ламається довгий промпт і скільки це коштує.

35 хв. читання

RTX 5090, 4090 і 3090 у локальних LLM: чужі заміри в одній таблиці

Три відеокарти під локальні LLM: tok/s на промті та генерації окремо, паспорт методики кожного заміру, реальні вати і ціна одного tok/s на 15 серпня 2026.

38 хв. читання

OpenAI запустила Ultrafast: GPT-5.6 Sol швидша в 14 разів на чипах Cerebras

OpenAI відкрила прев'ю Ultrafast: GPT-5.6 Sol працює до 14 разів швидше й видає до 750 токенів на секунду. Обчислюють пластини Cerebras, ціни поки не названі.

3 хв. читання

Стартап Tensordyne представив ШІ-прискорювач Napier на логарифмічній математиці — й обіцяє обійти Blackwell

Tensordyne анонсувала 3-нм інференс-чип Napier: замість множень — додавання за логарифмами. Заявлено до 13× токенів/с проти Blackwell, але цифри поки вендорські.

2 хв. читання