Квантизація локальних LLM: Q8 дає запас, а обрив якості починається нижче Q4
Скільки якості з'їдає квантизація моделі та скільки додає швидкості: таблиці втрат за…
Відеопам’ять під LLM: 10 моделей, 5 квантів і формула для KV-кешу
Скільки відеопам'яті потрібно під модель: таблиця по 10 моделях і 5 квантах,…
Ollama, LM Studio і llama.cpp на одній моделі: від 0,3% різниці до трьох разів
Ollama, LM Studio і llama.cpp на одній моделі: скільки забирає обгортка, чому…
DGX Spark, Mac Studio і Strix Halo: 120B тримають усі три, 70B буксує у двох
Зводимо заміри DGX Spark, Mac Studio M3 Ultra і Strix Halo до…
RTX 5090, 4090 і 3090 у локальних LLM: чужі заміри в одній таблиці
Три відеокарти під локальні LLM: tok/s на промті та генерації окремо, паспорт…
ROCm проти CUDA: де Radeon наздогнав GeForce, а де втратите час
Розбираємо ROCm vs CUDA за завданнями: інференс, донавчання, дифузія. Які Radeon підтримані,…
AMD Instinct MI350P: PCIe-прискорювач на 144 ГБ HBM3E і кому він потрібен
AMD Instinct MI350P — PCIe-прискорювач зі 144 ГБ HBM3E під ШІ. Розбираємо…
Чому ШІ-лабораторії орендують дата-центри, а не будують: нова економіка compute
ШІ-компанії дедалі частіше не будують, а орендують дата-центри та GPU-потужності. Розбираємо, хто…
