Квантование локальных LLM: Q8 даёт запас, а обрыв качества начинается ниже Q4
Сколько качества съедает квантование модели и сколько прибавляет скорости: таблицы потерь по…
Видеопамять под LLM: 10 моделей, 5 квантов и формула для KV-кэша
Сколько видеопамяти нужно под модель: таблица по 10 моделям и 5 квантам,…
Ollama, LM Studio и llama.cpp на одной модели: от 0,3% разницы до трёх раз
Ollama, LM Studio и llama.cpp на одной модели: сколько забирает обёртка, почему…
DGX Spark, Mac Studio и Strix Halo: 120B держат все три, 70B буксует у двух
Сводим замеры DGX Spark, Mac Studio M3 Ultra и Strix Halo к…
RTX 5090, 4090 и 3090 в локальных LLM: чужие замеры в одной таблице
Три видеокарты под локальные LLM: tok/s на промте и генерации раздельно, паспорт…
ROCm против CUDA: где Radeon догнал GeForce, а где потеряете время
Разбираем ROCm vs CUDA по задачам: инференс, дообучение, диффузия. Какие Radeon поддержаны,…
AMD Instinct MI350P: PCIe-ускоритель на 144 ГБ HBM3E и кому он нужен
AMD Instinct MI350P — PCIe-ускоритель со 144 ГБ HBM3E под ИИ. Разбираем…
Почему ИИ-лаборатории арендуют дата-центры, а не строят: новая экономика compute
ИИ-компании всё чаще не строят, а арендуют дата-центры и GPU-мощности. Разбираем, кто…
