local-llm

Perplexity Portable Computer: агент працює на вашій RTX, а рахунок за токени — нуль

Perplexity 25 серпня випустила Portable Computer — ШІ-агента, який працює на DGX Spark або RTX із 24 ГБ відеопам'яті. Локальні кроки не тарифікуються.

3 хв. читання

Mac Studio M5 Ultra: 512 ГБ пам’яті та кластер із чотирьох машин по Thunderbolt 5

Apple 25 серпня представила Mac Studio на M5 Max і M5 Ultra: до 512 ГБ єдиної пам'яті, 1,2 ТБ/с, обʼєднання в кластер по Thunderbolt 5. Ціни від $2499.

3 хв. читання

Xiaomi AI Cube: три чипи Xring і до 160 ГБ пам’яті під локальну модель на 120B

24 серпня 2026 року Xiaomi показала інженерний зразок AI Cube на чипах Xring O3, O100 і D100: до 160 ГБ єдиної пам'яті, 150 Вт і модель на 120B локально.

3 хв. читання

Квантизація локальних LLM: Q8 дає запас, а обрив якості починається нижче Q4

Скільки якості з'їдає квантизація моделі та скільки додає швидкості: таблиці втрат за рівнями GGUF, заміри llama.cpp і наукових робіт, де втрата помітна.

34 хв. читання

Відеопам’ять під LLM: 10 моделей, 5 квантів і формула для KV-кешу

Скільки відеопам'яті потрібно під модель: таблиця по 10 моделях і 5 квантах, реальні розміри GGUF, розрахунок KV-кешу за контекстом і що робити, коли не влазить.

43 хв. читання

Ollama, LM Studio і llama.cpp на одній моделі: від 0,3% різниці до трьох разів

Ollama, LM Studio і llama.cpp на одній моделі: скільки забирає обгортка, чому чужі заміри розходяться в рази і які налаштування важать більше за вибір програми.

33 хв. читання

DGX Spark, Mac Studio і Strix Halo: 120B тримають усі три, 70B буксує у двох

Зводимо заміри DGX Spark, Mac Studio M3 Ultra і Strix Halo до однієї методики: хто тягне 70B і 120B, де ламається довгий промпт і скільки це коштує.

35 хв. читання

RTX 5090, 4090 і 3090 у локальних LLM: чужі заміри в одній таблиці

Три відеокарти під локальні LLM: tok/s на промті та генерації окремо, паспорт методики кожного заміру, реальні вати і ціна одного tok/s на 15 серпня 2026.

38 хв. читання