Perplexity Portable Computer: агент считает на вашей RTX, счёт за токены — ноль
Perplexity 25 августа выпустила Portable Computer — ИИ-агента, который работает на DGX Spark или RTX с 24 ГБ VRAM. Локальные шаги не тарифицируются.
Mac Studio M5 Ultra: 512 ГБ единой памяти и кластер из четырёх машин по Thunderbolt 5
Apple 25 августа представила Mac Studio на M5 Max и M5 Ultra: до 512 ГБ единой памяти, 1,2 ТБ/с, объединение в кластер по Thunderbolt 5 с RDMA. Цены от $2499.
Xiaomi AI Cube: три чипа Xring и до 160 ГБ памяти под локальную модель на 120B
24 августа 2026 года Xiaomi показала инженерный образец AI Cube на чипах Xring O3, O100 и D100: до 160 ГБ единой памяти, 150 Вт и модель на 120B локально.
Квантование локальных LLM: Q8 даёт запас, а обрыв качества начинается ниже Q4
Сколько качества съедает квантование модели и сколько прибавляет скорости: таблицы потерь по уровням GGUF, замеры llama.cpp и научных работ, где потеря заметна.
Видеопамять под LLM: 10 моделей, 5 квантов и формула для KV-кэша
Сколько видеопамяти нужно под модель: таблица по 10 моделям и 5 квантам, реальные размеры GGUF, расчёт KV-кэша по длине контекста и что делать, когда не влезает.
Ollama, LM Studio и llama.cpp на одной модели: от 0,3% разницы до трёх раз
Ollama, LM Studio и llama.cpp на одной модели: сколько забирает обёртка, почему чужие замеры расходятся в разы и какие настройки решают больше выбора программы.
DGX Spark, Mac Studio и Strix Halo: 120B держат все три, 70B буксует у двух
Сводим замеры DGX Spark, Mac Studio M3 Ultra и Strix Halo к одной методике: кто тянет 70B и 120B, где ломается длинный промпт и сколько это стоит.
RTX 5090, 4090 и 3090 в локальных LLM: чужие замеры в одной таблице
Три видеокарты под локальные LLM: tok/s на промте и генерации раздельно, паспорт методики каждого замера, реальные ватты и цена одного tok/s на 15 августа 2026.
