local-llm

Perplexity Portable Computer: агент считает на вашей RTX, счёт за токены — ноль

Perplexity 25 августа выпустила Portable Computer — ИИ-агента, который работает на DGX Spark или RTX с 24 ГБ VRAM. Локальные шаги не тарифицируются.

3 мин. чтения

Mac Studio M5 Ultra: 512 ГБ единой памяти и кластер из четырёх машин по Thunderbolt 5

Apple 25 августа представила Mac Studio на M5 Max и M5 Ultra: до 512 ГБ единой памяти, 1,2 ТБ/с, объединение в кластер по Thunderbolt 5 с RDMA. Цены от $2499.

3 мин. чтения

Xiaomi AI Cube: три чипа Xring и до 160 ГБ памяти под локальную модель на 120B

24 августа 2026 года Xiaomi показала инженерный образец AI Cube на чипах Xring O3, O100 и D100: до 160 ГБ единой памяти, 150 Вт и модель на 120B локально.

3 мин. чтения

Квантование локальных LLM: Q8 даёт запас, а обрыв качества начинается ниже Q4

Сколько качества съедает квантование модели и сколько прибавляет скорости: таблицы потерь по уровням GGUF, замеры llama.cpp и научных работ, где потеря заметна.

34 мин. чтения

Видеопамять под LLM: 10 моделей, 5 квантов и формула для KV-кэша

Сколько видеопамяти нужно под модель: таблица по 10 моделям и 5 квантам, реальные размеры GGUF, расчёт KV-кэша по длине контекста и что делать, когда не влезает.

43 мин. чтения

Ollama, LM Studio и llama.cpp на одной модели: от 0,3% разницы до трёх раз

Ollama, LM Studio и llama.cpp на одной модели: сколько забирает обёртка, почему чужие замеры расходятся в разы и какие настройки решают больше выбора программы.

33 мин. чтения

DGX Spark, Mac Studio и Strix Halo: 120B держат все три, 70B буксует у двух

Сводим замеры DGX Spark, Mac Studio M3 Ultra и Strix Halo к одной методике: кто тянет 70B и 120B, где ломается длинный промпт и сколько это стоит.

35 мин. чтения

RTX 5090, 4090 и 3090 в локальных LLM: чужие замеры в одной таблице

Три видеокарты под локальные LLM: tok/s на промте и генерации раздельно, паспорт методики каждого замера, реальные ватты и цена одного tok/s на 15 августа 2026.

38 мин. чтения