quantization

Квантизація локальних LLM: Q8 дає запас, а обрив якості починається нижче Q4

Скільки якості з'їдає квантизація моделі та скільки додає швидкості: таблиці втрат за рівнями GGUF, заміри llama.cpp і наукових робіт, де втрата помітна.

34 хв. читання

Відеопам’ять під LLM: 10 моделей, 5 квантів і формула для KV-кешу

Скільки відеопам'яті потрібно під модель: таблиця по 10 моделях і 5 квантах, реальні розміри GGUF, розрахунок KV-кешу за контекстом і що робити, коли не влазить.

43 хв. читання

Локальна генерація відео: Wan 2.2, LTX-2.5 і HunyuanVideo на 8–32 ГБ

Wan 2.2, LTX-2.5 і HunyuanVideo 1.5 на власній карті: що влізе у 8–32 ГБ відеопам'яті, заміри швидкості з методикою, розбір трьох ліцензій і ціна секунди відео.

38 хв. читання

Solar Open 2 на 250 млрд параметрів: працює як маленька

Огляд Solar Open2 250B від Upstage: гібридна MoE-архітектура, бенчмарки, реальна швидкість на DGX Spark, пастки ліцензії та квантування, підтримка мов.

20 хв. читання

Thinking Machines випустила Inkling — відкриту мультимодальну модель на 975 млрд параметрів

Thinking Machines Lab випустила Inkling — відкриту за вагами MoE-модель на 975 млрд параметрів із контекстом до 1 млн токенів, для запуску на власній інфраструктурі.

4 хв. читання

Soofi S 30B: перша суверенна модель Німеччини — і як запустити її локально

Огляд Soofi S 30B від німецького консорціуму: архітектура, ліцензія, бенчмарки за даними розробника та розбір, на якому залізі реально запустити модель удома.

26 хв. читання

Німецький консорціум випустив Soofi S — відкриту модель 30B, що обійшла конкурентів

Soofi S 30B-A3B — відкрита гібридна модель Mamba-MoE від німецького консорціуму на хмарі Deutsche Telekom: параметри, бенчмарки, ліцензія та локальний запуск.

4 хв. читання

Unlimited-OCR від Baidu: компактна відкрита модель для розпізнавання тексту

Baidu відкрила Unlimited-OCR — модель на 3 млрд параметрів для розпізнавання тексту й парсингу PDF під ліцензією MIT. Уже 45 тис. завантажень на Hugging Face.

2 хв. читання