Квантизація локальних LLM: Q8 дає запас, а обрив якості починається нижче Q4
Скільки якості з'їдає квантизація моделі та скільки додає швидкості: таблиці втрат за рівнями GGUF, заміри llama.cpp і наукових робіт, де втрата помітна.
Відеопам’ять під LLM: 10 моделей, 5 квантів і формула для KV-кешу
Скільки відеопам'яті потрібно під модель: таблиця по 10 моделях і 5 квантах, реальні розміри GGUF, розрахунок KV-кешу за контекстом і що робити, коли не влазить.
Локальна генерація відео: Wan 2.2, LTX-2.5 і HunyuanVideo на 8–32 ГБ
Wan 2.2, LTX-2.5 і HunyuanVideo 1.5 на власній карті: що влізе у 8–32 ГБ відеопам'яті, заміри швидкості з методикою, розбір трьох ліцензій і ціна секунди відео.
Solar Open 2 на 250 млрд параметрів: працює як маленька
Огляд Solar Open2 250B від Upstage: гібридна MoE-архітектура, бенчмарки, реальна швидкість на DGX Spark, пастки ліцензії та квантування, підтримка мов.
Thinking Machines випустила Inkling — відкриту мультимодальну модель на 975 млрд параметрів
Thinking Machines Lab випустила Inkling — відкриту за вагами MoE-модель на 975 млрд параметрів із контекстом до 1 млн токенів, для запуску на власній інфраструктурі.
Soofi S 30B: перша суверенна модель Німеччини — і як запустити її локально
Огляд Soofi S 30B від німецького консорціуму: архітектура, ліцензія, бенчмарки за даними розробника та розбір, на якому залізі реально запустити модель удома.
Німецький консорціум випустив Soofi S — відкриту модель 30B, що обійшла конкурентів
Soofi S 30B-A3B — відкрита гібридна модель Mamba-MoE від німецького консорціуму на хмарі Deutsche Telekom: параметри, бенчмарки, ліцензія та локальний запуск.
Unlimited-OCR від Baidu: компактна відкрита модель для розпізнавання тексту
Baidu відкрила Unlimited-OCR — модель на 3 млрд параметрів для розпізнавання тексту й парсингу PDF під ліцензією MIT. Уже 45 тис. завантажень на Hugging Face.