Qwen3.8-Flash-Next: 6 млрд активних із 125 і перевага над DeepSeek-V4-Flash у коді
26 серпня 2026 року команда Qwen випустила Qwen3.8-Flash-Next — прев'ю архітектури Qwen4: 125 млрд параметрів, 6 млрд активних і навчання в 9 разів дешевше.
Квантизація локальних LLM: Q8 дає запас, а обрив якості починається нижче Q4
Скільки якості з'їдає квантизація моделі та скільки додає швидкості: таблиці втрат за рівнями GGUF, заміри llama.cpp і наукових робіт, де втрата помітна.
Відеопам’ять під LLM: 10 моделей, 5 квантів і формула для KV-кешу
Скільки відеопам'яті потрібно під модель: таблиця по 10 моделях і 5 квантах, реальні розміри GGUF, розрахунок KV-кешу за контекстом і що робити, коли не влазить.
Ollama, LM Studio і llama.cpp на одній моделі: від 0,3% різниці до трьох разів
Ollama, LM Studio і llama.cpp на одній моделі: скільки забирає обгортка, чому чужі заміри розходяться в рази і які налаштування важать більше за вибір програми.
RTX 5090, 4090 і 3090 у локальних LLM: чужі заміри в одній таблиці
Три відеокарти під локальні LLM: tok/s на промті та генерації окремо, паспорт методики кожного заміру, реальні вати і ціна одного tok/s на 15 серпня 2026.
Ollama підняла Series B на $65 млн — чому це важливо для локального ШІ
Раннер моделей з відкритими вагами Ollama закрив Series B на $65 млн (Theory Ventures) і виріс до 8,9 млн розробників. Що це означає для локального ШІ.
GPT-OSS на своєму ПК: перші відкриті моделі OpenAI за роки
Відкриті моделі OpenAI на власному ПК: скільки треба VRAM для 20B і 120B, які кванти обрати, як налаштувати глибину міркування і не спіткнутись об Harmony.
Phi-4 на своєму ПК: 14B-модель Microsoft проти гігантів
Огляд Phi-4 для локального запуску у 2026: уся лінійка, таблиця VRAM, чому 14B б'є GPT-4o у STEM, чесно про контекст 16K, українську мову та ліцензію MIT.
