Qwen3.8-Flash-Next: 6 млрд активных из 125 и обгон DeepSeek-V4-Flash в коде
26 августа 2026 года команда Qwen выпустила Qwen3.8-Flash-Next — превью архитектуры Qwen4: 125 млрд параметров, 6 млрд активных и обучение в 9 раз дешевле.
Квантование локальных LLM: Q8 даёт запас, а обрыв качества начинается ниже Q4
Сколько качества съедает квантование модели и сколько прибавляет скорости: таблицы потерь по уровням GGUF, замеры llama.cpp и научных работ, где потеря заметна.
Видеопамять под LLM: 10 моделей, 5 квантов и формула для KV-кэша
Сколько видеопамяти нужно под модель: таблица по 10 моделям и 5 квантам, реальные размеры GGUF, расчёт KV-кэша по длине контекста и что делать, когда не влезает.
Ollama, LM Studio и llama.cpp на одной модели: от 0,3% разницы до трёх раз
Ollama, LM Studio и llama.cpp на одной модели: сколько забирает обёртка, почему чужие замеры расходятся в разы и какие настройки решают больше выбора программы.
RTX 5090, 4090 и 3090 в локальных LLM: чужие замеры в одной таблице
Три видеокарты под локальные LLM: tok/s на промте и генерации раздельно, паспорт методики каждого замера, реальные ватты и цена одного tok/s на 15 августа 2026.
Ollama подняла Series B на $65 млн — почему это важно для локального ИИ
Раннер моделей с открытыми весами Ollama закрыл Series B на $65 млн (Theory Ventures) и вырос до 8,9 млн разработчиков. Что это значит для локального ИИ.
GPT-OSS на своём ПК: первые открытые модели OpenAI за годы
Открытые модели OpenAI на своём ПК: сколько нужно VRAM для 20B и 120B, какие кванты выбрать, как настроить глубину рассуждений и не споткнуться о Harmony.
Phi-4 на своём ПК: 14B-модель Microsoft против гигантов
Обзор Phi-4 для локального запуска в 2026: вся линейка, таблица VRAM, почему 14B бьёт GPT-4o в STEM, честно про контекст 16K, русский язык и лицензию MIT.
