llama-cpp

Qwen3.8-Flash-Next: 6 млрд активних із 125 і перевага над DeepSeek-V4-Flash у коді

26 серпня 2026 року команда Qwen випустила Qwen3.8-Flash-Next — прев'ю архітектури Qwen4: 125 млрд параметрів, 6 млрд активних і навчання в 9 разів дешевше.

4 хв. читання

Квантизація локальних LLM: Q8 дає запас, а обрив якості починається нижче Q4

Скільки якості з'їдає квантизація моделі та скільки додає швидкості: таблиці втрат за рівнями GGUF, заміри llama.cpp і наукових робіт, де втрата помітна.

34 хв. читання

Відеопам’ять під LLM: 10 моделей, 5 квантів і формула для KV-кешу

Скільки відеопам'яті потрібно під модель: таблиця по 10 моделях і 5 квантах, реальні розміри GGUF, розрахунок KV-кешу за контекстом і що робити, коли не влазить.

43 хв. читання

Ollama, LM Studio і llama.cpp на одній моделі: від 0,3% різниці до трьох разів

Ollama, LM Studio і llama.cpp на одній моделі: скільки забирає обгортка, чому чужі заміри розходяться в рази і які налаштування важать більше за вибір програми.

33 хв. читання

RTX 5090, 4090 і 3090 у локальних LLM: чужі заміри в одній таблиці

Три відеокарти під локальні LLM: tok/s на промті та генерації окремо, паспорт методики кожного заміру, реальні вати і ціна одного tok/s на 15 серпня 2026.

38 хв. читання

Ollama підняла Series B на $65 млн — чому це важливо для локального ШІ

Раннер моделей з відкритими вагами Ollama закрив Series B на $65 млн (Theory Ventures) і виріс до 8,9 млн розробників. Що це означає для локального ШІ.

2 хв. читання

GPT-OSS на своєму ПК: перші відкриті моделі OpenAI за роки

Відкриті моделі OpenAI на власному ПК: скільки треба VRAM для 20B і 120B, які кванти обрати, як налаштувати глибину міркування і не спіткнутись об Harmony.

21 хв. читання

Phi-4 на своєму ПК: 14B-модель Microsoft проти гігантів

Огляд Phi-4 для локального запуску у 2026: уся лінійка, таблиця VRAM, чому 14B б'є GPT-4o у STEM, чесно про контекст 16K, українську мову та ліцензію MIT.

19 хв. читання