vllm

Thinking Machines випустила Inkling — відкриту мультимодальну модель на 975 млрд параметрів

Thinking Machines Lab випустила Inkling — відкриту за вагами MoE-модель на 975 млрд параметрів із контекстом до 1 млн токенів, для запуску на власній інфраструктурі.

4 хв. читання

Soofi S 30B: перша суверенна модель Німеччини — і головне питання, чи можна запустити її локально

Огляд Soofi S 30B від німецького консорціуму: архітектура, ліцензія, бенчмарки за даними розробника та розбір, на якому залізі реально запустити модель удома.

26 хв. читання

GLM від Z.ai на своєму ПК: чи реально запустити фронтир-модель удома

Огляд GLM (Z.ai) для локального запуску у 2026: лінійка 4.6 і Flash, таблиця VRAM, агентний кодинг, MoE-offloading, ліцензія MIT, вимоги до заліза та українська.

26 хв. читання

GPT-OSS на своєму ПК: перші відкриті моделі OpenAI за роки

Відкриті моделі OpenAI на власному ПК: скільки треба VRAM для 20B і 120B, які кванти обрати, як налаштувати глибину міркування і не спіткнутись об Harmony.

21 хв. читання

Mistral Small на своєму ПК: європейська модель під одну відеокарту

Огляд Mistral Small для локального запуску у 2026: домашня 3.x проти серверної 4, таблиця VRAM, функції та агенти, ліцензія Apache 2.0, EU-приватність і українська.

19 хв. читання

Qwen3 на своєму ПК: чому це «модель за замовчуванням» для локального ШІ

Огляд Qwen3 для локального запуску у 2026: лінійка моделей, таблиця VRAM і швидкості за квантами, гібридний режим міркувань, українська мова, чесно про цензуру.

22 хв. читання

MiniMax випустила MiniMax-M3 — MoE-модель з MSA для мільйона токенів і режимами мислення

MiniMax-M3 (HF, 2 червня 2026): MoE + Sparse Attention для мільйона токенів. Мультимодальна — текст, відео, зображення. Together $1,2/млн вих. токенів.

2 хв. читання