vllm

Thinking Machines выпустила Inkling — открытую мультимодальную модель на 975 млрд параметров

Thinking Machines Lab выпустила Inkling — открытую по весам MoE-модель на 975 млрд параметров с контекстом до 1 млн токенов, для запуска в своей инфраструктуре.

4 мин. чтения

Soofi S 30B: первая суверенная модель Германии — и главный вопрос, можно ли запустить её локально

Обзор Soofi S 30B от немецкого консорциума: архитектура, лицензия, бенчмарки по данным разработчика и разбор, на каком железе реально запустить модель дома.

26 мин. чтения

GLM от Z.ai на своём ПК: реально ли запустить фронтир-модель дома

Обзор GLM (Z.ai) для локального запуска в 2026: линейка 4.6 и Flash, таблица VRAM, агентный кодинг, MoE-offloading, лицензия MIT, требования к железу и русский.

26 мин. чтения

GPT-OSS на своём ПК: первые открытые модели OpenAI за годы

Открытые модели OpenAI на своём ПК: сколько нужно VRAM для 20B и 120B, какие кванты выбрать, как настроить глубину рассуждений и не споткнуться о Harmony.

21 мин. чтения

Mistral Small на своём ПК: европейская модель под одну видеокарту

Обзор Mistral Small для локального запуска в 2026: домашняя 3.x против серверной 4, таблица VRAM, функции и агенты, лицензия Apache 2.0, EU-приватность и русский.

19 мин. чтения

Qwen3 на своём ПК: почему это «модель по умолчанию» для локального ИИ

Обзор Qwen3 для локального запуска в 2026: линейка моделей, таблица VRAM и скорости по квантам, гибридный режим рассуждений, русский язык, честно про цензуру.

22 мин. чтения

MiniMax выпустила MiniMax-M3 — MoE-модель с MSA для миллиона токенов и режимами думания

MiniMax-M3 (HF, 2 июня 2026): MoE + Sparse Attention для миллиона токенов. Мультимодальная — текст, видео, изображения. Together $1,2/млн вых. токенов.

2 мин. чтения