Квантование локальных LLM: Q8 даёт запас, а обрыв качества начинается ниже Q4
Сколько качества съедает квантование модели и сколько прибавляет скорости: таблицы потерь по уровням GGUF, замеры llama.cpp и научных работ, где потеря заметна.
Видеопамять под LLM: 10 моделей, 5 квантов и формула для KV-кэша
Сколько видеопамяти нужно под модель: таблица по 10 моделям и 5 квантам, реальные размеры GGUF, расчёт KV-кэша по длине контекста и что делать, когда не влезает.
Локальная генерация видео на видеокарте: Wan 2.2, LTX-2.5 и HunyuanVideo 1.5
Wan 2.2, LTX-2.5 и HunyuanVideo 1.5 на своей карте: таблица по 8-32 ГБ видеопамяти, замеры скорости с методикой, разбор трёх лицензий и расчёт себестоимости.
Solar Open 2 на 250 млрд параметров: работает как маленькая
Обзор Solar Open2 250B от Upstage: гибридная MoE-архитектура, бенчмарки, реальная скорость на DGX Spark, ловушки лицензии и квантования, поддержка языков.
Thinking Machines выпустила Inkling — открытую мультимодальную модель на 975 млрд параметров
Thinking Machines Lab выпустила Inkling — открытую по весам MoE-модель на 975 млрд параметров с контекстом до 1 млн токенов, для запуска в своей инфраструктуре.
Soofi S 30B: первая суверенная модель Германии — и как запустить её локально
Обзор Soofi S 30B от немецкого консорциума: архитектура, лицензия, бенчмарки по данным разработчика и разбор, на каком железе реально запустить модель дома.
Германский консорциум выпустил Soofi S — открытую модель 30B, обошедшую конкурентов
Soofi S 30B-A3B — открытая гибридная модель Mamba-MoE от немецкого консорциума на облаке Deutsche Telekom: параметры, бенчмарки, лицензия и локальный запуск.
Unlimited-OCR от Baidu: компактная открытая модель для распознавания текста
Baidu открыла Unlimited-OCR — модель на 3 млрд параметров для распознавания текста и парсинга PDF под лицензией MIT. Уже 45 тыс. загрузок на Hugging Face.