quantization

Квантование локальных LLM: Q8 даёт запас, а обрыв качества начинается ниже Q4

Сколько качества съедает квантование модели и сколько прибавляет скорости: таблицы потерь по уровням GGUF, замеры llama.cpp и научных работ, где потеря заметна.

34 мин. чтения

Видеопамять под LLM: 10 моделей, 5 квантов и формула для KV-кэша

Сколько видеопамяти нужно под модель: таблица по 10 моделям и 5 квантам, реальные размеры GGUF, расчёт KV-кэша по длине контекста и что делать, когда не влезает.

43 мин. чтения

Локальная генерация видео на видеокарте: Wan 2.2, LTX-2.5 и HunyuanVideo 1.5

Wan 2.2, LTX-2.5 и HunyuanVideo 1.5 на своей карте: таблица по 8-32 ГБ видеопамяти, замеры скорости с методикой, разбор трёх лицензий и расчёт себестоимости.

38 мин. чтения

Solar Open 2 на 250 млрд параметров: работает как маленькая

Обзор Solar Open2 250B от Upstage: гибридная MoE-архитектура, бенчмарки, реальная скорость на DGX Spark, ловушки лицензии и квантования, поддержка языков.

20 мин. чтения

Thinking Machines выпустила Inkling — открытую мультимодальную модель на 975 млрд параметров

Thinking Machines Lab выпустила Inkling — открытую по весам MoE-модель на 975 млрд параметров с контекстом до 1 млн токенов, для запуска в своей инфраструктуре.

4 мин. чтения

Soofi S 30B: первая суверенная модель Германии — и как запустить её локально

Обзор Soofi S 30B от немецкого консорциума: архитектура, лицензия, бенчмарки по данным разработчика и разбор, на каком железе реально запустить модель дома.

26 мин. чтения

Германский консорциум выпустил Soofi S — открытую модель 30B, обошедшую конкурентов

Soofi S 30B-A3B — открытая гибридная модель Mamba-MoE от немецкого консорциума на облаке Deutsche Telekom: параметры, бенчмарки, лицензия и локальный запуск.

4 мин. чтения

Unlimited-OCR от Baidu: компактная открытая модель для распознавания текста

Baidu открыла Unlimited-OCR — модель на 3 млрд параметров для распознавания текста и парсинга PDF под лицензией MIT. Уже 45 тыс. загрузок на Hugging Face.

2 мин. чтения