local-llm

Muse Glimmer от Meta: открытая 30B-модель для агентов влезает в 24 ГБ VRAM

Meta выложила Muse Glimmer — модель на 30 млрд параметров под Apache 2.0. В 4-битном кванте занимает около 20 ГБ и работает на одной потребительской видеокарте.

3 мин. чтения

Nvidia RTX Spark N1X обошёл Ryzen AI Max+ 395 в многопотоке Geekbench

В базе Geekbench 7 нашли две системы на ARM-чипе Nvidia RTX Spark N1X. Что показали 18- и 20-ядерная версии и что эти баллы значат для локального запуска ИИ.

3 мин. чтения

Память вернулась к ценам 2007 года: серверная DRAM прибавит ещё 13–18% за квартал

5 августа 2026 года учёный Даниэль Лемир показал: цена памяти за гигабайт откатилась к уровню 2007 года. TrendForce ждёт роста контрактных цен ещё на 13–18%.

2 мин. чтения

LFM2.5-2.6B: модель на 2,6 млрд параметров держит агента в 2,5 ГБ памяти

Liquid AI выложила LFM2.5-2.6B на Hugging Face: 2,6 млрд параметров, меньше 2,5 ГБ памяти и 220 токенов в секунду на M5 Max. Лицензия открытая, но с оговоркой.

3 мин. чтения

AMD Instinct Coder: стойка на восьми MI325X обещает минус 70% к цене токенов

AMD, Supermicro и Spectro Cloud собрали готовую платформу для ИИ-кодинга на своём железе: восемь Instinct MI325X, локальная модель GLM-5.2 и роутер к облаку.

3 мин. чтения

DeepSeek выложила V4 Flash под MIT: модель не выросла, но обошла собственную старшую Pro на агентских тестах

DeepSeek 31 июля выпустила финальную V4 Flash 0731: веса под MIT, 284 млрд параметров, контекст 1 млн токенов и цена втрое ниже медианы по классу.

3 мин. чтения

DeepSeek V4 Flash 0731: модель не выросла, а обошла старшую Pro

Обзор DeepSeek V4 Flash 0731: что реально изменилось, цены API, честный разбор бенчмарков и требования к железу, если запускать веса у себя.

20 мин. чтения

Вчетверо меньше — на один балл слабее: Thinking Machines выложила веса Inkling-Small

Thinking Machines открыла веса Inkling-Small на 276 млрд параметров. Модель отстала от старшей Inkling на один балл индекса, а памяти требует в разы меньше.

3 мин. чтения