Qwen 3.8-Max: чем больше усилия, тем хуже результат — и почему баллы не равны счёту
Независимый прогон VulcanBench: Qwen 3.8-Max берёт 81,2% задач на низком усилии и 55,1% на заводской настройке. Провалы — не ошибки, а незаконченные прогоны.
LFM2.5-2.6B: модель на 2,6 млрд параметров держит агента в 2,5 ГБ памяти
Liquid AI выложила LFM2.5-2.6B на Hugging Face: 2,6 млрд параметров, меньше 2,5 ГБ памяти и 220 токенов в секунду на M5 Max. Лицензия открытая, но с оговоркой.
GPT-5.6 Luna: у бесплатных ChatGPT появился безлимит на текст и кнопка Think
OpenAI обновила GPT-5.6 Sol для Plus и Pro и добавила ползунок глубины ответа. Бесплатным — модель Luna по умолчанию и безлимитные текстовые чаты.
Meta Muse Code в бете: токены в 21 раз дешевле в обмен на ваш код
Meta открыла бету Muse Code — терминального агента на модели Muse Spark 1.2. Дешёвый тариф стоит $0,20 за млн токенов, но Meta учится на вашем коде.
Открытая видеомодель впервые обошла закрытые — что MiniMax отдал вместе с весами H3, а что оставил себе
MiniMax выложила веса видеомодели H3 на Hugging Face. Она первая в рейтинге видеомонтажа Artificial Analysis, но локально выдаёт максимум 768p.
DeepSeek выложила V4 Flash под MIT: модель не выросла, но обошла собственную старшую Pro на агентских тестах
DeepSeek 31 июля выпустила финальную V4 Flash 0731: веса под MIT, 284 млрд параметров, контекст 1 млн токенов и цена втрое ниже медианы по классу.
DeepSeek V4 Flash 0731: модель не выросла, а обошла старшую Pro
Обзор DeepSeek V4 Flash 0731: что реально изменилось, цены API, честный разбор бенчмарков и требования к железу, если запускать веса у себя.
OpenAI назвала следующее семейство моделей Astra и выложила решения десяти открытых задач с доказательствами в Lean
OpenAI 1 августа опубликовала решения десяти нерешённых математических задач от внутренней версии Astra. Каждое доказательство формализовано в Lean.
