GPT-6 Astra: що вміє модель OpenAI, скільки коштує і де її межі
Розбір GPT-6 Astra: ціни API та підписок, хто отримав доступ, що стоїть за 99,9% на ARC-AGI-3, рівень Critical з кібербезпеки і критика заяви про AGI.
Claude Fable 5.1 подешевшала на папері — і подорожчала на 20% за завдання
Огляд Claude Fable 5.1: реальна ціна з кешем, вендорські та незалежні бенчмарки, три зміни API, що ламають код, і доступ за тарифами Claude.
Anthropic: Claude у ролі автодослідника закрив 10 типів збоїв вирівнювання
Anthropic опублікувала роботу про автоматичного дослідника вирівнювання: Claude сам знайшов методи проти всіх десяти типів збоїв і обійшов людей на обмані.
DeepSeek V4-Flash-Vision-Exp обходить Opus 4.8 на двох тестах, але ваг немає
DeepSeek випустив експериментальну мультимодальну модель V4-Flash-Vision-Exp: ціна як у V4-Flash, але ваг у відкритому доступі поки немає — лише API.
GLM-5.3 знайшла 1097 критичних багів — Z.ai притримала ваги на два тижні
GLM-5.3 від Z.ai набрала 60 балів Artificial Analysis і ділить перше місце серед відкритих моделей. Відкриті ваги затримали через кіберможливості.
Квантизація локальних LLM: Q8 дає запас, а обрив якості починається нижче Q4
Скільки якості з'їдає квантизація моделі та скільки додає швидкості: таблиці втрат за рівнями GGUF, заміри llama.cpp і наукових робіт, де втрата помітна.
Ollama, LM Studio і llama.cpp на одній моделі: від 0,3% різниці до трьох разів
Ollama, LM Studio і llama.cpp на одній моделі: скільки забирає обгортка, чому чужі заміри розходяться в рази і які налаштування важать більше за вибір програми.
DGX Spark, Mac Studio і Strix Halo: 120B тримають усі три, 70B буксує у двох
Зводимо заміри DGX Spark, Mac Studio M3 Ultra і Strix Halo до однієї методики: хто тягне 70B і 120B, де ламається довгий промпт і скільки це коштує.
