benchmarks

GPT-6 Astra: що вміє модель OpenAI, скільки коштує і де її межі

Розбір GPT-6 Astra: ціни API та підписок, хто отримав доступ, що стоїть за 99,9% на ARC-AGI-3, рівень Critical з кібербезпеки і критика заяви про AGI.

19 хв. читання

Claude Fable 5.1 подешевшала на папері — і подорожчала на 20% за завдання

Огляд Claude Fable 5.1: реальна ціна з кешем, вендорські та незалежні бенчмарки, три зміни API, що ламають код, і доступ за тарифами Claude.

27 хв. читання

Anthropic: Claude у ролі автодослідника закрив 10 типів збоїв вирівнювання

Anthropic опублікувала роботу про автоматичного дослідника вирівнювання: Claude сам знайшов методи проти всіх десяти типів збоїв і обійшов людей на обмані.

3 хв. читання

DeepSeek V4-Flash-Vision-Exp обходить Opus 4.8 на двох тестах, але ваг немає

DeepSeek випустив експериментальну мультимодальну модель V4-Flash-Vision-Exp: ціна як у V4-Flash, але ваг у відкритому доступі поки немає — лише API.

3 хв. читання

GLM-5.3 знайшла 1097 критичних багів — Z.ai притримала ваги на два тижні

GLM-5.3 від Z.ai набрала 60 балів Artificial Analysis і ділить перше місце серед відкритих моделей. Відкриті ваги затримали через кіберможливості.

3 хв. читання

Квантизація локальних LLM: Q8 дає запас, а обрив якості починається нижче Q4

Скільки якості з'їдає квантизація моделі та скільки додає швидкості: таблиці втрат за рівнями GGUF, заміри llama.cpp і наукових робіт, де втрата помітна.

34 хв. читання

Ollama, LM Studio і llama.cpp на одній моделі: від 0,3% різниці до трьох разів

Ollama, LM Studio і llama.cpp на одній моделі: скільки забирає обгортка, чому чужі заміри розходяться в рази і які налаштування важать більше за вибір програми.

33 хв. читання

DGX Spark, Mac Studio і Strix Halo: 120B тримають усі три, 70B буксує у двох

Зводимо заміри DGX Spark, Mac Studio M3 Ultra і Strix Halo до однієї методики: хто тягне 70B і 120B, де ламається довгий промпт і скільки це коштує.

35 хв. читання