Бенчмарки железа для ИИ

Бенчмарки железа для ИИ: скорость LLM в токенах/с, тесты диффузии, замеры VRAM и энергопотребления на реальных задачах.

Квантование локальных LLM: Q8 даёт запас, а обрыв качества начинается ниже Q4

Сколько качества съедает квантование модели и сколько прибавляет скорости: таблицы потерь по…

Видеопамять под LLM: 10 моделей, 5 квантов и формула для KV-кэша

Сколько видеопамяти нужно под модель: таблица по 10 моделям и 5 квантам,…

Ollama, LM Studio и llama.cpp на одной модели: от 0,3% разницы до трёх раз

Ollama, LM Studio и llama.cpp на одной модели: сколько забирает обёртка, почему…

RTX 5090, 4090 и 3090 в локальных LLM: чужие замеры в одной таблице

Три видеокарты под локальные LLM: tok/s на промте и генерации раздельно, паспорт…