Коротко: что решает выбор между RTX 5090, 4090 и 3090
Своих карт у редакции нет — всё, что ниже, это чужие замеры, сведённые к одной сравнимой таблице, с паспортом методики у каждой цифры. Данные и цены — на 15 августа 2026.
- Коротко: что решает выбор между RTX 5090, 4090 и 3090
- Три карты, два объёма памяти и три цены: что сравниваем
- Чьи это замеры: методика источников и что не попало в таблицу
- Скорость генерации: сколько tok/s дают RTX 5090, 4090 и 3090
- Обработка промта: где RTX 5090 отрывается сильнее всего
- Что влезает в 24 и 32 ГБ: модель, квант и длина контекста
- Ватты под инференсом: чем реальное потребление отличается от TDP
- Цена одного tok/s: RTX 3090 против RTX 5090 по августовским ценам
- Куда упирается скорость: КПД пропускной способности трёх карт
- FP4 на Blackwell: что ускоряет llama.cpp, а что не меняется
- Слабые места этого сравнения: чего чужие замеры не говорят
- FAQ
- RTX 5090 быстрее RTX 4090 на генерации в 1,2–1,6 раза, а не «в три раза». Разброс между источниками (1,29× у одного, 2,02× у другого) шире, чем разница между самими картами внутри любого одного замера.
- Разрыв 4090 против 3090 маленький там, где вы его чувствуете: 13–34% на генерации ответа. Зато на обработке промта 4090 быстрее вдвое — это две разные задачи, и смешивать их в одну цифру нельзя.
- Лишние 8 ГБ у 5090 не открывают новый класс моделей. Максимум для всех трёх карт — плотная модель на 32–34 млрд параметров в 4 битах. 32 ГБ покупают контекст и запас, а не модель следующего размера.
- По цене одного tok/s подержанная RTX 3090 выигрывает почти вдвое: $14,4 против $26,6 у RTX 5090. Электричество этот разрыв не отыгрывает — расчёт ниже показывает, что на это ушло бы больше двадцати пяти лет непрерывной генерации.
- Ватты под инференсом сильно ниже цифры из спецификации: у RTX 5090 измерено 353 Вт при заявленных 575 Вт. Карта в генерации не загружена целиком, она ждёт память.
- FP4 на 50-й серии ускоряет обработку промта, а не генерацию. По цифрам самих pull request’ов в llama.cpp: промт +27…+289%, генерация 0,99× — то есть не изменилась.
Три карты, два объёма памяти и три цены: что сравниваем
В локальных языковых моделях видеокарта решает две разные задачи. Первая — обработка промта (prompt processing, prefill): модель разом читает всё, что вы ей дали, — вопрос, историю чата, приложенные документы. Это счётная работа, и в ней важны вычислительные блоки. Вторая — генерация (token generation, decode): модель выдаёт ответ по одному токену, и на каждый токен ей нужно прочитать из видеопамяти веса целиком. Это работа не счётная, а транспортная, и в ней важна пропускная способность памяти.
Отсюда главное правило выбора: объём видеопамяти решает, запустится ли модель вообще, а пропускная способность — с какой скоростью пойдёт ответ. Мощность чипа влияет на третью величину — сколько вы ждёте перед первым словом ответа.Параметр RTX 3090 RTX 4090 RTX 5090 Архитектура Ampere Ada Lovelace Blackwell Видеопамять 24 ГБ GDDR6X 24 ГБ GDDR6X 32 ГБ GDDR7 Шина и скорость памяти 384 бит × 19,5 Гбит/с 384 бит × 21 Гбит/с 512 бит × 28 Гбит/с Пропускная способность 936 ГБ/с 1008 ГБ/с 1792 ГБ/с CUDA-ядра 10 496 16 384 21 760 Заявленная мощность 350 Вт 450 Вт 575 Вт Цена б/у на eBay US, 15.08.2026 $1263 $2500 $4319 Цена новой $1430 (на 15.08) $2899–3380 (на 15.08) $4599 (на 01.08)
Характеристики RTX 5090 взяты с официальной страницы NVIDIA: 32 ГБ GDDR7, шина 512 бит, 21 760 ядер, заявленная мощность 575 Вт. Пропускную способность вендор на странице не публикует, поэтому все три значения посчитаны одинаково — из ширины шины и скорости памяти: 512 бит ÷ 8 × 28 Гбит/с = 1792 ГБ/с. Тем же способом получаются 1008 ГБ/с у 4090 и 936 ГБ/с у 3090. Это важно: на карточке RTX 3090 у одного из источников стоит 986 ГБ/с при скорости памяти 19,5 Гбит/с — цифра, которая арифметически не получается.
Из таблицы видно то, что дальше объяснит почти все результаты. RTX 4090 обгоняет RTX 3090 по пропускной способности всего на 7,7% — 1008 против 936 ГБ/с. По вычислительным блокам разрыв в полтора раза. RTX 5090 добавляет к 4090 сразу 78% пропускной способности и треть ядер, а вместе с ними — треть объёма памяти.
Цены здесь — самая нестабильная строка таблицы. RTX 5090 при рекомендованной цене $1999 продавалась 1 августа 2026 за $4598,90, то есть на 130% выше рекомендованной; дефицит памяти держит весь рынок. Если вы ещё не определились с классом железа вообще, а не выбираете между этими тремя картами, начните с нашего гида по выбору железа для локального ИИ — он про уровни бюджета, а этот материал про цифры внутри одного уровня.
Чьи это замеры: методика источников и что не попало в таблицу
Святое правило этой рубрики — методика прозрачна. Цифра «RTX 5090 выдаёт 200 токенов в секунду» без модели, кванта, длины контекста и версии бекенда не значит ничего: те же 200 токенов на модели 8B и на модели 32B отличаются в пять раз, а тот же квант в другой сборке llama.cpp даёт другой результат.
Из пятнадцати разобранных материалов методику называет шесть. Вот их паспорта — именно из них взяты все цифры ниже.Источник Дата Бекенд Модель и квант Что меряли Какие карты Hardware Corner, карточки GPU март 2026 llama.cpp llama-bench, Ubuntu 24.04, CUDA 12.8 Qwen3 8B / 14B / 32B / 30B A3B, Q4_K_XL промт и генерация раздельно, 4k–256k все три Hardware Corner, статья о стенде 06.11.2025 llama-bench build 466c1911, флаги -fa 1 -ngl 99, EPYC 7642, 129 ГБ DDR4Q4_K_XL промт 2048 токенов, генерация 128 только 5090 llama.cpp, ветка результатов CUDA обновляется llama-bench, git-хэш обязателен Llama 2 7B Q4_0 pp512 и tg128 раздельно все три, но разные сборки Databasemart 03.08.2026 Ollama 0.6.5 у 5090, 0.5.4–0.5.7 у 4090 4 бита, 8–10 моделей только генерация 5090 и 4090, разные ОС CloudRift 09.10.2025 vLLM, 400 одновременных запросов AWQ и INT4, контекст 8192 суммарная пропускная способность 4090 и 5090 arXiv 2601.09527 14.01.2026 vLLM 0.12, CUDA 12.9, телеметрия DCGM Qwen3-8B в BF16 / W4A16 / NVFP4 пропускная способность и ватты только 5090
Что отброшено и почему:
- Десять материалов из топа выдачи — целиком. Ни модели, ни кванта, ни контекста, ни бекенда. Самый посещаемый из них закрыт пейволом, и в открытой части у него 380 слов и одна цифра.
- Утверждение «RTX 5090 быстрее RTX 4090 в 3,2 раза». Источник не называет ни режим, ни модель. Из подписи следует, что 4090 выдаёт около 56 токенов в секунду на модели 8B в 4 битах, тогда как три независимых замера с методикой дают 95–141. Цифра не сходится ни с чем.
- Puget Systems. Лаборатория с прозрачной методикой, которую наш профиль рубрики считает источником первого выбора. Открыть её не удалось ни одним способом (403 и защита от ботов), поэтому оттуда в статье нет ни одной цифры.
- Медианные цены RTX 50 за август от TechPowerUp. Та же история: страница закрыта проверкой браузера. Цены взяты у трекеров, которые реально открылись.
- Строка gpt-oss 20B. У RTX 5090 она подписана как Q4_K, у RTX 4090 и RTX 3090 — как MXFP4. Разные форматы, сравнивать нельзя, хотя строки стоят в таблицах одного сайта и выглядят одинаково.
- Строки Gemma4 26B и 31B, Qwen3.5 27B и 35B у RTX 4090. У 3090 с тем же объёмом памяти они есть, у 4090 нет, и почему — источник не объясняет.
- Русскоязычный разбор RTX 5090 для инференса. Мерялась, дословно, «одна моделька» — без названия, кванта и контекста.
Отдельная оговорка про самый цитируемый источник ниши. На карточке RTX 4090 у Hardware Corner заголовком стоит «78.7 t/s average on 14B models at 16k context». В таблице на той же странице у Qwen3 14B в 4 битах стоит 84,4 при 4k и 69,8 при 16k — то есть 78,7 не совпадает ни с одной колонкой. Там же заявлена обработка промта 4474 t/s, тогда как собственная строка карты даёт 3452,3, а вот у RTX 5090 значение в этой же ячейке — 4473,1. У 3090 и 5090 заголовочные цифры со своими таблицами сходятся точно, так что дефект единичный. Цена ошибки не косметическая: из 78,7 выведена цена одного tok/s ($2200 ÷ 78,7 = $27,95), а по таблице получилось бы $31,52 — карта выглядит на 11% выгоднее, чем по данным самого источника. Именно 78,7 и разошлось по выдаче как «скорость RTX 4090».
Скорость генерации: сколько tok/s дают RTX 5090, 4090 и 3090
Генерация — это та скорость, которую вы видите глазами: как быстро текст ползёт по экрану. Таблица ниже — единственный набор, где все три карты промерены одним стендом, одним бекендом и одним квантом. Строки, где кванты у карт различаются, из неё убраны.Модель, квант, контекст RTX 3090 RTX 4090 RTX 5090 4090/3090 5090/4090 Qwen3 8B Q4_K, 4k 115,3 141,3 200,4 1,23× 1,42× Qwen3 8B Q4_K, 16k 87,5 108,0 162,3 1,23× 1,50× Qwen3 8B Q4_K, 32k 67,9 82,3 129,8 1,21× 1,58× Qwen3 14B Q4_K, 4k 70,0 84,4 123,8 1,21× 1,47× Qwen3 14B Q4_K, 16k 52,1 69,8 102,7 1,34× 1,47× Qwen3 30B A3B Q4_K, 16k 113,8 139,2 170,4 1,22× 1,22× Qwen3 32B Q4_K, 4k 35,1 39,6 61,4 1,13× 1,55× Qwen3 32B Q4_K, 16k 30,3 34,4 50,9 1,14× 1,48×
Замеры Hardware Corner, обновление марта 2026; llama-bench, Ubuntu 24.04, CUDA 12.8. Оговорка к самому источнику: строки таблиц он подписывает как Q4_K, а свою методику — как Q4_K_XL; какое из двух обозначений точное, издание не поясняет.
Два вывода читаются прямо из колонок соотношений. RTX 4090 обгоняет RTX 3090 на 13–34% — заметно, но это не разница поколений в разы. RTX 5090 обгоняет RTX 4090 на 22–58%, и меньше всего разрыв на модели со смешанными экспертами (Qwen3 30B A3B), где на каждый токен читается только часть весов.
Теперь то, ради чего эта статья написана. Возьмите тот же вопрос — «во сколько раз RTX 5090 быстрее RTX 4090» — и посмотрите, что отвечают источники с методикой.Источник и режим Что мерили 5090 / 4090 Открытая таблица llama.cpp Llama 2 7B Q4_0, tg128, разные сборки 1,29× Hardware Corner, снимок декабря 2025 Qwen3 8B, 16k 1,39× Hardware Corner, снимок марта 2026 Qwen3 8B, 16k 1,50× Databasemart, август 2026 llama3.1 8B, Ollama, разные версии бекенда 1,57× CloudRift, октябрь 2025 Qwen3-Coder 30B AWQ, vLLM, 400 запросов 2,02× Отношение пропускной способности теоретический потолок для генерации 1,78×
Разброс 1,29–2,02 — это не «кто-то ошибся». Это три разных явления в одной колонке.
Первое: батч меняет расклад. В открытой таблице llama.cpp и у Hardware Corner меряют одиночный запрос — так работает ваш чат. CloudRift (это провайдер аренды GPU, и быстрая карта — часть его продукта, что стоит держать в уме) гонит 400 запросов одновременно, и там карта считает много токенов параллельно, то есть упирается уже не в память, а в вычислительные блоки, где у Blackwell преимущество больше. Косвенное подтверждение из работы про потребительский Blackwell: одна RTX 5090 даёт 411 токенов в секунду при восьми одновременных запросах и 6894 при ста двадцати восьми. Это одна и та же карта.
Второе: цифры двигаются во времени. У одного и того же издания RTX 5090 на Qwen3 8B при 16k выдавала 145,34 t/s в декабре 2025 и 162,3 t/s в марте 2026 — плюс 11,7% при неизменном железе. В ноябре 2025 на 4k было 186 t/s, в марте — 200,4. А вот RTX 3090 в тех же двух снимках дала 87,45 и 87,5 — то есть не сдвинулась вовсе. Росло не железо, а поддержка Blackwell в llama.cpp. Практический вывод простой: любой замер RTX 5090 старше полугода занижен, а замер RTX 3090 — нет.
Третье: разные стенды не сравнимы, даже когда таблицы выглядят одинаково. Ollama-замеры августа сняты на версии 0.6.5 под Ubuntu для 5090 и на версиях 0.5.4–0.5.7 под Windows для 4090, на разных процессорах. В самой публикации об этом не сказано ни слова, и пара выглядит как честное сравнение.
Обработка промта: где RTX 5090 отрывается сильнее всего
Вторая половина работы — та, что происходит до первого слова ответа. Если вы пишете короткие вопросы в чат, вы её почти не замечаете. Если вы кидаете модели файл на сорок страниц, работаете с длинной историей или строите поиск по документам, то именно она и есть ваше время ожидания.Модель, квант, контекст RTX 3090 RTX 4090 RTX 5090 4090/3090 5090/4090 Qwen3 8B Q4_K, 4k 4049,6 9250,5 11 933,4 2,28× 1,29× Qwen3 8B Q4_K, 16k 2572,5 5530,5 8538,4 2,15× 1,54× Qwen3 14B Q4_K, 16k 1678,7 3452,3 4473,1 2,06× 1,30× Qwen3 32B Q4_K, 4k 1087,9 2448,0 2931,3 2,25× 1,20×
Тот же стенд Hardware Corner, март 2026. Цифры — токены промта в секунду.
Сравните колонку «4090/3090» здесь и в предыдущей таблице. На генерации 4090 быстрее 3090 на 13–34%. На обработке промта — вдвое, от 2,06 до 2,28 раза. Это и есть доказательство того, что смешивать две задачи в одну цифру нельзя: одна и та же пара карт отличается либо на четверть, либо в два раза, смотря что вы делаете.
Тот же вывод даёт открытая таблица llama.cpp на совсем другой модели: на Llama 2 7B в Q4_0 RTX 3090 показывает pp512 5174,69 и tg128 158,16, RTX 4090 — 11 992,70 и 186,21, RTX 5090 — 14 751,98 и 239,62. Промт у 4090 вдвое быстрее, чем у 3090, генерация — на 18%. Оговорка самой ветки: строки присланы разными участниками на разных сборках, и результат зависит от драйвера, операционной системы и производителя платы.
Практический смысл: если ваша работа — длинный контекст, разница между поколениями гораздо больше, чем показывает средний обзор. Подержанная RTX 3090 на промте отстаёт вдвое, и это ощущается на каждом запросе с приложенным документом. Если же вы пишете короткие вопросы и читаете ответ по мере набора, этой разницей можно пренебречь — там решает генерация, а в ней разрыв вчетверо меньше.
Что влезает в 24 и 32 ГБ: модель, квант и длина контекста
Скорость обсуждать бессмысленно, пока модель не помещается в память: как только части весов уезжают в оперативную память, счёт идёт уже не на десятки токенов в секунду, а на единицы. Считать вес просто. Файл Qwen3 8B в кванте UD-Q4_K_XL весит 5,14 ГБ на восемь с небольшим миллиардов параметров — то есть около 0,63 ГБ на каждый миллиард параметров в четырёх битах. В восьми битах вдвое больше, в BF16 — вчетверо.Модель и квант Вес весов 24 ГБ (3090 и 4090) 32 ГБ (5090) 8B в 4 битах 5,1 ГБ да, ~18 ГБ остаётся под контекст да, ~26 ГБ остаётся 8B в 8 битах 8,7 ГБ да да 8B в BF16 16,4 ГБ да, но контекста почти не остаётся да, с запасом 14B в 4 битах ~9 ГБ да да 32B в 4 битах ~20 ГБ впритык, длинный контекст не влезет да, ~12 ГБ под контекст 32B в 8 битах ~35 ГБ нет нет 70B в 4 битах ~40 ГБ нет нет
Остаток после весов уходит под KV-кеш — память, где модель держит уже прочитанный контекст. Он растёт линейно с длиной, и именно здесь лишние 8 ГБ отрабатывают. Видно это по самим таблицам замеров: у RTX 5090 есть колонка на 256 тысяч токенов контекста, у RTX 4090 строки обрываются на 128 тысячах.
А вот чего 32 ГБ не дают — так это следующего класса моделей. В сводке того же источника максимальная модель у всех трёх карт одинаковая: 34B. Плотная модель на 70 млрд параметров даже в четырёх битах требует около 40 ГБ и не помещается ни в одну из трёх. Если вам нужно именно 70B, ответ лежит в другой плоскости — две подержанные RTX 3090 дают 48 ГБ дешевле одной RTX 5090, и это отдельный разговор про мультикарту.
Подробную раскладку «сколько памяти нужно каждой конкретной модели» и разбор того, что теряется в качестве между 4 и 8 битами, мы выносим в отдельные материалы — здесь ровно столько, сколько нужно для сравнения карт.
Ватты под инференсом: чем реальное потребление отличается от TDP
Цифра из спецификации — это потолок, который карта берёт в тяжёлой графике. В генерации токенов вычислительные блоки простаивают в ожидании памяти, и реальное потребление заметно ниже.Карта Заявленная мощность Измерено под инференсом Чем мерили RTX 3090 350 Вт ~333 Вт при лимите 350 Вт пользовательский замер, 28.04.2026, Qwen 3.6 27B, llama-swap RTX 4090 450 Вт измерения не нашлось — RTX 5090 575 Вт 353 Вт на RAG-нагрузке, 435 Вт при 64 запросах arXiv 2601.09527, 14.01.2026, телеметрия NVIDIA DCGM
RTX 5090 под инференсом ест 61–76% от заявленных 575 Вт — то есть под блок питания на киловатт её брать не обязательно, а под непрерывную генерацию тем более. По RTX 4090 честного измерения найти не удалось вовсе: в выдаче кочует цифра из спецификации, причём несколько страниц приписывают 4090 те самые 575 Вт, которых у неё нет (её заявленная мощность 450 Вт).
Отдельно полезная кривая — что даёт ограничение мощности. На RTX 3090 в замере от 28 апреля 2026 (бекенд llama-swap v199, форк llama.cpp; драйвер NVIDIA 590.48.01; модель Qwen 3.6 27B; генерация эссе на 4000 токенов):
- 350 Вт — 32,0 токена в секунду, реально ~333 Вт;
- 300 Вт — 33,0 токена в секунду (быстрее!), ~295 Вт;
- 275 Вт — 32,7;
- 250 Вт — 31,7, то есть минус 1% скорости при минус 86 Вт;
- 200 Вт — 20,6, здесь карта уже сыпется;
- 150 Вт — 8,3.
Лучшая эффективность — около 250–280 Вт: 0,128 токена на ватт против 0,096 на полном лимите. Практически это значит, что у карты можно снять сотню ватт почти бесплатно, а заодно убрать шум и нагрев. Замер один и пользовательский, но с полностью описанной процедурой — команда, пауза на стабилизацию, порядок тестов.
Цена одного tok/s: RTX 3090 против RTX 5090 по августовским ценам
Чтобы сравнение было честным, все три цены взяты у одного трекера, одним методом (средняя по проданным лотам на eBay US) и в один день — 15 августа 2026. Иначе получилось бы ровно то, за что мы критикуем выдачу.Показатель RTX 3090 RTX 4090 RTX 5090 Цена б/у, 15.08.2026 $1263 (372 лота) $2500 (16 лотов) $4319 (68 лотов) Qwen3 8B Q4, 16k — генерация 87,5 t/s 108,0 t/s 162,3 t/s Цена одного tok/s $14,4 $23,1 $26,6 Qwen3 14B Q4, 16k — генерация 52,1 t/s 69,8 t/s 102,7 t/s Цена одного tok/s $24,2 $35,8 $42,1 Электричество, грн за миллион токенов 4,6 3,9 2,6
Порядок карт не меняется ни на одной модели: RTX 3090 стоит в 1,8 раза меньше за единицу скорости, чем RTX 5090. Оговорка по выборкам: у 3090 средняя посчитана по 372 объявлениям, у 4090 — всего по 16, поэтому её цена самая шаткая. Второй трекер в тот же день давал 3090 за $1000, а розничная цена RTX 5090 1 августа была $4598,90 при рекомендованной $1999.
Теперь электричество — аргумент, который в спорах о подержанных картах достают первым. Считаем по украинскому тарифу для населения, 4,32 грн за кВт·ч (зафиксирован до 31 октября 2026). Формула открытая, подставьте свои ватты:
Гривны за миллион токенов = (1 000 000 ÷ tok/s ÷ 3600) × мощность в кВт × 4,32
Для RTX 3090: миллион токенов при 87,5 t/s — это 3,17 часа работы; при измеренных 333 Вт выходит 1,06 кВт·ч, то есть 4,57 грн. Для RTX 5090 при 162,3 t/s и измеренных 353 Вт — 1,71 часа, 0,60 кВт·ч, 2,61 грн. Для RTX 4090 измеренных ватт нет, взят типовой рабочий лимит 350 Вт: 2,57 часа, 0,90 кВт·ч, 3,89 грн.
Разница между самой прожорливой и самой экономной картой — около двух гривен на миллион сгенерированных токенов. Миллион токенов — это сотни тысяч слов связного текста.
Отсюда прямой ответ на популярный тезис. Разрыв в цене между RTX 3090 и RTX 5090 — $3056, то есть около 136,6 тысячи гривен по курсу НБУ 44,69 грн за доллар на 15 августа 2026. Чтобы отыграть его экономией электричества по 1,96 грн за миллион токенов, нужно сгенерировать около 70 миллиардов токенов. При круглосуточной генерации на скорости 87,5 t/s это больше двадцати пяти лет. Электричество спор между этими картами не решает — решает цена покупки.
Что этот расчёт не учитывает: гарантию (у б/у её нет), риск покупки карты после майнинга, потребление остальной системы и то, что цены на видеопамять сейчас двигаются быстрее, чем выходят статьи. Если карта у вас уже есть и вопрос стоит иначе — «что ей выгоднее поручить», — у нас есть отдельный разбор RTX 5090 в майнинге с той же арифметикой, но для добычи.
Куда упирается скорость: КПД пропускной способности трёх карт
«Генерация упирается в память» — самое частое объяснение в этой теме. Оно верное, но неполное, и проверяется в две строки.
Если на каждый токен читаются все веса модели, то скорость чтения равна tok/s × вес модели. Делим на паспортную пропускную способность и получаем долю, которую карта реально выбирает. Берём Qwen3 8B в 4 битах — 5,14 ГБ в сборке UD-Q4_K_XL, которую источник называет в описании методики (сами строки он подписывает просто Q4_K; между этими двумя вариантами разница в весе около 2%, на вывод она не влияет), при 4k контекста, где KV-кеш ещё мал:Показатель RTX 3090 RTX 4090 RTX 5090 Пропускная способность 936 ГБ/с 1008 ГБ/с 1792 ГБ/с Генерация, Qwen3 8B Q4, 4k 115,3 t/s 141,3 t/s 200,4 t/s Читается фактически 593 ГБ/с 726 ГБ/с 1030 ГБ/с Доля использованной полосы 63% 72% 57%
Самая быстрая карта распоряжается своей памятью хуже двух старших. Преимущество RTX 5090 в 1,78 раза по пропускной способности превращается в 1,42 раза по токенам ровно потому, что её КПД ниже. Это оценка снизу — KV-кеш при 4k мал, но не равен нулю, — однако вывод к этому устойчив: чтобы догнать 4090 по КПД, RTX 5090 пришлось бы читать на четверть больше данных на каждый токен.
Второе наблюдение ломает объяснение с другой стороны. У RTX 4090 пропускная способность больше, чем у RTX 3090, на 7,7%, а генерация быстрее на 13–34% — во всех восьми парах замеров с одного стенда, плюс 18% в открытой таблице llama.cpp на совсем другой модели. Если бы всё решала полоса, прироста сверх 7,7% быть не могло. Значит, работают кеш, вычислительные кернелы и зрелость драйвера — Ampere вышла в 2020 году, Ada в 2022-м, и код под Ada оптимизировали дольше.
Складываем: у 3090 и 4090 генерация упирается в память почти целиком, у 5090 — ещё и в софт. Отсюда и наблюдаемый дрейф цифр во времени: чем зрелее становится код под Blackwell, тем ближе карта к своему потолку. Если вас интересует, как то же самое выглядит на другом вендоре, у нас есть разбор ROCm против CUDA — там зрелость стека решает ещё больше.
FP4 на Blackwell: что ускоряет llama.cpp, а что не меняется
Главный аргумент за 50-ю серию в маркетинге — аппаратная поддержка четырёхбитных вычислений (NVFP4). Смотрим не на слайды, а на цифры в самих pull request’ах.
Общий кернел NVFP4 (pull request #21074) вошёл в llama.cpp 1 апреля 2026. Замеры автора на RTX 5090, обработка промта pp512 до и после:
- Qwen3-0.6B: 33 870 → 42 942 токена в секунду (+26,8%);
- Qwen3.5-4B: 5984 → 13 064 (+118,3%);
- Qwen3.5-27B: 1026 → 2989 (+191,2%);
- Nemotron-3-Nano-30B: 1829 → 7116 (+289,1%).
Генерация в том же замере — 0,99× от прежней. То есть не изменилась вовсе. Второй pull request, #22196, с нативным путём под тензорные ядра Blackwell (смержен 28 апреля 2026), даёт ту же картину на другом железе: обработка промта 506 → 611 токенов в секунду (+20,7%), генерация 12,01 → 11,91.
Независимое подтверждение с другой стороны: в работе про потребительский Blackwell переход с BF16 на NVFP4 на vLLM уронил время до первого токена с 1538 до 450 мс — втрое с лишним. Это ровно та часть работы, которую и ускоряют оба кернела. Заодно там же измерено падение расхода энергии с 403 до 239 Вт·ч на миллион токенов.
Два уточнения, которых нет в обзорах:
- Нативный путь под Blackwell (тот самый #22196) закрыт проверкой на compute capability 12.1, а отдельная заявка на нативные NVFP4-кернелы именно для ветки SM120 (к ней относится RTX 5090) закрыта как «not planned». Автор смерженного кернела прямо пишет, что его версия — «первая базовая поддержка», не SM120-специфичная, и оптимизированный вариант ожидается «как минимум вдвое быстрее».
- RTX 3090 и RTX 4090 модели в формате NVFP4 запустят, но аппаратного ускорения не получат — у Ampere и Ada нет соответствующих блоков. Им достаётся только экономия памяти от четырёх бит, которая у них и так есть в обычных GGUF-квантах.
Практический вывод для того, кто выбирает карту под чат: прибавки в скорости ответа FP4 вам не даст. Он даёт время до первого слова и работу с длинным контекстом. Это ровно тот сценарий, где RTX 5090 и так впереди.
Слабые места этого сравнения: чего чужие замеры не говорят
Обязательный блок честности, без которого весь материал выше стоил бы меньше.
Это не наши замеры. Ни одной из трёх карт у редакции нет. Всё, что в таблицах, — чужие прогоны, у каждого назван стенд, дата и бекенд. Мы сделали одно: свели их к сравнимому виду, выбросили несравнимое и посчитали то, чего никто не считал.
Основной набор цифр — с одного стенда. Больше никто не промерил все три карты одинаково. Это же значит, что цифры Hardware Corner мы не можем проверить вторым источником — только сверить направление с открытой таблицей llama.cpp и Ollama-стендом, снятыми на другом железе. Направление сходится, абсолютные значения — нет.
Методика на карточках GPU не расписана вовсе — она взята из соседней статьи того же издания от 6 ноября 2025. Формально это значит, что стенд мог смениться между ноябрём и мартом, и проверить это невозможно.
У вас будет медленнее, чем в таблице. Стенды собраны на серверных процессорах со 129 и 256 ГБ оперативной памяти. Дома роль играют скорость PCIe, охлаждение (при перегреве карта сбрасывает частоты), фоновая нагрузка на видеопамять от рабочего стола и браузера, и просто другая версия бекенда. Ollama, LM Studio и llama.cpp на одной карте дают разный результат — это тема отдельного разбора.
Цены протухнут первыми. Разброс на 15 августа 2026 по одной и той же RTX 5090 составлял от $2868 до $4599 в зависимости от площадки. Все расчёты цены токена нужно пересчитывать под цену, которую видите вы.
Цифры 50-й серии продолжат расти. Нативные NVFP4-кернелы вошли в llama.cpp только в конце апреля 2026, а RTX 5090 у одного издания за три месяца прибавила 11,7% при том же железе. Любой замер Blackwell старше полугода занижен; замеры Ampere — нет.
Что осталось за рамками сравнения: обучение и дообучение (там расклад другой — важнее объём памяти и поддержка форматов), качество ответов на разных квантах, мультикартовые конфигурации, шум и температуры, а также поведение карт после долгого майнинга — а это про подержанную 3090 самый частый практический риск.
Если после всего этого вы склоняетесь к 5090, у нас есть полная сборка ПК на RTX 5090 под локальный ИИ с подбором комплектующих. Если склоняетесь к тому, чтобы просто начать, — гайд по запуску Llama на своём компьютере объясняет, что именно запускать на любой из трёх.
FAQ
Стоит ли брать RTX 5090 вместо двух подержанных RTX 3090?
Две 3090 дают 48 ГБ против 32 ГБ и стоят на 15 августа 2026 около $2526 против $4319 — фактически цена одной RTX 4090, но с вдвое большим объёмом памяти. Это единственный способ из трёх карт подступиться к моделям на 70 млрд параметров. Но каждая отдельная карта останется медленной на обработке промта, добавятся вторая линия PCIe, 700 Вт под нагрузкой и возня с распределением слоёв. Одна 5090 проще и быстрее в чате, две 3090 дешевле и вместительнее.
Запустится ли модель на 70B параметров на RTX 5090?
Целиком в видеопамять — нет. Плотная модель на 70 млрд параметров даже в четырёх битах весит около 40 ГБ, а у карты 32 ГБ. Формально запустить можно с выгрузкой части слоёв в оперативную память, но скорость падает с десятков токенов в секунду до единиц, и практического смысла в этом мало. Максимум для всех трёх карт — плотная модель на 32–34 млрд параметров в 4 битах.
Насколько RTX 4090 быстрее RTX 3090 в локальных LLM?
На генерации ответа — на 13–34% по восьми парам замеров на одном стенде и на 18% по открытой таблице llama.cpp. На обработке промта — вдвое: 2,06–2,28 раза в тех же замерах. То есть в коротком чате разрыв маленький, а на длинных документах и в поиске по своим файлам — двукратный.
Сколько стоит электричество на миллион токенов дома?
По украинскому тарифу 4,32 грн за кВт·ч (действует до 31 октября 2026) — от 2,6 до 4,6 грн в зависимости от карты, на модели 8B в четырёх битах. Считается так: миллион токенов делим на скорость в токенах в секунду, переводим в часы, умножаем на мощность в киловаттах и на тариф. Разница между самой экономной и самой прожорливой картой — около двух гривен на миллион токенов.
Даёт ли FP4 на RTX 5090 прибавку к скорости в чате?
Практически нет. По цифрам самих pull request’ов в llama.cpp NVFP4 ускоряет обработку промта на 27–289% в зависимости от модели, а генерацию оставляет на уровне 0,99 от прежней. Вы почувствуете это как более быстрый старт ответа, особенно на длинном контексте, но текст после первого слова будет ползти с той же скоростью. RTX 3090 и RTX 4090 аппаратного ускорения FP4 не имеют вовсе.
Почему в разных обзорах у одной карты разная скорость?
Три причины, и все законные. Разные задачи: одиночный чат и сервер на 400 одновременных запросов дают разрыв между картами 1,29 и 2,02 раза соответственно. Разные модели и кванты: 8B в четырёх битах и 32B в четырёх битах отличаются в три-четыре раза. Разное время: поддержка Blackwell в llama.cpp за три месяца прибавила одной и той же RTX 5090 около 12% на том же железе. Поэтому цифру без модели, кванта, контекста, бекенда и даты читать бессмысленно.
