Коротко: що вирішує вибір між RTX 5090, 4090 і 3090
Власних карт у редакції немає — усе, що нижче, це чужі заміри, зведені до однієї порівнянної таблиці, з паспортом методики біля кожної цифри. Дані і ціни — на 15 серпня 2026.
- Коротко: що вирішує вибір між RTX 5090, 4090 і 3090
- Три карти, два обсяги пам’яті і три ціни: що порівнюємо
- Чиї це заміри: методика джерел і що не потрапило в таблицю
- Швидкість генерації: скільки tok/s дають RTX 5090, 4090 і 3090
- Обробка промта: де RTX 5090 відривається найсильніше
- Що влізає у 24 і 32 ГБ: модель, квант і довжина контексту
- Вати під інференсом: чим реальне споживання відрізняється від TDP
- Ціна одного tok/s: RTX 3090 проти RTX 5090 за серпневими цінами
- Куди впирається швидкість: ККД пропускної здатності трьох карт
- FP4 на Blackwell: що пришвидшує llama.cpp, а що не змінюється
- Слабкі місця цього порівняння: чого чужі заміри не кажуть
- FAQ
- RTX 5090 швидша за RTX 4090 на генерації в 1,2–1,6 раза, а не «втричі». Розкид між джерелами (1,29× в одного, 2,02× в іншого) ширший, ніж різниця між самими картами всередині будь-якого одного заміру.
- Розрив 4090 проти 3090 малий саме там, де ви його відчуваєте: 13–34% на генерації відповіді. Зате на обробці промта 4090 швидша вдвічі — це два різні завдання, і змішувати їх в одну цифру не можна.
- Зайві 8 ГБ у 5090 не відкривають новий клас моделей. Максимум для всіх трьох карт — щільна модель на 32–34 млрд параметрів у 4 бітах. 32 ГБ купують контекст і запас, а не модель наступного розміру.
- За ціною одного tok/s вживана RTX 3090 виграє майже вдвічі: $14,4 проти $26,6 у RTX 5090. Електрика цього розриву не відіграє — розрахунок нижче показує, що на це пішло б понад двадцять п’ять років безперервної генерації.
- Вати під інференсом помітно нижчі за цифру зі специфікації: у RTX 5090 виміряно 353 Вт при заявлених 575 Вт. Карта в генерації не завантажена цілком, вона чекає пам’ять.
- FP4 на 50-й серії пришвидшує обробку промта, а не генерацію. За цифрами самих pull request’ів у llama.cpp: промт +27…+289%, генерація 0,99× — тобто не змінилася.
Три карти, два обсяги пам’яті і три ціни: що порівнюємо
У локальних мовних моделях відеокарта виконує два різні завдання. Перша — обробка промта (prompt processing, prefill): модель разом читає все, що ви їй дали, — питання, історію чату, прикладені документи. Це лічильна робота, і в ній важливі обчислювальні блоки. Друга — генерація (token generation, decode): модель видає відповідь по одному токену, і на кожен токен їй потрібно прочитати з відеопам'яті ваги цілком. Це робота не лічильна, а транспортна, і в ній важлива пропускна здатність пам’яті.
Звідси головне правило вибору: обсяг відеопам’яті вирішує, чи запуститься модель узагалі, а пропускна здатність — з якою швидкістю піде відповідь. Потужність чипа впливає на третю величину — скільки ви чекаєте перед першим словом відповіді.Параметр RTX 3090 RTX 4090 RTX 5090 Архітектура Ampere Ada Lovelace Blackwell Відеопам’ять 24 ГБ GDDR6X 24 ГБ GDDR6X 32 ГБ GDDR7 Шина і швидкість пам’яті 384 біт × 19,5 Гбіт/с 384 біт × 21 Гбіт/с 512 біт × 28 Гбіт/с Пропускна здатність 936 ГБ/с 1008 ГБ/с 1792 ГБ/с Ядра CUDA 10 496 16 384 21 760 Заявлена потужність 350 Вт 450 Вт 575 Вт Ціна б/в на eBay US, 15.08.2026 $1263 $2500 $4319 Ціна нової $1430 (на 15.08) $2899–3380 (на 15.08) $4599 (на 01.08)
Характеристики RTX 5090 взяті з офіційної сторінки NVIDIA: 32 ГБ GDDR7, шина 512 біт, 21 760 ядер, заявлена потужність 575 Вт. Пропускну здатність вендор на сторінці не публікує, тому всі три значення пораховані однаково — з ширини шини і швидкості пам’яті: 512 біт ÷ 8 × 28 Гбіт/с = 1792 ГБ/с. Тим самим способом виходять 1008 ГБ/с у 4090 і 936 ГБ/с у 3090. Це важливо: на картці RTX 3090 в одного з джерел стоїть 986 ГБ/с при швидкості пам’яті 19,5 Гбіт/с — цифра, яка арифметично не виходить.
З таблиці видно те, що далі пояснить майже всі результати. RTX 4090 випереджає RTX 3090 за пропускною здатністю всього на 7,7% — 1008 проти 936 ГБ/с. За обчислювальними блоками розрив у півтора раза. RTX 5090 додає до 4090 одразу 78% пропускної здатності і третину ядер, а разом з ними — третину обсягу пам’яті.
Ціни тут — найнестабільніший рядок таблиці. RTX 5090 при рекомендованій ціні $1999 продавалася 1 серпня 2026 за $4598,90, тобто на 130% вище за рекомендовану; дефіцит пам’яті тримає весь ринок. Якщо ви ще не визначилися з класом заліза взагалі, а не обираєте між цими трьома картами, почніть із нашого гіда з вибору заліза для локального ШІ — він про рівні бюджету, а цей матеріал про цифри всередині одного рівня.
Чиї це заміри: методика джерел і що не потрапило в таблицю
Святе правило цієї рубрики — методика прозора. Цифра «RTX 5090 видає 200 токенів за секунду» без моделі, кванта, довжини контексту і версії бекенда не означає нічого: ті самі 200 токенів на моделі 8B і на моделі 32B відрізняються вп’ятеро, а той самий квант в іншій збірці llama.cpp дає інший результат.
З п’ятнадцяти розібраних матеріалів методику називає шість. Ось їхні паспорти — саме з них узяті всі цифри нижче.Джерело Дата Бекенд Модель і квант Що міряли Які карти Hardware Corner, картки GPU березень 2026 llama.cpp llama-bench, Ubuntu 24.04, CUDA 12.8 Qwen3 8B / 14B / 32B / 30B A3B, Q4_K_XL промт і генерація окремо, 4k–256k усі три Hardware Corner, стаття про стенд 06.11.2025 llama-bench build 466c1911, прапорці -fa 1 -ngl 99, EPYC 7642, 129 ГБ DDR4Q4_K_XL промт 2048 токенів, генерація 128 лише 5090 llama.cpp, гілка результатів CUDA оновлюється llama-bench, git-хеш обов’язковий Llama 2 7B Q4_0 pp512 і tg128 окремо усі три, але різні збірки Databasemart 03.08.2026 Ollama 0.6.5 у 5090, 0.5.4–0.5.7 у 4090 4 біти, 8–10 моделей лише генерація 5090 і 4090, різні ОС CloudRift 09.10.2025 vLLM, 400 одночасних запитів AWQ та INT4, контекст 8192 сумарна пропускна здатність 4090 і 5090 arXiv 2601.09527 14.01.2026 vLLM 0.12, CUDA 12.9, телеметрія DCGM Qwen3-8B у BF16 / W4A16 / NVFP4 пропускна здатність і вати лише 5090
Що відкинуто і чому:
- Десять матеріалів із топу видачі — цілком. Ні моделі, ні кванта, ні контексту, ні бекенда. Найвідвідуваніший із них закритий пейволом, і у відкритій частині в нього 380 слів і одна цифра.
- Твердження «RTX 5090 швидша за RTX 4090 у 3,2 раза». Джерело не називає ні режим, ні модель. З підпису випливає, що 4090 видає близько 56 токенів за секунду на моделі 8B у 4 бітах, тоді як три незалежні заміри з методикою дають 95–141. Цифра не сходиться ні з чим.
- Puget Systems. Лабораторія з прозорою методикою, яку наш профіль рубрики вважає джерелом першого вибору. Відкрити її не вдалося жодним способом (403 і захист від ботів), тому звідти в статті немає жодної цифри.
- Медіанні ціни RTX 50 за серпень від TechPowerUp. Та сама історія: сторінка закрита перевіркою браузера. Ціни взяті у трекерів, які реально відкрилися.
- Рядок gpt-oss 20B. У RTX 5090 він підписаний як Q4_K, у RTX 4090 і RTX 3090 — як MXFP4. Різні формати, порівнювати не можна, хоча рядки стоять у таблицях одного сайту і виглядають однаково.
- Рядки Gemma4 26B і 31B, Qwen3.5 27B і 35B у RTX 4090. У 3090 із тим самим обсягом пам’яті вони є, у 4090 немає, і чому — джерело не пояснює.
- Російськомовний розбір RTX 5090 для інференсу. Мірялася, дослівно, «одна моделька» — без назви, кванта і контексту.
Окреме застереження про найцитованіше джерело ніші. На картці RTX 4090 у Hardware Corner заголовком стоїть «78.7 t/s average on 14B models at 16k context». У таблиці на тій самій сторінці у Qwen3 14B у 4 бітах стоїть 84,4 при 4k і 69,8 при 16k — тобто 78,7 не збігається з жодною колонкою. Там само заявлена обробка промта 4474 t/s, тоді як власний рядок карти дає 3452,3, а от у RTX 5090 значення в цій же комірці — 4473,1. У 3090 і 5090 заголовні цифри зі своїми таблицями збігаються точно, тож дефект поодинокий. Ціна помилки не косметична: із 78,7 виведена ціна одного tok/s ($2200 ÷ 78,7 = $27,95), а за таблицею вийшло б $31,52 — карта виглядає на 11% вигіднішою, ніж за даними самого джерела. Саме 78,7 і розійшлося видачею як «швидкість RTX 4090».
Швидкість генерації: скільки tok/s дають RTX 5090, 4090 і 3090
Генерація — це та швидкість, яку ви бачите очима: як швидко текст повзе екраном. Таблиця нижче — єдиний набір, де всі три карти проміряні одним стендом, одним бекендом і одним квантом. Рядки, де кванти в карт різняться, з неї прибрані.Модель, квант, контекст RTX 3090 RTX 4090 RTX 5090 4090/3090 5090/4090 Qwen3 8B Q4_K, 4k 115,3 141,3 200,4 1,23× 1,42× Qwen3 8B Q4_K, 16k 87,5 108,0 162,3 1,23× 1,50× Qwen3 8B Q4_K, 32k 67,9 82,3 129,8 1,21× 1,58× Qwen3 14B Q4_K, 4k 70,0 84,4 123,8 1,21× 1,47× Qwen3 14B Q4_K, 16k 52,1 69,8 102,7 1,34× 1,47× Qwen3 30B A3B Q4_K, 16k 113,8 139,2 170,4 1,22× 1,22× Qwen3 32B Q4_K, 4k 35,1 39,6 61,4 1,13× 1,55× Qwen3 32B Q4_K, 16k 30,3 34,4 50,9 1,14× 1,48×
Заміри Hardware Corner, оновлення березня 2026; llama-bench, Ubuntu 24.04, CUDA 12.8. Застереження до самого джерела: рядки таблиць воно підписує як Q4_K, а свою методику — як Q4_K_XL; яке з двох позначень точне, видання не пояснює.
Два висновки читаються прямо з колонок співвідношень. RTX 4090 випереджає RTX 3090 на 13–34% — помітно, але це не різниця поколінь у рази. RTX 5090 випереджає RTX 4090 на 22–58%, і найменший розрив на моделі зі змішаними експертами (Qwen3 30B A3B), де на кожен токен читається лише частина ваг.
Тепер те, заради чого ця стаття написана. Візьміть те саме питання — «у скільки разів RTX 5090 швидша за RTX 4090» — і подивіться, що відповідають джерела з методикою.Джерело і режим Що міряли 5090 / 4090 Відкрита таблиця llama.cpp Llama 2 7B Q4_0, tg128, різні збірки 1,29× Hardware Corner, знімок грудня 2025 Qwen3 8B, 16k 1,39× Hardware Corner, знімок березня 2026 Qwen3 8B, 16k 1,50× Databasemart, серпень 2026 llama3.1 8B, Ollama, різні версії бекенда 1,57× CloudRift, жовтень 2025 Qwen3-Coder 30B AWQ, vLLM, 400 запитів 2,02× Відношення пропускної здатності теоретична стеля для генерації 1,78×
Розкид 1,29–2,02 — це не «хтось помилився». Це три різні явища в одній колонці.
Перше: батч змінює розклад. У відкритій таблиці llama.cpp і в Hardware Corner міряють одиночний запит — так працює ваш чат. CloudRift (це провайдер оренди GPU, і швидка карта — частина його продукту, що варто тримати в голові) жене 400 запитів одночасно, і там карта обробляє багато токенів паралельно, тобто впирається вже не в пам’ять, а в обчислювальні блоки, де у Blackwell перевага більша. Опосередковане підтвердження з роботи про споживчий Blackwell: одна RTX 5090 дає 411 токенів за секунду при восьми одночасних запитах і 6894 при ста двадцяти восьми. Це одна й та сама карта.
Друге: цифри рухаються в часі. В одного й того самого видання RTX 5090 на Qwen3 8B при 16k видавала 145,34 t/s у грудні 2025 і 162,3 t/s у березні 2026 — плюс 11,7% при незмінному залізі. У листопаді 2025 на 4k було 186 t/s, у березні — 200,4. А от RTX 3090 у тих самих двох знімках дала 87,45 і 87,5 — тобто не зрушила зовсім. Зростало не залізо, а підтримка Blackwell у llama.cpp. Практичний висновок простий: будь-який замір RTX 5090 старший за пів року занижений, а замір RTX 3090 — ні.
Третє: різні стенди не порівнянні, навіть коли таблиці виглядають однаково. Ollama-заміри серпня зняті на версії 0.6.5 під Ubuntu для 5090 і на версіях 0.5.4–0.5.7 під Windows для 4090, на різних процесорах. У самій публікації про це не сказано жодного слова, і пара має вигляд чесного порівняння.
Обробка промта: де RTX 5090 відривається найсильніше
Друга половина роботи — та, що відбувається до першого слова відповіді. Якщо ви пишете короткі питання в чат, ви її майже не помічаєте. Якщо ви кидаєте моделі файл на сорок сторінок, працюєте з довгою історією або будуєте пошук по документах, то саме вона і є ваш час очікування.Модель, квант, контекст RTX 3090 RTX 4090 RTX 5090 4090/3090 5090/4090 Qwen3 8B Q4_K, 4k 4049,6 9250,5 11 933,4 2,28× 1,29× Qwen3 8B Q4_K, 16k 2572,5 5530,5 8538,4 2,15× 1,54× Qwen3 14B Q4_K, 16k 1678,7 3452,3 4473,1 2,06× 1,30× Qwen3 32B Q4_K, 4k 1087,9 2448,0 2931,3 2,25× 1,20×
Той самий стенд Hardware Corner, березень 2026. Цифри — токени промта за секунду.
Порівняйте колонку «4090/3090» тут і в попередній таблиці. На генерації 4090 швидша за 3090 на 13–34%. На обробці промта — вдвічі, від 2,06 до 2,28 раза. Це і є доказ того, що змішувати два завдання в одну цифру не можна: та сама пара карт відрізняється або на чверть, або вдвічі, залежно від того, що ви робите.
Той самий висновок дає відкрита таблиця llama.cpp на зовсім іншій моделі: на Llama 2 7B у Q4_0 RTX 3090 показує pp512 5174,69 і tg128 158,16, RTX 4090 — 11 992,70 і 186,21, RTX 5090 — 14 751,98 і 239,62. Промт у 4090 вдвічі швидший, ніж у 3090, генерація — на 18%. Застереження самої гілки: рядки надіслані різними учасниками на різних збірках, і результат залежить від драйвера, операційної системи і виробника плати.
Практичний сенс: якщо ваша робота — довгий контекст, різниця між поколіннями значно більша, ніж показує середній огляд. Вживана RTX 3090 на промті відстає вдвічі, і це відчувається на кожному запиті з прикладеним документом. Якщо ж ви пишете короткі питання і читаєте відповідь у міру набору, цією різницею можна знехтувати — там вирішує генерація, а в ній розрив учетверо менший.
Що влізає у 24 і 32 ГБ: модель, квант і довжина контексту
Швидкість обговорювати немає сенсу, поки модель не вміщується в пам’ять: щойно частини ваг їдуть в оперативну пам’ять, лік іде вже не на десятки токенів за секунду, а на одиниці. Порахувати вагу просто. Файл Qwen3 8B у кванті UD-Q4_K_XL важить 5,14 ГБ на вісім із невеликим мільярдів параметрів — тобто близько 0,63 ГБ на кожен мільярд параметрів у чотирьох бітах. У восьми бітах удвічі більше, у BF16 — учетверо.Модель і квант Вага ваг 24 ГБ (3090 і 4090) 32 ГБ (5090) 8B у 4 бітах 5,1 ГБ так, ~18 ГБ лишається під контекст так, ~26 ГБ лишається 8B у 8 бітах 8,7 ГБ так так 8B у BF16 16,4 ГБ так, але контексту майже не лишається так, із запасом 14B у 4 бітах ~9 ГБ так так 32B у 4 бітах ~20 ГБ впритул, довгий контекст не влізе так, ~12 ГБ під контекст 32B у 8 бітах ~35 ГБ ні ні 70B у 4 бітах ~40 ГБ ні ні
Залишок після ваг іде під KV-кеш — пам’ять, де модель тримає вже прочитаний контекст. Він росте лінійно з довжиною, і саме тут зайві 8 ГБ відпрацьовують. Видно це за самими таблицями замірів: у RTX 5090 є колонка на 256 тисяч токенів контексту, у RTX 4090 рядки обриваються на 128 тисячах.
А от чого 32 ГБ не дають — так це наступного класу моделей. У зведенні того самого джерела максимальна модель у всіх трьох карт однакова: 34B. Щільна модель на 70 млрд параметрів навіть у чотирьох бітах потребує близько 40 ГБ і не вміщується в жодну з трьох. Якщо вам потрібно саме 70B, відповідь лежить в іншій площині — дві вживані RTX 3090 дають 48 ГБ дешевше за одну RTX 5090, і це окрема розмова про мультикарту.
Детальну розкладку «скільки пам’яті потрібно кожній конкретній моделі» і розбір того, як просідає якість між 4 і 8 бітами, ми виносимо в окремі матеріали — тут рівно стільки, скільки потрібно для порівняння карт.
Вати під інференсом: чим реальне споживання відрізняється від TDP
Цифра зі специфікації — це стеля, яку карта бере у важкій графіці. У генерації токенів обчислювальні блоки простоюють в очікуванні пам’яті, і реальне споживання помітно нижче.Карта Заявлена потужність Виміряно під інференсом Чим міряли RTX 3090 350 Вт ~333 Вт при ліміті 350 Вт користувацький замір, 28.04.2026, Qwen 3.6 27B, llama-swap RTX 4090 450 Вт заміру не знайшлося — RTX 5090 575 Вт 353 Вт на RAG-навантаженні, 435 Вт при 64 запитах arXiv 2601.09527, 14.01.2026, телеметрія NVIDIA DCGM
RTX 5090 під інференсом їсть 61–76% від заявлених 575 Вт — тобто під блок живлення на кіловат її брати не обов’язково, а під безперервну генерацію й поготів. За RTX 4090 чесного вимірювання знайти не вдалося зовсім: у видачі кочує цифра зі специфікації, до того ж кілька сторінок приписують 4090 ті самі 575 Вт, яких у неї немає (її заявлена потужність 450 Вт).
Окремо корисна крива — що дає обмеження потужності. На RTX 3090 у замірі від 28 квітня 2026 (бекенд llama-swap v199, форк llama.cpp; драйвер NVIDIA 590.48.01; модель Qwen 3.6 27B; генерація есе на 4000 токенів):
- 350 Вт — 32,0 токена за секунду, реально ~333 Вт;
- 300 Вт — 33,0 токена за секунду (швидше!), ~295 Вт;
- 275 Вт — 32,7;
- 250 Вт — 31,7, тобто мінус 1% швидкості при мінус 86 Вт;
- 200 Вт — 20,6, тут карта вже сиплеться;
- 150 Вт — 8,3.
Найкраща ефективність — близько 250–280 Вт: 0,128 токена на ват проти 0,096 на повному ліміті. Практично це означає, що з карти можна зняти сотню ватів майже безкоштовно, а заразом прибрати шум і нагрів. Замір один і користувацький, але з повністю описаною процедурою — команда, пауза на стабілізацію, порядок тестів.
Ціна одного tok/s: RTX 3090 проти RTX 5090 за серпневими цінами
Щоб порівняння було чесним, усі три ціни взяті в одного трекера, одним методом (середня за проданими лотами на eBay US) і в один день — 15 серпня 2026. Інакше вийшло б рівно те, за що ми критикуємо видачу.Показник RTX 3090 RTX 4090 RTX 5090 Ціна б/в, 15.08.2026 $1263 (372 лоти) $2500 (16 лотів) $4319 (68 лотів) Qwen3 8B Q4, 16k — генерація 87,5 t/s 108,0 t/s 162,3 t/s Ціна одного tok/s $14,4 $23,1 $26,6 Qwen3 14B Q4, 16k — генерація 52,1 t/s 69,8 t/s 102,7 t/s Ціна одного tok/s $24,2 $35,8 $42,1 Електрика, грн за мільйон токенів 4,6 3,9 2,6
Порядок карт не змінюється на жодній моделі: RTX 3090 коштує в 1,8 раза менше за одиницю швидкості, ніж RTX 5090. Застереження щодо вибірок: у 3090 середня порахована за 372 оголошеннями, у 4090 — усього за 16, тому її ціна найхиткіша. Другий трекер того самого дня давав 3090 за $1000, а роздрібна ціна RTX 5090 1 серпня була $4598,90 при рекомендованій $1999.
Тепер електрика — аргумент, який у суперечках про вживані карти дістають першим. Розраховуємо за українським тарифом для населення, 4,32 грн за кВт·год (зафіксований до 31 жовтня 2026). Формула відкрита, підставте свої вати:
Гривні за мільйон токенів = (1 000 000 ÷ tok/s ÷ 3600) × потужність у кВт × 4,32
Для RTX 3090: мільйон токенів при 87,5 t/s — це 3,17 години роботи; при виміряних 333 Вт виходить 1,06 кВт·год, тобто 4,57 грн. Для RTX 5090 при 162,3 t/s і виміряних 353 Вт — 1,71 години, 0,60 кВт·год, 2,61 грн. Для RTX 4090 виміряних ватів немає, узятий типовий робочий ліміт 350 Вт: 2,57 години, 0,90 кВт·год, 3,89 грн.
Різниця між найненажерливішою і найощадливішою картою — близько двох гривень на мільйон згенерованих токенів. Мільйон токенів — це сотні тисяч слів зв’язного тексту.
Звідси пряма відповідь на популярну тезу. Розрив у ціні між RTX 3090 і RTX 5090 — $3056, тобто близько 136,6 тисячі гривень за курсом НБУ 44,69 грн за долар на 15 серпня 2026. Щоб відіграти його економією електрики по 1,96 грн за мільйон токенів, треба згенерувати близько 70 мільярдів токенів. При цілодобовій генерації на швидкості 87,5 t/s це понад двадцять п’ять років. Електрика суперечку між цими картами не вирішує — вирішує ціна купівлі.
Чого цей розрахунок не враховує: гарантію (у б/в її немає), ризик купівлі карти після майнінгу, споживання решти системи і те, що ціни на відеопам’ять зараз рухаються швидше, ніж виходять статті. Якщо карта у вас уже є і питання стоїть інакше — «що їй вигідніше доручити», — у нас є окремий розбір RTX 5090 у майнінгу з тією самою арифметикою, але для видобутку.
Куди впирається швидкість: ККД пропускної здатності трьох карт
«Генерація впирається в пам’ять» — найчастіше пояснення в цій темі. Воно правильне, але неповне, і перевіряється у два рядки.
Якщо на кожен токен читаються всі ваги моделі, то швидкість читання дорівнює tok/s × вага моделі. Ділимо на паспортну пропускну здатність і отримуємо частку, яку карта реально вибирає. Беремо Qwen3 8B у 4 бітах — 5,14 ГБ у збірці UD-Q4_K_XL, яку джерело називає в описі методики (самі рядки воно підписує просто Q4_K; між цими двома варіантами різниця у вазі близько 2%, на висновок вона не впливає), при 4k контексту, де KV-кеш іще малий:Показник RTX 3090 RTX 4090 RTX 5090 Пропускна здатність 936 ГБ/с 1008 ГБ/с 1792 ГБ/с Генерація, Qwen3 8B Q4, 4k 115,3 t/s 141,3 t/s 200,4 t/s Читається фактично 593 ГБ/с 726 ГБ/с 1030 ГБ/с Частка використаної смуги 63% 72% 57%
Найшвидша карта розпоряджається своєю пам’яттю гірше за двох старших. Перевага RTX 5090 в 1,78 раза за пропускною здатністю перетворюється на 1,42 раза за токенами рівно тому, що її ККД нижчий. Це оцінка знизу — KV-кеш при 4k малий, але не дорівнює нулю, — однак висновок до цього стійкий: щоб наздогнати 4090 за ККД, RTX 5090 довелося б читати на чверть більше даних на кожен токен.
Друге спостереження ламає пояснення з іншого боку. У RTX 4090 пропускна здатність більша, ніж у RTX 3090, на 7,7%, а генерація швидша на 13–34% — в усіх восьми парах замірів з одного стенда, плюс 18% у відкритій таблиці llama.cpp на зовсім іншій моделі. Якби все вирішувала смуга, приросту понад 7,7% бути не могло. Отже, працюють кеш, обчислювальні кернели і зрілість драйвера — Ampere вийшла 2020 року, Ada 2022-го, і код під Ada оптимізували довше.
Складаємо: у 3090 і 4090 генерація впирається в пам’ять майже цілком, у 5090 — ще й у софт. Звідси й спостережуваний дрейф цифр у часі: що зріліший стає код під Blackwell, то ближча карта до своєї стелі. Якщо вас цікавить, як те саме має вигляд в іншого вендора, у нас є розбір ROCm проти CUDA — там зрілість стека вирішує ще більше.
FP4 на Blackwell: що пришвидшує llama.cpp, а що не змінюється
Головний аргумент за 50-ту серію в маркетингу — апаратна підтримка чотирибітних обчислень (NVFP4). Дивимося не на слайди, а на цифри в самих pull request’ах.
Загальний кернел NVFP4 (pull request #21074) увійшов у llama.cpp 1 квітня 2026. Заміри автора на RTX 5090, обробка промта pp512 до і після:
- Qwen3-0.6B: 33 870 → 42 942 токени за секунду (+26,8%);
- Qwen3.5-4B: 5984 → 13 064 (+118,3%);
- Qwen3.5-27B: 1026 → 2989 (+191,2%);
- Nemotron-3-Nano-30B: 1829 → 7116 (+289,1%).
Генерація в тому самому замірі — 0,99× від попередньої. Тобто не змінилася зовсім. Другий pull request, #22196, із нативним шляхом під тензорні ядра Blackwell (змерджений 28 квітня 2026), дає ту саму картину на іншому залізі: обробка промта 506 → 611 токенів за секунду (+20,7%), генерація 12,01 → 11,91.
Незалежне підтвердження з іншого боку: у роботі про споживчий Blackwell перехід з BF16 на NVFP4 на vLLM зронив час до першого токена з 1538 до 450 мс — утричі з гаком. Це рівно та частина роботи, яку й пришвидшують обидва кернели. Заразом там само виміряно падіння витрати енергії з 403 до 239 Вт·год на мільйон токенів.
Два уточнення, яких немає в оглядах:
- Нативний шлях під Blackwell (той самий #22196) закритий перевіркою на compute capability 12.1, а окрема заявка на нативні NVFP4-кернели саме для гілки SM120 (до неї належить RTX 5090) закрита як «not planned». Автор змердженого кернела прямо пише, що його версія — «перша базова підтримка», не SM120-специфічна, і оптимізований варіант очікується «щонайменше вдвічі швидшим».
- RTX 3090 і RTX 4090 моделі у форматі NVFP4 запустять, але апаратного прискорення не отримають — у Ampere і Ada немає відповідних блоків. Їм дістається лише економія пам’яті від чотирьох біт, яка в них і так є у звичайних GGUF-квантах.
Практичний висновок для того, хто обирає карту під чат: прибавки у швидкості відповіді FP4 вам не дасть. Він дає час до першого слова і роботу з довгим контекстом. Це рівно той сценарій, де RTX 5090 і так попереду.
Слабкі місця цього порівняння: чого чужі заміри не кажуть
Обов’язковий блок чесності, без якого весь матеріал вище коштував би менше.
Це не наші заміри. Жодної з трьох карт у редакції немає. Усе, що в таблицях, — чужі прогони, у кожного названо стенд, дату і бекенд. Ми зробили одне: звели їх до порівнянного вигляду, викинули непорівнянне і порахували те, чого ніхто не рахував.
Основний набір цифр — з одного стенда. Більше ніхто не проміряв усі три карти однаково. Це ж означає, що цифри Hardware Corner ми не можемо перевірити другим джерелом — лише звірити напрямок із відкритою таблицею llama.cpp і Ollama-стендом, знятими на іншому залізі. Напрямок збігається, абсолютні значення — ні.
Методика на картках GPU не розписана зовсім — вона взята із сусідньої статті того самого видання від 6 листопада 2025. Формально це означає, що стенд міг змінитися між листопадом і березнем, і перевірити це неможливо.
У вас буде повільніше, ніж у таблиці. Стенди зібрані на серверних процесорах зі 129 і 256 ГБ оперативної пам’яті. Удома роль відіграють швидкість PCIe, охолодження (при перегріві карта скидає частоти), фонове навантаження на відеопам’ять від робочого столу і браузера, і просто інша версія бекенда. Ollama, LM Studio і llama.cpp на одній карті дають різний результат — це тема окремого розбору.
Ціни протухнуть першими. Розкид на 15 серпня 2026 по одній і тій самій RTX 5090 становив від $2868 до $4599 залежно від майданчика. Усі розрахунки ціни токена треба перераховувати під ціну, яку бачите ви.
Цифри 50-ї серії продовжать зростати. Нативні NVFP4-кернели увійшли в llama.cpp лише наприкінці квітня 2026, а RTX 5090 в одного видання за три місяці додала 11,7% на тому самому залізі. Будь-який замір Blackwell старший за пів року занижений; заміри Ampere — ні.
Що лишилося поза межами порівняння: навчання і донавчання (там розклад інший — важливіші обсяг пам’яті і підтримка форматів), якість відповідей на різних квантах, мультикартові конфігурації, шум і температури, а також поведінка карт після довгого майнінгу — а це про вживану 3090 найчастіший практичний ризик.
Якщо після всього цього ви схиляєтеся до 5090, у нас є повна збірка ПК на RTX 5090 під локальний ШІ з підбором комплектуючих. Якщо схиляєтеся до того, щоб просто почати, — гайд із запуску Llama на власному комп’ютері пояснює, що саме запускати на будь-якій із трьох.
FAQ
Чи варто брати RTX 5090 замість двох вживаних RTX 3090?
Дві 3090 дають 48 ГБ проти 32 ГБ і коштують на 15 серпня 2026 близько $2526 проти $4319 — фактично ціна однієї RTX 4090, але з удвічі більшим обсягом пам’яті. Це єдиний спосіб із трьох карт підступитися до моделей на 70 млрд параметрів. Але кожна окрема карта лишиться повільною на обробці промта, додадуться друга лінія PCIe, 700 Вт під навантаженням і морока з розподілом шарів. Одна 5090 простіша і швидша в чаті, дві 3090 дешевші і місткіші.
Чи запуститься модель на 70B параметрів на RTX 5090?
Цілком у відеопам’ять — ні. Щільна модель на 70 млрд параметрів навіть у чотирьох бітах важить близько 40 ГБ, а в карти 32 ГБ. Формально запустити можна з вивантаженням частини шарів в оперативну пам’ять, але швидкість падає з десятків токенів за секунду до одиниць, і практичного сенсу в цьому мало. Максимум для всіх трьох карт — щільна модель на 32–34 млрд параметрів у 4 бітах.
Наскільки RTX 4090 швидша за RTX 3090 у локальних LLM?
На генерації відповіді — на 13–34% за вісьмома парами замірів на одному стенді і на 18% за відкритою таблицею llama.cpp. На обробці промта — вдвічі: 2,06–2,28 раза в тих самих замірах. Тобто в короткому чаті розрив малий, а на довгих документах і в пошуку по своїх файлах — дворазовий.
Скільки коштує електрика на мільйон токенів удома?
За українським тарифом 4,32 грн за кВт·год (діє до 31 жовтня 2026) — від 2,6 до 4,6 грн залежно від карти, на моделі 8B у чотирьох бітах. Обчислюється так: мільйон токенів ділимо на швидкість у токенах за секунду, переводимо в години, множимо на потужність у кіловатах і на тариф. Різниця між найощадливішою і найненажерливішою картою — близько двох гривень на мільйон токенів.
Чи дає FP4 на RTX 5090 прибавку до швидкості в чаті?
Практично ні. За цифрами самих pull request’ів у llama.cpp NVFP4 пришвидшує обробку промта на 27–289% залежно від моделі, а генерацію лишає на рівні 0,99 від попередньої. Ви відчуєте це як швидший старт відповіді, особливо на довгому контексті, але текст після першого слова повзтиме з тією самою швидкістю. RTX 3090 і RTX 4090 апаратного прискорення FP4 не мають зовсім.
Чому в різних оглядах в однієї карти різна швидкість?
Три причини, і всі законні. Різні завдання: одиночний чат і сервер на 400 одночасних запитів дають розрив між картами 1,29 і 2,02 раза відповідно. Різні моделі і кванти: 8B у чотирьох бітах і 32B у чотирьох бітах відрізняються у три-чотири рази. Різний час: підтримка Blackwell у llama.cpp за три місяці додала одній і тій самій RTX 5090 близько 12% на тому самому залізі.
