ROCm против CUDA: где Radeon уже догнал GeForce, а где вы потеряете выходные на настройку

24 мин. чтения
Bybit
SpaceX за крипту
Дробные доли · 24/7
Открыть рынок →

Коротко

Ответ «брать Radeon или GeForce» перестал быть общим. Он распадается на три разных ответа в зависимости от того, что именно вы собираетесь запускать.

  • Гонять готовые языковые модели (llama.cpp, Ollama, LM Studio) — Radeon уже полноценный вариант. Более того, для этой задачи ROCm часто вообще не нужен: бэкенд Vulkan работает на обычном графическом драйвере и в открытом скорборде llama.cpp обгоняет нативный ROCm на той же карте.
  • Дообучать модели (LoRA, QLoRA) — разрыв ещё есть, но он сокращается на глазах: базовая библиотека квантования bitsandbytes официально поддерживает ROCm, а в популярный Unsloth поддержку AMD предложили правками от 25 июля 2026 года, которые пока ждут ревью мейнтейнера.
  • Держать продакшн-подачу, работать с диффузией как основной задачей или сидеть на Windows — здесь NVIDIA по-прежнему заметно впереди, и это не вопрос упрямства.

Главный подвох в цене: сравнивать доллары за гигабайт видеопамяти без даты бессмысленно. Из-за дефицита памяти к июлю 2026 года ценники разъехались у обеих экосистем, а розничная цена RTX 5090 больше чем вдвое превышает официальную рекомендованную.

Что такое ROCm и почему сравнение не бинарное

CUDA — закрытая программная платформа NVIDIA: драйвер, компилятор, библиотеки и, главное, почти два десятилетия накопленного кода, который написан именно под неё (платформа вышла в 2007 году). Когда говорят «эта штука работает только на NVIDIA», речь почти всегда про CUDA.

ROCm (Radeon Open Compute) — открытый ответ AMD: тот же слой драйвера, компилятора и библиотек, но с открытым исходным кодом. Внутри него живёт HIP — язык и API, намеренно сделанные почти зеркальными к CUDA, чтобы код переносился с минимальной правкой.

BYBIT EARNЗаставь крипту работатьПроценты на USDT и BTC без блокировки — деньги остаются под рукой.Разместить

Важная деталь, которую пропускают почти все сравнения: между вами и видеокартой стоит не только «ROCm или CUDA», но и бэкенд конкретной программы. Одна и та же llama.cpp умеет считать через CUDA, через ROCm/HIP и через Vulkan — обычный графический интерфейс, который есть в системе и так. Поэтому вопрос «rocm vs cuda» на практике часто оказывается вопросом «какой бэкенд включить», а не «какую карту купить».

Какие Radeon официально поддержаны

Список поддержанных карт для ROCm 7.2 под Linux (релиз от 21 января 2026 года, подтверждён матрицей совместимости AMD от 28 мая 2026 года):

ПоколениеКарты в официальном спискеЧего в списке нет
RDNA 4RX 9070, RX 9070 XT, RX 9070 GRE, RX 9060 XT, Radeon AI PRO R9700
RDNA 3RX 7900 XTX, RX 7900 XT, RX 7900 GRE, RX 7800 XT, RX 7700 XT, PRO W7900, PRO W7800, PRO W7700RX 7600 и младше
APUлинейка Ryzen AI Max и Ryzen AI HX

Два практических вывода. Первый: бюджетный порог входа — RX 7700 XT, всё что ниже официально не поддержано, и «оно вроде запускается» здесь означает «вы сами себе техподдержка». Второй: 16-гигабайтные карты вроде RX 7800 XT в списке есть — то есть заходить в тему можно и не с топового железа.

Windows. ROCm 7.2 впервые свёл Windows и Linux в один релиз и один установщик для Radeon и Ryzen. Но независимые обзоры на июль 2026 года по-прежнему называют путь через Windows экспериментальным для большинства инструментов работы с языковыми моделями. Формально поддержка есть, практически основная дорога — Linux.

Софт-стек: три разные картины зрелости

Ошибка большинства обзоров — говорить «ROCm созрел» или «ROCm сырой» целиком. На деле зрелость сильно отличается по типу задачи. Опорная точка — релиз ROCm 7.14 от 15 июля 2026 года, первый производственный выпуск на новой системе сборки.

ЗадачаСостояние на ROCmЧто это значит на практике
Запуск LLM (llama.cpp, Ollama)Работает, в том числе на Windows и на Ryzen под LinuxСтавится и считает; для многих сценариев ROCm можно вообще обойти через Vulkan
Продакшн-подача (vLLM, SGLang)vLLM заведён на Ryzen под Linux; SGLang впервые появился на Radeon в 7.14Свежая функциональность. Для домашних экспериментов годится, для боевой нагрузки — рано
Диффузия (ComfyUI, Stable Diffusion)ComfyUI охватывает RX 7000 и 9000 под Linux и Windows; SD 3.5 и Chroma провалидированыЗаработает, но экосистема расширений и оптимизаций писалась под CUDA
Квантование и дообучение (bitsandbytes)Официальная поддержка ROCm наравне с CUDA, Intel XPU, Apple Silicon и GaudiОтдельный раздел установки в документации, а не форк энтузиаста
Дообучение через UnslothПравки под ROCm предложены 25 июля 2026 года, на конец июля не влитыСамое подвижное звено. Работать будет только со сборкой из ветки авторов правок

Про последнюю строку стоит сказать отдельно, потому что она хорошо показывает, в каком состоянии находится экосистема дообучения. 25 июля 2026 года в репозиторий unsloth-zoo пришли три предложения правок: набор тестов совместимости с ROCm, подсказка по механизму внимания для AMD вместе с помощником по расходу видеопамяти и руководство по оптимизации с замерами. Все три на конец июля висят открытыми и ждут ревью мейнтейнера — то есть в официальном релизе библиотеки поддержки AMD ещё нет, работать она будет только у того, кто соберёт код из ветки авторов.

Важно и то, что это не «внезапный прорыв на этой неделе», как подают некоторые пересказы: правки под ROCm в этот репозиторий вливались и раньше, в том числе поддержка ROCm под Windows. Речь о постепенном накоплении, а не о рубильнике.

BYBIT COPY TRADINGКопитрейдинг на BybitОткрытая статистика трейдеров, старт с $10, отключение в один клик.Выбрать трейдера

Мораль для покупателя: проверяйте статус конкретной правки, а не заголовок новости. Именно раздел дообучения устаревает быстрее всего, и разница между «предложено» и «влито в релиз» — это разница между рабочим вечером и неделей возни.

Скрытый козырь: Vulkan вместо ROCm

Это самый неожиданный результат ресёрча, и в мейнстримных сравнениях его почти нет.

В открытом скорборде llama.cpp (модель Llama 2 7B, квантование Q4_0, без Flash Attention) одна и та же RX 7900 XTX показывает:

Карта и бэкендГенерация, токенов/с
RX 7900 XTX, Vulkan191,3
RTX 4090, CUDA186,2
RX 7900 XTX, ROCm/HIP167,1

То есть на этом конкретном тесте Vulkan оказался быстрее родного ROCm на той же карте — и практически сравнялся с RTX 4090 на CUDA. Phoronix независимо отмечает, что llama.cpp с Vulkan обгоняет вычислительный стек AMD в части тестов языковых моделей не первый раз.

Практический смысл: если ваша задача — только запускать готовые модели, ROCm можно не устанавливать вовсе. Vulkan едет на обычном графическом драйвере, который уже стоит в системе. Стандартный совет «сначала помучайся с установкой ROCm, потом считай» для этого сценария просто неверен.

Оговорка обязательна: это не значит, что Vulkan быстрее всегда. Он не покрывает обучение, не даёт того же набора библиотек и на другой модели или другом квантовании расклад может перевернуться. Но как первая попытка он и проще, и часто быстрее.

Производительность: почему цифры расходятся вдвое

Здесь начинается самое честное и самое неудобное. Три независимых источника меряют одну и ту же пару карт — RX 7900 XTX против RTX 4090 — и получают принципиально разные ответы.

МетодикаМодель и условияRX 7900 XTX к RTX 4090
LocalScore (краудсорсинг, разные машины пользователей)Llama 3.1 8B Instruct Q4_K_M≈50% (45,3 против 90,3 токенов/с)
Открытый скорборд llama.cppLlama 2 7B Q4_0, бэкенд HIP≈90% (167,1 против 186,2 токенов/с)
Сводная таблица craftrigs.comLlama 3.1 8B Q4_K_M, ROCm 6.2.4, переменная HSA_OVERRIDE_GFX_VERSION, Flash Attention≈88% (125 токенов/с на 8B, 12,4 на 70B)

Ни один из источников не врёт. Разница в том, что меняется всё сразу: модель, квантование, бэкенд, флаги запуска и качество конкретной пользовательской сборки. Краудсорсинговая база собирает машины «как есть», включая неоптимальные конфигурации; скорборд и сводная таблица — заведомо настроенные стенды.

Отсюда третий вывод статьи, который стоит дороже любой отдельной цифры: чужой бенчмарк говорит о чужой конфигурации. Если вы выбираете карту под конкретную модель, ищите замер именно на ней, а лучше закладывайте время на собственную проверку.

Свежий пример из сообщества той же природы: 9 июля 2026 года участник r/ROCm сообщил, что получил на паре Radeon AI PRO R9700 около 26,5 токена в секунду на Qwen3.6-27B в FP8. Это сообщение пользователя, а не проверенный нами замер, и на вашу сборку оно автоматически не переносится — но показывает, что на свежем железе люди уже считают.

Средний сегмент. Club386 на собственном стенде сравнил RX 9070 XT и RTX 5070 Ti. В Geekbench AI разрыв оказался всего 7,4% в пользу NVIDIA. Но в Procyon AI, где генерация текста опирается на нативную поддержку CUDA, RTX 5070 Ti оказалась более чем вдвое быстрее. Это ровно та ситуация, ради которой стоит смотреть на бэкенд: разрыв создаёт не кремний, а то, подо что написан тест.

Цена за гигабайт видеопамяти

Видеопамять — жёсткий потолок: не влезла модель, значит не влезла, никакая скорость не поможет. Поэтому главная валюта здесь — доллары за гигабайт.

Проблема в том, что к июлю 2026 года эти доллары поехали. Микросхемы памяти дают больше 80% себестоимости видеокарты, а дата-центры под ИИ выгребают производство, и розница отвязалась от рекомендованных цен.

КартаVRAMЦена и дата срезаНаш расчёт $/ГБ
RX 7900 XTX24 ГБ$747 (маркетплейсы, 1 июля 2026)≈$31
RX 7900 XTX24 ГБ$1100–1400 новая, $750–850 б/у (розница, конец мая — июнь 2026)≈$46–58 / ≈$31–35
RX 9070 XT16 ГБ$607 (маркетплейсы, 1 июля 2026) при рекомендованной $599≈$38
RTX 5070 Ti16 ГБ≈$861–899 (рекомендованная $749 плюс 15–20%)≈$54–56
RTX 508016 ГБ≈$1149–1199 (рекомендованная $999 плюс 15–20%)≈$72–75
RTX 509032 ГБ≈$4329 на Amazon (11 июля 2026) при рекомендованной $1999, премиальные версии выше $5000≈$135
RTX 4090, б/у24 ГБ$1800–2700 (снята с производства в октябре 2024)≈$75–113
RTX 3090, б/у24 ГБ$600 (апрель 2026) — ≈$1000 (июль 2026)≈$25–42

Долларовые значения за гигабайт посчитаны нами из приведённых цен и объёмов памяти; сами цены — из источников с датой среза.

Два честных предупреждения по этой таблице. Первое: цена RX 7900 XTX расходится между источниками почти в два раза — маркетплейсовый минимум и розничный прайс это разные вещи, и снимались они в разные недели на растущем рынке. Второе: по линейке RX 9000 источники прямо противоречат друг другу. Обзор рынка от tech-insider фиксирует у RX 9070 XT два повышения с момента запуска суммарно на 10–15% и обещает новые, а сводка gpupoet в том же июле находит карту по $607, то есть практически по рекомендованной цене, и отмечает падение младшей RX 9070 на 18% к предыдущему месяцу. Скорее всего, дело в методике: прайс-листы партнёров против фактических сделок на площадках. Мы взяли в таблицу цифру фактической сделки как более близкую к тому, что увидит покупатель, но держите в голове, что заявленные прайсы выше.

Если убрать шум, картина такая: по деньгам за гигабайт памяти б/у RTX 3090 и RX 7900 XTX стоят рядом и заметно впереди всего актуального модельного ряда NVIDIA. Отдельный разбор сборки на RX 7900 XTX под локальные модели, с ценами и конфигурацией целиком, у нас есть в материале про 24 гигабайта за полцены RTX 4090 на ROCm — здесь же нас интересует именно платформа.

Что даёт ROCm.ai и почему его проценты не про вашу карту

23 июля 2026 года AMD представила ROCm.ai — надстройку над стеком из трёх частей: командной строки ROCm CLI, набора AMD Skills (готовые компетенции об AMD для ИИ-помощников Claude, Cursor, Codex и Gemini) и Hyperloom, агента автоматической оптимизации инференса. Общая доступность заявлена с августа 2026 года; по независимому изложению ITdaily, охват — от дата-центров до клиентских ПК.

Из анонса разошлись по заголовкам цифры: в среднем 3,3 раза на инференсе и 2,4 раза на обучении. Прежде чем закладывать их в решение о покупке, прочитайте сноску AMD.

Эти замеры сделаны лабораторией AMD 7 июля 2026 года на восьмипроцессорной серверной платформе Supermicro с ускорителями Instinct MI355X, и базой сравнения выступает ROCm 7.0. То есть:

  • это не потребительский Radeon, а датацентровый ускоритель Instinct стоимостью в порядки дороже;
  • это не сравнение с CUDA, а сравнение AMD со своей же предыдущей версией.

Ни одной независимой публикации, подтверждающей такой эффект на игровой видеокарте, на 30 июля 2026 года нет. ROCm.ai — это в первую очередь инструментарий разработчика: он снижает не время счёта, а время «пока оно вообще заведётся». Ставка разумная, но пока это заявка. Как только выйдет сборка, картину придётся пересматривать по фактическим замерам.

Сколько времени вы реально потратите

Деньги — не единственная валюта. Вторая — ваши часы, и по ним разрыв виден отчётливее, чем по токенам в секунду.

  • Только инференс через Vulkan. ROCm не нужен, работает на штатном графическом драйвере. Затраты — как у NVIDIA, то есть близко к нулю.
  • PyTorch и дообучение под Linux. Практики сходятся на оценке в 2–4 часа на чистую установку с учётом типовых граблей. И это оценка для случая, когда всё пошло по плану.
  • Windows. Формально поддержан с ROCm 7.2, практически по-прежнему называется экспериментальным для большинства LLM-инструментов. Если Windows у вас не обсуждается — считайте, что серьёзной работы с моделями на Radeon там пока нет.

Отдельная статья расходов — обновления. Одна из самых неприятных особенностей стека в том, что рабочая конфигурация может сломаться от штатного апдейта системы.

Риски и слабые места

Это не абстрактные «возможные сложности», а открытые задачи в публичном трекере ROCm с датами.

  • Сбой при работе с несколькими картами (ROCm/ROCm #6290, открыт 21 мая 2026, пара RX 9070 XT): менеджер памяти путает видеопамять и системную, драйвер обращается к неотображённой области и падает. Для того, кто планирует собрать пару карт ради суммарной памяти, это прямой риск.
  • Деградация после обновления (#6369, открыт 19 июня 2026): после апдейта до ROCm 7.2.4 вместе с прошивками кэш вычислительных ядер перестал работать, и один прогон инференса стал занимать около 385 секунд вместо примерно 6. Замедление в 64 раза без единой правки в вашем коде.
  • Аварийное завершение на ROCm 7.2.1 (#6269, открыт 17 мая 2026) — ошибка защиты памяти.
  • Свежее железо ломается первым (unslothai/unsloth #7307, 21 июля 2026): предсобранный сервер для RDNA 4 падал при старте из-за порядка загрузки библиотек. Здесь важен и обратный сигнал: автор нашёл причину, мейнтейнер подтвердил исправление, и всё закрылось за считаные дни. Экосистема живая.

Честный противовес: у NVIDIA свои болячки, и её стек не «просто работает» по волшебству. Разница в том, что у CUDA гораздо больше людей уже наступили на те же грабли и написали, как их обойти. Вы платите не за скорость — вы платите за вероятность встретить проблему, которую до вас никто не описал.

Когда Radeon сегодня брать не стоит

Явный список, а не общая фраза «CUDA зрелее».

  1. Дообучение моделей — ваша основная работа, а не хобби. Базовый слой есть, но в популярных надстройках поддержка AMD местами ещё не доехала до релиза: правки в Unsloth от 25 июля 2026 года на конец месяца не влиты. Если от этого зависит рабочий процесс, вы станете тестировщиком.
  2. Продакшн-подача через vLLM или SGLang. SGLang доехал до Radeon только в релизе 7.14 (15 июля 2026). Для боевой нагрузки это слишком свежо.
  3. Диффузия как главная задача. ComfyUI и SD 3.5 запускаются, но экосистема расширений, ускорителей внимания и готовых рецептов писалась под CUDA, и подбирать замены придётся вручную.
  4. Windows без вариантов. См. выше: экспериментальный статус — это не формальность.
  5. Вам нужно, чтобы заработало сегодня вечером. Если нет желания читать трекер багов и держать заметки по своей конфигурации, переплата за GeForce покупает вам предсказуемость.

И обратный список — когда Radeon уместен: вы гоняете готовые модели, вам важен объём памяти на доллар, вы работаете под Linux и морально готовы, что раз в полгода обновление что-нибудь сломает.

Альтернативы, о которых стоит знать

Intel Arc. По ранжированию gpupoet на 1 июля 2026 года карты Arc B570 ($215, 203 TOPS INT8, 10 ГБ) и Arc B580 ($248, 233 TOPS, 12 ГБ) лидируют по цене за единицу вычислений среди всего протестированного — обгоняя и NVIDIA, и AMD. Оговорка ровно та же, что была у AMD три года назад: стек oneAPI и IPEX-LLM работает, но зрелость ниже, а памяти на борту мало для крупных моделей.

Процессоры с общей памятью. Отдельная дорога — не дискретная карта, а APU, где видеоядру доступна системная память. Это снимает потолок VRAM ценой пропускной способности. Мы разбирали такой путь на примерах Ryzen AI Max+ 395 — вариант для тех, кому важнее уместить большую модель, чем получить максимум токенов в секунду.

Apple Silicon. Логика та же, что у APU: память общая, и модель, которая не влезает в 24 гигабайта видеопамяти, спокойно живёт в оперативной. Свой стек — MLX и Metal — развивается активно, а llama.cpp и Ollama работают из коробки. Расплата двойная: пропускная способность памяти ниже, чем у дискретной карты сопоставимой цены, а дообучение и совместимость с библиотеками, написанными под CUDA, ещё уже, чем на ROCm. Это вариант «запускать, а не разрабатывать».

Аренда вычислений. При эпизодической нагрузке аренда почти всегда дешевле покупки. Своё железо выигрывает, когда карта загружена регулярно или когда данные не должны покидать вашу машину.

Что устареет в этой статье первым

  • Цены. Дефицит памяти движет их каждый месяц, и разброс между источниками уже сейчас достигает полутора-двух раз. Сверяйтесь с рыночными сводками на дату покупки.
  • Состояние дообучения. Самое быстро меняющееся место: правки под ROCm в Unsloth поданы 25 июля 2026 года и ждут ревью — как только их вольют, этот раздел статьи придётся читать с поправкой. Проверять стоит статус самих правок в репозитории, а не пересказы новостей.
  • ROCm.ai. С августа 2026 года начнётся общая доступность, и заголовочные цифры наконец можно будет проверить независимо — в том числе на потребительских картах, если AMD туда его действительно доведёт.

Частые вопросы

Можно ли запустить локальную модель на Radeon вообще без ROCm? Да, если речь про инференс в llama.cpp, Ollama или LM Studio. Бэкенд Vulkan работает на штатном графическом драйвере, установка ROCm не требуется. В открытом скорборде llama.cpp RX 7900 XTX на Vulkan показала 191,3 токена в секунду против 167,1 на ROCm — то есть отказ от ROCm не только упрощает жизнь, но и не обязательно стоит вам производительности.

Насколько RX 7900 XTX медленнее RTX 4090 в языковых моделях? От «вдвое» до «почти столько же» — в зависимости от методики. Краудсорсинговая база LocalScore даёт около 50% на Llama 3.1 8B Q4_K_M, открытый скорборд llama.cpp — около 90% на Llama 2 7B Q4_0, сводная таблица настроенного стенда — около 88%. Корректный вывод: цифру нужно искать под вашу модель и ваш бэкенд, единого ответа нет.

Работает ли PyTorch на AMD? Да, есть отдельные сборки PyTorch под ROCm, и в связке с ними официально поддержана bitsandbytes — библиотека квантования, на которой держится QLoRA. Разница между PyTorch на CUDA и на ROCm сегодня не в том, «запустится или нет», а в том, сколько вокруг готовых рецептов и как быстро находится решение, когда что-то ломается.

Заведётся ли ROCm на RX 7600 или другой карте не из списка? Формально нет: официальная поддержка начинается с RX 7700 XT, всё что младше в перечне ROCm 7.2 отсутствует. На практике энтузиасты запускают стек и на неподдержанных чипах через переменную HSA_OVERRIDE_GFX_VERSION, но это режим «сам себе техподдержка»: обновление драйвера или ROCm может сломать сборку в любой момент, и жалоба в трекер по неподдержанной карте закрывается без разбора.

Дают ли обещанные AMD 3,3 раза прирост моей видеокарте? Нет оснований так считать. Эти цифры получены лабораторией AMD 7 июля 2026 года на серверной платформе с восемью ускорителями Instinct MI355X, а базой сравнения выступает предыдущая версия ROCm 7.0, а не CUDA. К потребительским Radeon они прямого отношения не имеют, независимых подтверждений на игровых картах на конец июля 2026 года нет.

Что дешевле в пересчёте на гигабайт видеопамяти? По ценам июля 2026 года впереди б/у RTX 3090 (примерно $25–42 за гигабайт) и RX 7900 XTX (примерно $31–58 в зависимости от канала продажи). Актуальный ряд NVIDIA заметно дороже: RTX 5070 Ti — около $54–56, RTX 5080 — около $72–75, RTX 5090 — около $135 за гигабайт. Расчёт наш, исходные цены с датами приведены в таблице выше.

BYBIT · СПОТ И ФЬЮЧЕРСЫ
Крипта с нуля
Комиссия 0,1%, торги 24/7, старт с $10
Открыть счёт
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.