Що сталося
На конференції Hot Chips 2026, що пройшла 23–24 серпня, компанія d-Matrix показала ранній кремній прискорювача Raptor. Його ідея — відмовитися від HBM: замість пам’яті, що стоїть поруч з обчислювальним кристалом, кристали DRAM складають просто під ним. Заявлений результат — близько 100 ТБ/с пропускної здатності за 0,37 пДж на переданий біт.
Деталі
| Показник | Raptor (3D-DRAM) | HBM4 | SRAM |
|---|---|---|---|
| Пропускна здатність на мм² | 32,6 ГБ/с | близько 1,5 ГБ/с | обмежена площею |
| Енергія на біт вводу-виводу | 0,3–0,4 пДж | 2,5–5 пДж | близько 0,05 пДж |
| Потужність на ГБ/с | 2,96 мВт | 40 мВт | приблизно вдесятеро гірше за HBM |
| Ємність | 32 ГБ на карту | залежить від стека | близько 4 ГБ стеля |
Усе впирається в довжину шляху до пам’яті: у HBM сигнал іде сантиметрами через підкладку, у Raptor кристали з’єднані «обличчям до обличчя» з кроком 36 мкм, тобто шлях міліметровий. Звідси й економія: на 100 ТБ/с ввід-вивід витрачає близько 296 Вт. Обчислювальний кристал робить TSMC за нормами N4, партнер із 3D-упаковки — Alchip. Конфігурація із 72 карт, за розрахунками компанії, вміщує передову модель із контекстом на мільйон токенів.
Застереження: цифри поки вендорські, незалежних замірів немає, строків серійного виробництва d-Matrix не називала.
Що це означає
Стосується це всіх, хто платить за інференс — від орендарів хмарних GPU до покупців пам’яті. Вузьке місце сучасних прискорювачів на HBM — не арифметика, а подача ваг із пам’яті: генерація токена читає модель цілком, тому швидкість упирається в пропускну здатність, а розмір моделі — в ємність. Саме через це обсяг пам’яті визначає, що взагалі вдасться запустити.
Масштаб виграшу, якщо цифри підтвердяться: 2,96 мВт на ГБ/с проти 40 мВт у HBM4 — це порядок величини за енергією на ту саму смугу. За вартості електрики в дата-центрі й нинішнього дефіциту HBM така різниця переходить просто в ціну токена.
Чого це не означає: заміни HBM завтра не буде. Показано ранній кремній, а не продукт, і 3D-упаковка додає своїх проблем — насамперед відведення тепла, бо гарячий обчислювальний кристал тепер стоїть впритул до пам’яті, яка перегріву не любить.
Горизонт: наступна точка — заява про серійне виробництво і перші незалежні тести. До них Raptor лишається ставкою на те, що дефіцит HBM триватиме достатньо довго, аби альтернативу встигли довести.
Контекст
Ідея обійти HBM ширяє в галузі не перший місяць: Qualcomm просуває свій підхід із пам’яттю поруч з обчисленням, AMD купила MEXT заради того, щоб флеш працював як DRAM, а SK hynix і Samsung нарощують шари в самій HBM. Причина в усіх одна — пам’ять подорожчала і стала дефіцитом, а попит на інференс зростає швидше, ніж виробництво стеків.


