Що сталося
26 серпня 2026 року корейська XCENA представила на конференції Hot Chips 2026 архітектуру та заміри свого чипа MX1 — «обчислювальної пам’яті» на шині CXL. CXL (Compute Express Link) — це стандарт, який дає змогу під’єднувати до сервера додаткову пам’ять через слот PCIe, як відеокарту. MX1 поєднує в одному пристрої три речі: до 2 ТБ DDR5, SSD у ролі повільної пам’яті та 3072 маленькі ядра RISC-V, які обробляють дані там, де вони лежать. Масове виробництво компанія планує до кінця 2026 року, перший виторг — у 2027-му.
Деталі
| Параметр | Значення |
|---|---|
| Інтерфейс | CXL 3.2 поверх PCIe 6.0, пристрій CXL Type 3 |
| Пам’ять | до 2 ТБ DDR5-8400, чотири канали |
| Ядра | 3072 in-order RISC-V (24 підсистеми по 128 ядер), техпроцес Samsung 4 нм |
| Векторні блоки | близько 3 TFLOPS FP32/FP16 на скалярних добутках |
| SSD-ярус | InfiniteMemory: SSD видно як байт-адресовану пам’ять, гарячі сторінки по 64 КБ кешуються в DRAM |
| Замір на шести аналітичних ядрах | до 4,7× пропускної здатності та 18,7× енергоефективності проти CPU, що читає дані через CXL; до 2,0× і 6,2× проти того самого CPU з локальною DDR5 |
Базою для порівняння був Intel Xeon 6767P. Окремо XCENA показала роботу з KV-кешем — проміжною пам’яттю, яку мовна модель накопичує впродовж діалогу: на Llama 3.1 8B із vLLM час до першого токена під час читання кешу з MX1 становив 1,13× від варіанта з DRAM сервера, а під час читання з «голого» SSD — 1,86×.
Найпомітніша частина доповіді — стійка, зібрана разом із Samsung (комутатор CXL Liqid, відеокарти NVIDIA RTX Pro 6000 Blackwell, цільові 20 ТБ і 2,7 ТБ/с). На векторному пошуку за індексом FAISS із 512 млн векторів десять MX1 дали 64× запитів на секунду проти CPU з пулом CXL-пам’яті, а на Llama 3.1 70B (INT8, контекст 100 тис. токенів) два сервери по п’ять MX1 підняли швидкість генерації з 5,5 до 17,7 токена на секунду — у 3,35 раза.
Що це означає
Стосується це тих, хто тримає сервери для інференсу та RAG — пошуку у власній базі документів перед відповіддю моделі. Вузьке місце таких систем не обчислення, а пам’ять: HBM на відеокарті дорога і її мало, а коли контекст і векторні індекси туди не вміщаються, дані ганяють через CPU. MX1 пропонує третій ярус між HBM і SSD, де дешева DDR5 і ядра поруч із нею беруть на себе пошук, фільтрацію та підготовку даних.
Застереження важливіші за рекорди. Усі заміри зробила сама XCENA на своїх навантаженнях; незалежних тестів немає, а кратні цифри на кшталт 64× отримано проти CPU, якому навмисно дали читати дані через повільний CXL. До того ж код під MX1 пишеться окремо, на C/C++ або Rust, а підтримку PyTorch і векторних баз компанія лише добудовує.
Горизонт для практика: пів року до серійних зразків і щонайменше рік до того, як такі карти з’являться в хмарних провайдерів. Головний сигнал — чи підхопить ідею Samsung як виробник пам’яті.
Контекст
XCENA заснували вихідці із Samsung Electronics і SK hynix, штаб-квартира — у Південній Кореї, офіс — у Каліфорнії. До серпня 2026 року компанія залучила $185 млн, зокрема раунд B на $135 млн. Лінійку MX1 вона вперше показала в серпні 2025 року; тоді йшлося про 1 ТБ на пристрій.



