d-Matrix Raptor: 3D-DRAM с пропускной способностью более 100 TB/s для AI-инференции
Компания d-Matrix на конференции Hot Chips 2026 представила ускоритель Raptor, который использует принципиально иную архитектуру по сравнению с традиционными решениями для искусственного интеллекта. Вместо привычных чипов HBM, расположенных рядом с вычислительным блоком, инженеры d-Matrix в связке с Meta реализовали технологию 3D-DRAM, где слой логики физически накладывается непосредственно поверх памяти. Такой подход позволил достичь рекордной пропускной способности более 100 TB/s, однако устройство позиционируется не как универсальный заменитель HBM4, а как узкоспециализированное решение для генеративных задач.
Архитектура: логика прямо над памятью
Ключевая особенность Raptor заключается в вертикальной интеграции. В отличие от классических GPU, где память и вычислительная часть соединены через сложные межчиповые интерфейсы (Interposer), здесь используется метод Face-to-Face. Логический чип размещается прямо над блоком DRAM, а связь между ними обеспечивается массивом микропадов размером около 36 мкм. Такая конструкция кардинально сокращает путь прохождения данных и снижает энергопотребление: измеренная энергия передачи составляет всего 0,37 пДж на бит.
Характеристики и производительность
Одна карта Raptor состоит из восьми чиплетов (Chiplets). Каждый чиплет обеспечивает 4 ГБ памяти и около 12,5 TB/s пропускной способности. В сумме это дает конфигурацию на 32 ГБ с общей шириной шины более 100 TB/s. Для сравнения: аналогичные решения на базе HBM требуют значительно больше места и энергии для достижения сопоставимых показателей.
Важно понимать, что эти цифры достигаются в специфических условиях. d-Matrix демонстрировал прототипы еще на конференции ISCA 2026, подтвердив работоспособность «раннего кремния». В тестах на генеративных моделях ускоритель показал прирост пропускной способности (Throughput) в 4,71 раза по сравнению с конфигурацией на HBM и в 2,44 раза — по сравнению с SRAM. Это делает его крайне эффективным для фазы генерации токенов, где нагрузка смещается от вычислений к чтению данных из памяти.
Ограничения и перспективы
Несмотря на впечатляющие показатели скорости, у архитектуры есть существенные ограничения. Объем памяти в 32 ГБ на одной карте мал для современных больших языковых моделей (LLM), которые требуют значительно больше ресурсов. d-Matrix решает эту проблему через масштабируемость: предполагается использование нескольких карт и сложных систем межсоединений (Interconnect). Это переносит часть сложности с локальной памяти на сеть и программное обеспечение.
Также стоит отметить тепловой режим работы. Поскольку логический чип находится над памятью, он может нагреваться сильнее. Конструкция спроектирована так, чтобы горячий слой логики был лучше охлажден, а питание проходило через более термостойкую зону памяти. Таким образом, Raptor — это не просто «быстрый HBM», а фундаментально новый подход к устранению узкого места памяти в ИИ-инференсе.