d-Matrix заявляет о чипе Raptor с плотностью пропускной способности в 20 раз выше NVIDIA Rubin
Компания d-Matrix представила новый ускоритель Raptor, который позиционируется как решение для фазы декодирования в задачах AI-инференса. Производитель заявляет о плотности пропускной способности, превышающей показатели архитектуры NVIDIA Rubin на 20 раз.
В основе заявления лежит использование технологии 3D DRAM. Если у AMD во второй генерации 3D V-Cache кэш-ячейки из SRAM размещаются под ядрами процессора, то в чипе Raptor используется до четырёх слоёв именно DRAM для увеличения ёмкости. d-Matrix утверждает, что это позволяет достичь плотности пропускной способности примерно в 20 раз выше, чем у конкурентов, и снизить энергопотребление на гигабайт переданных данных в 13,5 раза.

Техническая суть новинки кроется в отказе от традиционной архитектуры с использованием межчипового интерпозера. Обычно чипы HBM стоят рядом с вычислительным блоком на кремниевом интерпозере, что ограничивает количество контактов (пинов) по краям кристалла и требует мощных интерфейсных драйверов (PHY), потребляющих сотни ватт энергии. d-Matrix применяет технологию face-to-face bonding с шагом 36 микрон для прямого соединения логического кристалла TSMC N4 поверх DRAM. Это полностью устраняет необходимость в блоке PHY и позволяет электронам двигаться вертикально на расстояние всего нескольких микрон, снижая энергозатраты до 0,37 пДж/бит.

Несмотря на то, что общая ёмкость памяти уступает HBM, d-Matrix считает это несущественным недостатком для целевого сценария — инференса больших языковых моделей (LLM). Чипы Raptor не предназначены для обучения огромных моделей, а ориентированы на обслуживание запросов. На одной карте реализовано 32 ГБ памяти. Для работы с гигантскими моделями компания предлагает горизонтальное масштабирование в кластерные конфигурации (например, из 72 карт), объединённые высокоскоростными шинами. В такой сборке общая пропускная способность достигает петабайт в секунду, что позволяет распределять параметры модели между узлами и обрабатывать контекстные окна с миллионами токенов без «бутылочного горлышка» на этапе декодирования.

Производитель приводит амбициозные цифры производительности: около 1000 токенов в секунду на пользователя при обслуживании модели класса 3T с контекстом в 1 миллион токенов. В бенчмарках на базе GLM 5.2 кластер из 72 карт показал результат 2121 токен/сек/пользователь для 32 пользователей, а на новой модели Kimi K3 — 785 токенов при 32 одновременных сессиях.

Стоит отметить, что презентация на конференции Hot Chips фокусировалась преимущественно на преодолении инженерных сложностей стекинга DRAM под логикой. Конкретные характеристики и результаты тестирования самого продукта Raptor раскрыты крайне скупо, а живая демонстрация устройства пока не проводилась. Тем не менее, d-Matrix уже имеет коммерческие продукты на рынке, поэтому речь идёт не о стартапе с обещаниями без реализации, а о компании, работающей над конкретным решением для ниши AI-инференса.