NVIDIA открыла cuFile: открытый стек для хранения данных у GPU
Технология cuFile сама по себе не нова: она является частью GPUDirect Storage и позволяет приложениям передавать данные между совместимым хранилищем и памятью GPU, минуя классический буфер обмена в оперативной памяти через CPU. Это особенно важно для задач ИИ и HPC, где современные GPU генерируют множество параллельных запросов к памяти одновременно. Если каждый доступ требует участия CPU как посредника, возникают дополнительные копирования данных, задержки и нагрузка на процессор.
Однако не стоит воспринимать фразу «хранилище становится памятью» слишком буквально. SSD не заменяют HBM-память: даже очень быстрые NVMe-системы остаются далеко от локального GPU-HBM по показателям задержки и пропускной способности. Хранилище интересно как дополнительный уровень для данных, которые не должны постоянно занимать дорогую память ускорителя.
Новизна заключается именно в открытии интерфейсов. На конференции Future of Memory and Storage (FMS) NVIDIA объявила о том, что API cuFile и части вертикально интегрированного стека программного обеспечения для хранения данных будут доступны как open-source. В качестве основы используется новая организация GitHub xio-sig.
В этой организации cuFile должен стать единым интерфейсом программирования, который можно расширять для различных платформ и производителей. Дополнительно предусмотрены пакет тестов на соответствие (Conformance), мультиплатформенная библиотека libxFile и xioLinux как основа для Linux. Google, Intel, Meta и NVIDIA названы первоначальными maintainерами проекта.
Это стратегически интереснее, чем просто публикация исходного кода: если производители хранилищ будут реализовывать одинаковый интерфейс и проходить совместные тесты на соответствие, теоретически снижается риск появления несовместимых путей передачи данных для каждого файловой системы, платформы и ускорителя. Однако текущий статус проекта в GitHub показывает, что он находится на ранней стадии: компоненты объявлены, но код ещё не полностью заполнен.
Параллельно NVIDIA разрабатывает более масштабную промышленную программу Storage-Next. По данным компании, в ней участвуют более 40 производителей и поставщиков, включая DDN, KIOXIA и Micron. Цель — совместно развивать интерфейсы и требования для систем хранения данных, управляемых GPU, и создавать максимально совместимые стандарты.
Другой компонент — SCADA (Scaled Accelerated Data Access). Он позволяет массово параллельным GPU целенаправленно извлекать только те данные из хранилища, которые нужны приложению в данный момент, и передавать их напрямую в быструю память GPU. Это может быть полезно для систем поиска, больших баз данных и длинных контекстов ИИ, где не обязательно удерживать огромные объёмы данных полностью в HBM или оперативной памяти.
NVIDIA также связывает эту стратегию с технологиями Vera и BlueField. Например, для двухуровневой пайплайны сжатия и шифрования с использованием CPU Vera заявлен до 3,21-кратный прирост производительности по сравнению с x86-системой. Однако это собственный бенчмарк NVIDIA и следует воспринимать как заявление производителя.
Ключевой момент здесь не в том, чтобы заменить HBM: технически это было бы нереалистично из-за фундаментальных различий в задержках и пропускной способности. NVIDIA скорее стремится объединить иерархию памяти системы ИИ. HBM остаётся критически важным для текущих тензоров, KV-кешей и других данных с временными требованиями. Большие массивы данных, информация о моделях или контекстные данные могут лежать на более дешёвых уровнях хранилища и загружаться при необходимости как можно более эффективно.
По мере роста агентских систем ИИ и их объёмов контекста именно этот путь передачи данных становится всё важнее. Если Intel, Meta, Google, производители накопителей и NVIDIA действительно будут работать над совместимыми интерфейсами, это может создать значимую инфраструктуру ниже уровня самих моделей ИИ.
SSD не станут внезапно HBM, но если данные будут достигать GPU за микросекунды вместо ненужных обходов, а разные производители смогут использовать одинаковый программный путь, то массовое хранилище для систем ИИ станет гораздо более интересным, чем просто большим архивом за сервером.