Архитектура СХД для Big Data и ML: где точка отказа классических систем

Обратная связь

Архитектура СХД для Big Data и ML: где точка отказа классических систем

Для аналитики Big Data и обучения ML-моделей нужна СХД с параллельным доступом к массиву NVMe-накопителей и низкой задержкой отклика. All-Flash СХД «Молния» построена на 24 накопителях U.2 с интерфейсом PCIe Gen4/5, поддерживает FC до 32 Гбит/с, Ethernet/iSCSI до 100 Гбит/с и NVMe-oF RoCE, что явно ориентировано на ML-платформы, Big Data и ERP-нагрузки. Для многоуровневого хранения холодных и горячих данных гибридная СХД «Гром» с NVMe-кэшем и tiering снижает стоимость хранения без потери скорости на активных данных.

Инженеры ЦОД знают проблему на практике: датасет для обучения модели читается не последовательно, а хаотично, множеством параллельных потоков. Классическая СХД на HDD с контроллером, рассчитанным на транзакционную нагрузку, начинает захлёбываться уже на этапе загрузки батчей, и GPU-кластер простаивает, ожидая данные. Разберём, какая архитектура хранения закрывает эту проблему и как правильно распределить данные между уровнями.

Почему обычная СХД не подходит для ML-пайплайна

Обучение моделей генерирует случайный I/O с высокой конкурентностью запросов — сотни потоков одновременно тянут данные с разных участков массива. HDD-based системы физически ограничены скоростью вращения шпинделя, а любая SAN с контроллером старого поколения захлёбывается на очереди запросов.

  • Высокий рандомный IOPS критичен для shuffle-операций и загрузки мини-батчей.
  • Низкая задержка (latency) напрямую влияет на скорость итерации обучения.
  • Пропускная способность сети хранения должна масштабироваться без узких мест на front-end портах.

Архитектура «Молния»: All-Flash под ML и Big Data

СХД «Молния» построена на 24 накопителях формата U.2 с интерфейсом PCIe Gen4/5, что снимает ограничение по скорости отдельного диска и позволяет параллелить нагрузку по всему массиву. Двухконтроллерная схема Active-Active с ALUA/SLUA обеспечивает отказоустойчивость без деградации производительности при переключении узла.

На уровне сети система поддерживает Fibre Channel на скоростях 16/32 Гбит/с, Ethernet/iSCSI на 10/25/100 Гбит/с, а также NVMe-oF через RoCE — это ключевой протокол именно для ML-инфраструктуры, поскольку минимизирует накладные расходы на сериализацию данных при удалённом доступе к NVMe.

Многоуровневое хранение: роль СХД «Гром»

Не весь Big Data датасет требует flash-скорости постоянно. Архивные логи, исторические выгрузки и холодные партиции разумно держать на более дешёвом уровне. Гибридная СХД «Гром» комбинирует SAS4 HDD, SSD и опциональный NVMe-кэш, реализуя tiering — автоматическое перемещение горячих блоков на быстрый уровень и холодных на емкий.

  • Базовый блок «Гром» поддерживает и HDD в формате LFF, и SSD/NVMe в формате SFF (2,5″); полки расширения — LFF/SFF.
  • Объём хранения масштабируется до 90 дисков на контроллерную пару через JBOD-полки.
  • Поддерживаются RAID до уровня 60 и RAID TP (с тройной чётностью); точное распределение функций по лицензионным пакетам Base/Enterprise/Data-Center уточняется по актуальному прайс-листу NIMBUS.

Сравнение архитектур для аналитических нагрузок

ПараметрМолния (All-Flash NVMe)Гром (гибрид SAS4)
Тип накопителейNVMe U.2, PCIe Gen4/5SAS4 HDD/SSD + опциональный NVMe-кэш
Целевой сценарийML-платформы, Big Data, ERPМногоуровневое хранение, архивы, tiering
Сетевые протоколыFC 16/32 Гбит/с, iSCSI 10/25/100 Гбит/с, NVMe-oF RoCEFC 16/32 Гбит/с, iSCSI 10/25 Гбит/с
Максимальная емкостьДо 24 NVMe в 2UДо 90 дисков через JBOD
Дедупликация/компрессияЕсть (Enterprise/Data-Center)Есть с версии 220 (Enterprise)

Практический кейс: пайплайн обучения моделей

Компания разворачивает GPU-кластер для обучения рекомендательных моделей на телеком-данных объёмом в сотни терабайт. Горячий слой — обучающие выборки последних 30 дней — размещается на «Молния» с подключением по NVMe-oF RoCE напрямую к GPU-серверам, что минимизирует задержку загрузки батчей. Холодные исторические данные с retention более года переносятся через политику tiering на «Гром», а снепшоты обеих систем встроены в ПО «Юпитер» для быстрого восстановления пайплайна. Детальные конфигурации под конкретный объём GPU-кластера можно рассчитать через контакты на nimbus.ru.

Частые вопросы

Можно ли использовать «Гром» напрямую для обучения ML-моделей?

«Гром» лучше подходит для холодного и тёплого слоя данных с tiering, а для активной фазы обучения с высоким IOPS рекомендуется All-Flash «Молния».

Поддерживает ли «Молния» NVMe-oF для прямого доступа GPU-серверов?

Да, система поддерживает NVMe-oF через RoCE, что снижает задержку по сравнению с классическим iSCSI при доступе к flash-массиву.

Какой протокол выбрать для файлового доступа аналитических систем?

Для файлового доступа обе линейки поддерживают протокол SMB и NFS, что закрывает сценарии BI и ETL-инструментов.

Нужна ли дедупликация для Big Data хранилища?

Дедупликация полезна для повторяющихся логов и резервных копий, но недоступна на базовой модели «Гром 210» — требуется версия Enterprise.

Как обеспечить отказоустойчивость на этапе долгого обучения модели?

Обе СХД работают в режиме Active-Active High Availability, что исключает простой при отказе одного контроллера во время многочасового обучения.


Гром

система хранения данных

Архитектура СХД для Big Data и ML: где точка отказа классических систем

В реестре

Архитектура СХД для Big Data и ML: где точка отказа классических систем

Оптимально подходит для организаций среднего и крупного бизнеса, которым требуется надежное, масштабируемое и эффективное решение для хранения данных с возможностью адаптации к различным типам нагрузок

Заказать

Молния

система хранения данных

Архитектура СХД для Big Data и ML: где точка отказа классических систем

В реестре

Архитектура СХД для Big Data и ML: где точка отказа классических систем

Решение премиум-класса для организаций, чей бизнес зависит от скорости обработки данных и требует инфраструктуры хранения с высокой пропускной способностью. Подходит для отраслей: телекоммуникации, финансы, госучреждения и производство

Заказать