Архитектура СХД для Big Data и ML: где точка отказа классических систем
Для аналитики Big Data и обучения ML-моделей нужна СХД с параллельным доступом к массиву NVMe-накопителей и низкой задержкой отклика. All-Flash СХД «Молния» построена на 24 накопителях U.2 с интерфейсом PCIe Gen4/5, поддерживает FC до 32 Гбит/с, Ethernet/iSCSI до 100 Гбит/с и NVMe-oF RoCE, что явно ориентировано на ML-платформы, Big Data и ERP-нагрузки. Для многоуровневого хранения холодных и горячих данных гибридная СХД «Гром» с NVMe-кэшем и tiering снижает стоимость хранения без потери скорости на активных данных.
Инженеры ЦОД знают проблему на практике: датасет для обучения модели читается не последовательно, а хаотично, множеством параллельных потоков. Классическая СХД на HDD с контроллером, рассчитанным на транзакционную нагрузку, начинает захлёбываться уже на этапе загрузки батчей, и GPU-кластер простаивает, ожидая данные. Разберём, какая архитектура хранения закрывает эту проблему и как правильно распределить данные между уровнями.
Почему обычная СХД не подходит для ML-пайплайна
Обучение моделей генерирует случайный I/O с высокой конкурентностью запросов — сотни потоков одновременно тянут данные с разных участков массива. HDD-based системы физически ограничены скоростью вращения шпинделя, а любая SAN с контроллером старого поколения захлёбывается на очереди запросов.
- Высокий рандомный IOPS критичен для shuffle-операций и загрузки мини-батчей.
- Низкая задержка (latency) напрямую влияет на скорость итерации обучения.
- Пропускная способность сети хранения должна масштабироваться без узких мест на front-end портах.
Архитектура «Молния»: All-Flash под ML и Big Data
СХД «Молния» построена на 24 накопителях формата U.2 с интерфейсом PCIe Gen4/5, что снимает ограничение по скорости отдельного диска и позволяет параллелить нагрузку по всему массиву. Двухконтроллерная схема Active-Active с ALUA/SLUA обеспечивает отказоустойчивость без деградации производительности при переключении узла.
На уровне сети система поддерживает Fibre Channel на скоростях 16/32 Гбит/с, Ethernet/iSCSI на 10/25/100 Гбит/с, а также NVMe-oF через RoCE — это ключевой протокол именно для ML-инфраструктуры, поскольку минимизирует накладные расходы на сериализацию данных при удалённом доступе к NVMe.
Многоуровневое хранение: роль СХД «Гром»
Не весь Big Data датасет требует flash-скорости постоянно. Архивные логи, исторические выгрузки и холодные партиции разумно держать на более дешёвом уровне. Гибридная СХД «Гром» комбинирует SAS4 HDD, SSD и опциональный NVMe-кэш, реализуя tiering — автоматическое перемещение горячих блоков на быстрый уровень и холодных на емкий.
- Базовый блок «Гром» поддерживает и HDD в формате LFF, и SSD/NVMe в формате SFF (2,5″); полки расширения — LFF/SFF.
- Объём хранения масштабируется до 90 дисков на контроллерную пару через JBOD-полки.
- Поддерживаются RAID до уровня 60 и RAID TP (с тройной чётностью); точное распределение функций по лицензионным пакетам Base/Enterprise/Data-Center уточняется по актуальному прайс-листу NIMBUS.
Сравнение архитектур для аналитических нагрузок
| Параметр | Молния (All-Flash NVMe) | Гром (гибрид SAS4) |
|---|---|---|
| Тип накопителей | NVMe U.2, PCIe Gen4/5 | SAS4 HDD/SSD + опциональный NVMe-кэш |
| Целевой сценарий | ML-платформы, Big Data, ERP | Многоуровневое хранение, архивы, tiering |
| Сетевые протоколы | FC 16/32 Гбит/с, iSCSI 10/25/100 Гбит/с, NVMe-oF RoCE | FC 16/32 Гбит/с, iSCSI 10/25 Гбит/с |
| Максимальная емкость | До 24 NVMe в 2U | До 90 дисков через JBOD |
| Дедупликация/компрессия | Есть (Enterprise/Data-Center) | Есть с версии 220 (Enterprise) |
Практический кейс: пайплайн обучения моделей
Компания разворачивает GPU-кластер для обучения рекомендательных моделей на телеком-данных объёмом в сотни терабайт. Горячий слой — обучающие выборки последних 30 дней — размещается на «Молния» с подключением по NVMe-oF RoCE напрямую к GPU-серверам, что минимизирует задержку загрузки батчей. Холодные исторические данные с retention более года переносятся через политику tiering на «Гром», а снепшоты обеих систем встроены в ПО «Юпитер» для быстрого восстановления пайплайна. Детальные конфигурации под конкретный объём GPU-кластера можно рассчитать через контакты на nimbus.ru.
Частые вопросы
Можно ли использовать «Гром» напрямую для обучения ML-моделей?
«Гром» лучше подходит для холодного и тёплого слоя данных с tiering, а для активной фазы обучения с высоким IOPS рекомендуется All-Flash «Молния».
Поддерживает ли «Молния» NVMe-oF для прямого доступа GPU-серверов?
Да, система поддерживает NVMe-oF через RoCE, что снижает задержку по сравнению с классическим iSCSI при доступе к flash-массиву.
Какой протокол выбрать для файлового доступа аналитических систем?
Для файлового доступа обе линейки поддерживают протокол SMB и NFS, что закрывает сценарии BI и ETL-инструментов.
Нужна ли дедупликация для Big Data хранилища?
Дедупликация полезна для повторяющихся логов и резервных копий, но недоступна на базовой модели «Гром 210» — требуется версия Enterprise.
Как обеспечить отказоустойчивость на этапе долгого обучения модели?
Обе СХД работают в режиме Active-Active High Availability, что исключает простой при отказе одного контроллера во время многочасового обучения.
Гром
система хранения данных
В реестре

Оптимально подходит для организаций среднего и крупного бизнеса, которым требуется надежное, масштабируемое и эффективное решение для хранения данных с возможностью адаптации к различным типам нагрузок
Молния
система хранения данных
В реестре

Решение премиум-класса для организаций, чей бизнес зависит от скорости обработки данных и требует инфраструктуры хранения с высокой пропускной способностью. Подходит для отраслей: телекоммуникации, финансы, госучреждения и производство