Как GPU-кластеры меняют сетевую инфраструктуру российских ЦОДов

Изображение: Magnific.com
Высоконагруженные GPU-кластеры постепенно становятся отдельным классом нагрузки для корпоративных ЦОДов. По данным совместного исследования Аналитического центра ИКС и компании «Инфосистемы Джет», 30,4% опрошенных уже выделили для задач искусственного интеллекта отдельный сетевой сегмент, еще 15,2% планируют сделать это. Однако внедрение ИИ меняет не только требования к скорости. Заказчикам приходится заново оценивать архитектуру фабрики, задержки, резервирование, микросегментацию и совместимость оборудования разных производителей.

Модернизация идет неравномерно: рядом с подключениями быстрее 100 Гбит/с работают 10-гигабитные каналы, а российские и зарубежные коммутаторы остаются частью одной инфраструктуры.

Что именно изучали авторы исследования

В опросе участвовали ИТ-руководители и специалисты 46 компаний, отвечающие за выбор оборудования, построение и эксплуатацию сетей ЦОДов. У 54,3% респондентов объекты насчитывают от 10 до 100 заполненных оборудованием стоек, еще у 15,2% — более 100 стоек. Поэтому результаты прежде всего описывают практику средних и крупных корпоративных площадок, представленных в выборке, а не весь российский рынок.

Участникам задавали вопросы о серверных подключениях, каналах между ЦОДами, резервировании, сетях GPU-кластеров, микросегментации, балансировке трафика и используемом оборудовании. Во многих случаях можно было отметить несколько вариантов. Это важно для интерпретации: приведенные проценты показывают распространенность технологии среди опрошенных, но не образуют рыночные доли и не всегда складываются до 100%.

GPU-кластеру недостаточно просто быстрого канала

Выделенный сетевой сегмент для высоконагруженного GPU-кластера имеется у 30,4% участников, 15,2% планируют его создать, а 39,1% не рассматривают такое внедрение. Три опубликованных варианта охватывают 84,7% выборки; отдельная позиция оставшихся участников на диаграмме не указана. Поэтому корректнее говорить о заметном интересе к специализированной инфраструктуре, а не о переходе большинства компаний на новый тип сети.

 

Рис. 1. Наличие выделенного сетевого сегмента для высоконагруженного GPU-кластера в ЦОДах участников исследования. Источник: АЦ ИКС, «Инфосистемы Джет», 2026 год.

Рис. 1. Наличие выделенного сетевого сегмента для высоконагруженного GPU-кластера в ЦОДах участников исследования. Источник: АЦ ИКС, «Инфосистемы Джет», 2026 год.

 

В 2025 году 8% респондентов говорили о корректировке планов развития сети с учетом ИИ. Этот показатель нельзя напрямую сопоставлять с нынешними 30,4%: прошлогодний вопрос касался планов, а новый — наличия отдельного сегмента.

Сеть становится критичной для GPU-кластера из-за характера обмена данными. При распределенном обучении модели узлы постоянно передают друг другу большие массивы информации. Если задержка нестабильна или пакеты теряются, ускорители простаивают в ожидании, и дорогие вычислительные ресурсы используются не полностью. Поэтому от фабрики требуются высокая пропускная способность, малая задержка и предсказуемая работа при интенсивном трафике между серверами.

Внутри вычислительного узла обмен между GPU обычно обеспечивают NVLink и NVSwitch. Между узлами строится фабрика leaf–spine: коммутаторы доступа подключаются ко всем магистральным устройствам. Сети хранения и управления отделяют от основного обмена GPU, чтобы служебная нагрузка не влияла на вычисления.

На межсерверном уровне конкурируют два подхода. InfiniBand изначально рассчитан на высокопроизводительные вычисления и обеспечивает встроенный удаленный доступ к памяти с низкими задержками. Ethernet с RoCEv2 использует более привычную для корпоративных сетей основу и позволяет передавать данные напрямую между памятью узлов, сокращая участие центрального процессора. Но RoCE требует аккуратной настройки управления перегрузками и предотвращения потерь пакетов: обычной Ethernet-конфигурации для такого кластера недостаточно.

Среди компаний, уже имеющих выделенный GPU-сегмент, 50% применяют Ethernet/RoCEv2, 21,4% — InfiniBand, еще 28,6% затруднились назвать технологию. Эти доли рассчитаны не по всей выборке, а по небольшой группе действующих проектов. Они показывают предпочтение участников, но не дают оснований объявлять Ethernet безусловным стандартом для всех российских GPU-кластеров.

Скорости растут без одномоментной замены действующих сетей

В серверном доступе пока доминируют 10 Гбит/с — этот вариант указали 41,3% участников. Подключения 25 Гбит/с используют 26,1%, гигабитные — 23,9%. Одновременно 21,7% опрошенных уже применяют каналы быстрее 100 Гбит/с, еще 13% работают на скорости 100 Гбит/с. Поскольку можно было выбрать несколько ответов, одна компания могла указать разные скорости для отдельных площадок или классов оборудования.

 

Рис. 2. Скорости каналов, используемых для подключения серверов в ЦОДах участников исследования. Можно было выбрать несколько вариантов. Источник: АЦ ИКС, «Инфосистемы Джет», 2026 год.

Рис. 2. Скорости каналов, используемых для подключения серверов в ЦОДах участников исследования. Можно было выбрать несколько вариантов. Источник: АЦ ИКС, «Инфосистемы Джет», 2026 год.

 

Высокоскоростные интерфейсы в первую очередь появляются там, где они дают измеримый результат: в GPU-фабриках, производительных хранилищах и магистральных сегментах. Рост пропускной способности не означает одновременной замены всех коммутаторов и сетевых адаптеров.

В сетях хранения Ethernet и Fibre Channel пока сосуществуют. Ethernet с iSCSI используют 67,4% опрошенных, Fibre Channel — 65,2%. Здесь также допускался множественный выбор: многие ЦОДы поддерживают обе технологии для разных систем. Авторы исследования ожидают постепенного усиления Ethernet, однако фактическое распределение показывает, что Fibre Channel сохраняет значимую установленную базу.

Резервирование начинается с архитектуры каналов

Половина участников имеет собственный резервный ЦОД, 36,9% арендуют площадку в коммерческом дата-центре, а 30,4% используют облачные сервисы. Эти варианты могут сочетаться: компания способна одновременно эксплуатировать две собственные площадки и привлекать внешнего оператора для отдельных систем. Резервного ЦОДа нет у 15,2% опрошенных.

Для связи между площадками 54,3% применяют «темную» оптику — выделенное волокно, на котором заказчик самостоятельно устанавливает сетевое оборудование. Еще 32,6% используют DWDM, позволяющую передавать несколько спектральных каналов по одной паре волокон, а 19,6% приобретают VPN-сервис у оператора. Почти 37% респондентов указали межплощадочные соединения на 100 Гбит/с и выше.

«Темная» оптика дает низкую задержку и контроль над физическим каналом, но требует собственного активного оборудования. DWDM увеличивает емкость волокон и усложняет эксплуатацию. Операторский VPN быстрее запускается, однако маршрут и характеристики транспортной сети остаются в зоне ответственности провайдера.

Для публикации сервисов 60,9% участников используют независимые от оператора PI-адреса. Они позволяют сохранять один сетевой префикс при смене провайдера и строить резервирование через BGP. При отказе основного маршрута тот же префикс продолжает анонсироваться с другой площадки или через второго оператора. PA-адреса, полученные из блока конкретного провайдера, применяют 32,6%; переключение с ними чаще требует дополнительных механизмов на уровне DNS или приложений.

Микросегментация и балансировка закрывают разные задачи

Микросегментацию используют 39,1% респондентов, еще 4,3% планируют внедрение. При этом 30,4% не применяют технологию и не собираются это делать, а 26,1% затруднились с ответом. Среди конкретных платформ Cisco ACI указали 17,4% всей выборки, Huawei iMaster — 13%, VMware NSX — 8,7%.

Микросегментация задает правила взаимодействия не только для подсетей и VLAN, но и для отдельных виртуальных машин, контейнеров, приложений или сервисов. Если один узел скомпрометирован, такие политики ограничивают дальнейшее перемещение атакующего внутри ЦОДа. Но сама по себе технология не гарантирует защиту: результат зависит от корректности правил, видимости связей между приложениями и регулярного пересмотра политик.

Балансировка решает другую задачу — распределяет запросы между экземплярами приложения и выводит из ротации недоступные узлы. Программные балансировщики применяют 52,2% участников, аппаратные — 39,1%, еще 6,5% указали балансировку без уточнения технологии. Ответы могли пересекаться. Аппаратные решения востребованы там, где нужны специализированное ускорение и высокая пропускная способность; программные проще развертывать на стандартных серверах и масштабировать вместе с приложениями.

Российские и зарубежные коммутаторы работают рядом

Зарубежное оборудование сохраняется в большинстве исследованных ЦОДов. Cisco используют 54,3% респондентов против 72% годом ранее. Huawei, напротив, выросла с 38 до 52,2%. Juniper Networks указали 17,4%, HPE — 10,9%. Только три компании из 46 сообщили, что полностью обходятся без зарубежных коммутаторов.

Среди российских производителей чаще всего упоминались «Элтекс» — 28,3%, YADRO — 21,7%, B4Com — 17,4%, Qtech и «Аквариус» — по 15,2%. Еще 23,9% участников не используют отечественные решения. Эти показатели характеризуют присутствие оборудования в инфраструктуре опрошенных, а не доли продаж. Один ЦОД может одновременно эксплуатировать устройства нескольких брендов.

 

Рис. 3. Производители сетевого оборудования, решения которых используют участники исследования. Можно было выбрать несколько вариантов. Источник: АЦ ИКС, «Инфосистемы Джет», 2026 год.

Рис. 3. Производители сетевого оборудования, решения которых используют участники исследования. Можно было выбрать несколько вариантов. Источник: АЦ ИКС, «Инфосистемы Джет», 2026 год.

 

Получается не замена одного набора поставщиков другим, а смешанный парк. Западные бренды нередко остаются в инфраструктуре без официальной поддержки, Huawei расширяет присутствие, а российские решения занимают отдельные сегменты. Некоторые участники уточнили, что отечественные коммутаторы пока используются на второстепенных задачах. Поэтому пятерку «Элтекс», YADRO, B4Com, Qtech и «Аквариус» корректнее называть наиболее часто упоминавшимися российскими производителями в этой выборке, а не лидерами всего рынка.

Директор по контенту АЦ ИКС Александр Барсков связывает выбор оборудования не только с производительностью и набором функций. Для заказчика имеют значение доступность поставок, техническая поддержка, совместимость с установленными системами и риски дальнейшей эксплуатации. Данные исследования подтверждают такую логику: большинство ЦОДов не строится вокруг одного вендора, а сочетает решения разного происхождения и возраста.

Переход к быстрым сетям будет точечным

Российские ЦОДы не переходят на инфраструктуру для ИИ одновременно. Часть компаний уже строит отдельные GPU-фабрики, часть планирует их, а значительная группа пока не видит такой необходимости.

Практический выбор зависит от нагрузки. Для GPU-кластера важны задержка, пропускная способность и предсказуемость обмена между узлами. Для резервной площадки — расстояние, контроль над каналом и сценарий переключения. Для действующего корпоративного ЦОДа к этим условиям добавляются совместимость с установленной сетью, наличие специалистов, поддержка и стоимость изменений.

Поэтому развитие будет идти через отдельные высокоскоростные сегменты и постепенное обновление фабрик, а не через полную замену инфраструктуры за один цикл. Исследование АЦ ИКС и «Инфосистемы Джет» фиксирует направление этого движения, но его результаты нужно читать с учетом выборки из 46 компаний и множественного выбора в большинстве вопросов.

Источник
Совместное исследование АЦ ИКС и компании «Инфосистемы Джет» «Сетевая инфраструктура ЦОДов — 2026»

Автор: Анатолий Хаблюк.

Тематики: Интеграция

Ключевые слова: ЦОД, сетевое оборудование, Инфосистемы Джет, ИТ инфраструктура