Дата-центр Z.AI мощностью 1 ГВт: сколько весит AI-инфраструктура

Дата-центр Z.AI мощностью 1 ГВт: сколько весит AI-инфраструктура

Модель легко воспринимать как строку в API. Инфраструктура под ней выглядит куда прозаичнее: здание, подстанция, охлаждение, оптика между стойками и смена инженеров на дежурстве.

По данным Bloomberg, Z.AI, ранее известная как Zhipu, завершила строительство дата-центра мощностью 1 ГВт и частично ввела его в эксплуатацию. Издание сравнивает такую мощность с электроснабжением 750 тысяч домов. Компания использует китайские ускорители, однако точный состав кластера не раскрывает.

Что означает мощность 1 ГВт

Один гигаватт равен миллиарду ватт. Сравнение с домами помогает представить порядок величины, но у бытовой и вычислительной нагрузки разный профиль. Дата-центр потребляет мощность непрерывно, а жилой район имеет утренние и вечерние пики.

Такому объекту нужна собственная высоковольтная инфраструктура. Электричество почти полностью превращается в тепло, поэтому рядом с ускорителями работают насосы, теплообменники и градирни либо другие системы отвода тепла. При выборе места учитывают цену земли, доступную генерацию, воду, сетевое подключение и разрешения.

Мощность площадки также не равна фактическому потреблению одной модели. Часть ресурса уходит на inference, исследования, резерв и вспомогательные системы. Без данных о PUE, загрузке и составе оборудования нельзя посчитать реальную эффективность.

Что Z.AI запускает на этой инфраструктуре

Линейка GLM развивалась от GLM-130B и ChatGLM к GLM-4 и GLM-4.5. Последняя описывается как Mixture-of-Experts модель на 355 миллиардов параметров с 32 миллиардами активных параметров на проход. Она рассчитана на reasoning, код и агентные задачи.

Из этого нельзя заключить, что весь дата-центр построен только для GLM-4.5. Кластеры такого масштаба обычно обслуживают обучение, inference и несколько параллельных экспериментов.

Публичных данных о training efficiency мало. Неизвестны точные ускорители, сетевая топология, доля работающих мощностей и частота сбоев под длительной нагрузкой. Сообщение Bloomberg подтверждает масштаб проекта, но не даёт технического аудита.

Почему происхождение чипов имеет значение

Экспортные ограничения затруднили китайским компаниям доступ к передовым ускорителям NVIDIA. Поэтому Z.AI приходится строить стек вокруг оборудования, которое можно закупать и обслуживать внутри страны.

Замены одной платы на другую недостаточно. Ускорителю нужны драйверы, компилятор, оптимизированные kernels, библиотеки коллективных операций и интеграция с PyTorch или другим фреймворком. CUDA получила эту экосистему за много лет. Китайским платформам приходится закрывать те же слои в более сжатые сроки.

Среди китайских ускорителей обычно называют Huawei Ascend 910B, Biren BR100, Cambricon MLU370 и Moore Threads MTT S4000. Публичное сообщение о Z.AI не позволяет уверенно сказать, какие из них установлены в конкретных кластерах.

По зрелости инструментов, производительности и удобству разработки китайский стек пока уступает NVIDIA. Запуск большой площадки показывает доступность альтернативы, но не доказывает паритет.

Сеть сложнее количества чипов

Кластер с тысячами ускорителей ограничен скоростью обмена между ними. Во время распределённого обучения устройства регулярно синхронизируют градиенты. Медленный или нестабильный узел задерживает весь шаг.

Для таких систем используют InfiniBand, RoCE и собственные решения для collective operations. Топология сети, пропускная способность и обработка отказов влияют на полезную загрузку не меньше пиковых FLOPS одного ускорителя.

Стандартный NCCL рассчитан на экосистему NVIDIA. Другому железу нужны совместимые библиотеки и оптимизированные реализации all-reduce. Именно здесь большой кластер проверяет зрелость платформы лучше, чем одиночный benchmark.

Как Z.AI выглядит на фоне США

Американские компании тоже планируют площадки мощностью в сотни мегаватт и больше. Microsoft, Amazon, Google и Meta заключают долгосрочные энергетические соглашения и строят крупные кампусы.

Разница Z.AI заключается в цепочке поставок. Американские проекты опираются на зрелый стек NVIDIA и международный рынок капитала. Китайский проект работает при ограниченном доступе к этому оборудованию и большей зависимости от локальных производителей и финансирования.

Поэтому 1 ГВт не следует читать как таблицу лидеров. Мощность говорит о размере энергетического подключения. Она ничего не сообщает напрямую о количестве полезных training tokens на один мегаватт или о стоимости готовой модели.

Что теряется в модельных бенчмарках

MMLU, HumanEval и MATH сравнивают ответы моделей, а не устойчивость инфраструктуры. В таблице результатов не видно, сколько раз перезапускался кластер, насколько хорошо работает сеть и сколько инженерного времени ушло на обход ограничений платформы.

Мне как раз интересна эта невидимая часть. Чистый ответ модели появляется после довольно грязной работы: неисправных узлов, несовместимых библиотек, перегретых стоек и долгих ночных прогонов.

Гигаваттная площадка не делает модель автоматически лучше. Она лишь повышает потолок экспериментов, которые компания может проводить одновременно.

Цепочка поставок и охлаждение

Кроме ускорителей проекту нужны серверы, оптические модули, коммутаторы, системы питания и запасные части. У каждого слоя свой срок поставки. Проблема в одном компоненте может оставить дорогие ускорители без работы.

Охлаждение тоже нельзя вывести из мощности одной строкой. Реальный расход воды зависит от климата, технологии охлаждения и режима повторного использования. Пока Z.AI не раскрыла площадку и инженерную схему, утверждения о конкретном источнике энергии или расходе воды остаются предположениями.

В предыдущем тексте вероятные детали были поданы как установленные. Из сообщения о мощности нельзя вывести тип градирен, напряжение подстанции или выбранную сетевую топологию.

Российский контекст

Российские компании сталкиваются с похожей проблемой доступа к ускорителям, хотя рынок, санкции и доступные поставщики отличаются от китайских. Опыт Z.AI показывает, что альтернативный стек можно масштабировать, если одновременно инвестировать в железо, сеть и программные инструменты.

Из него не следует, что такой путь дешёвый или быстрый. Менее зрелые библиотеки увеличивают время отладки, а более слабый ускоритель может потребовать больше устройств для той же задачи. Национальная доступность оборудования не отменяет стоимость эксплуатации.

Для российских команд практичнее следить не за числом гигаватт, а за доступностью конкретного стека: компилятора, kernels, collective libraries, профилировщиков и специалистов, которые умеют всё это чинить.

Часто задаваемые вопросы

Один гигаватт много для AI?

Да, это крупное энергетическое подключение. Но оно описывает площадку, а не потребление одной training job. Для сравнения проектов нужны фактическая загрузка, PUE и производительность под реальной нагрузкой.

Почему слабый китайский чип может быть полезен?

Потому что доступный ускоритель можно закупать, ремонтировать и включать в долгосрочный план. Недоступный H100 не участвует в расчётах, каким бы быстрым он ни был. При этом разницу в производительности всё равно придётся компенсировать количеством оборудования и инженерной работой.

Изменит ли проект работу обычного пользователя?

Непосредственно нет. Пользователь по-прежнему увидит модель через API. Косвенный эффект зависит от того, сможет ли Z.AI выпускать модели с приемлемой ценой и скоростью, используя собственную инфраструктуру.

Вывод

Проект Z.AI показывает физический масштаб современной AI-разработки. Он не подтверждает равенство китайских ускорителей с NVIDIA и не раскрывает эффективность кластера. Зато он даёт конкретный объект для разговора об энергетике, поставках и программном стеке, которые обычно скрываются за словом «облако».

← Все записи