Дата-центр Z.AI мощностью 1 ГВт: сколько весит AI-инфраструктура
Модель легко воспринимать как строку в API. Инфраструктура под ней выглядит куда прозаичнее: здание, подстанция, охлаждение, оптика между стойками и смена инженеров на дежурстве.
По данным Bloomberg, Z.AI, ранее известная как Zhipu, завершила строительство дата-центра мощностью 1 ГВт и частично ввела его в эксплуатацию. Издание сравнивает такую мощность с электроснабжением 750 тысяч домов. Компания использует китайские ускорители, однако точный состав кластера не раскрывает.
Что означает мощность 1 ГВт
Один гигаватт равен миллиарду ватт. Сравнение с домами помогает представить порядок величины, но у бытовой и вычислительной нагрузки разный профиль. Дата-центр потребляет мощность непрерывно, а жилой район имеет утренние и вечерние пики.
Такому объекту нужна собственная высоковольтная инфраструктура. Электричество почти полностью превращается в тепло, поэтому рядом с ускорителями работают насосы, теплообменники и градирни либо другие системы отвода тепла. При выборе места учитывают цену земли, доступную генерацию, воду, сетевое подключение и разрешения.
Мощность площадки также не равна фактическому потреблению одной модели. Часть ресурса уходит на inference, исследования, резерв и вспомогательные системы. Без данных о PUE, загрузке и составе оборудования нельзя посчитать реальную эффективность.
Что Z.AI запускает на этой инфраструктуре
Линейка GLM развивалась от GLM-130B и ChatGLM к GLM-4 и GLM-4.5. Последняя описывается как Mixture-of-Experts модель на 355 миллиардов параметров с 32 миллиардами активных параметров на проход. Она рассчитана на reasoning, код и агентные задачи.
Из этого нельзя заключить, что весь дата-центр построен только для GLM-4.5. Кластеры такого масштаба обычно обслуживают обучение, inference и несколько параллельных экспериментов.
Публичных данных о training efficiency мало. Неизвестны точные ускорители, сетевая топология, доля работающих мощностей и частота сбоев под длительной нагрузкой. Сообщение Bloomberg подтверждает масштаб проекта, но не даёт технического аудита.
Почему происхождение чипов имеет значение
Экспортные ограничения затруднили китайским компаниям доступ к передовым ускорителям NVIDIA. Поэтому Z.AI приходится строить стек вокруг оборудования, которое можно закупать и обслуживать внутри страны.
Замены одной платы на другую недостаточно. Ускорителю нужны драйверы, компилятор, оптимизированные kernels, библиотеки коллективных операций и интеграция с PyTorch или другим фреймворком. CUDA получила эту экосистему за много лет. Китайским платформам приходится закрывать те же слои в более сжатые сроки.
Среди китайских ускорителей обычно называют Huawei Ascend 910B, Biren BR100, Cambricon MLU370 и Moore Threads MTT S4000. Публичное сообщение о Z.AI не позволяет уверенно сказать, какие из них установлены в конкретных кластерах.
По зрелости инструментов, производительности и удобству разработки китайский стек пока уступает NVIDIA. Запуск большой площадки показывает доступность альтернативы, но не доказывает паритет.
Сеть сложнее количества чипов
Кластер с тысячами ускорителей ограничен скоростью обмена между ними. Во время распределённого обучения устройства регулярно синхронизируют градиенты. Медленный или нестабильный узел задерживает весь шаг.
Для таких систем используют InfiniBand, RoCE и собственные решения для collective operations. Топология сети, пропускная способность и обработка отказов влияют на полезную загрузку не меньше пиковых FLOPS одного ускорителя.
Стандартный NCCL рассчитан на экосистему NVIDIA. Другому железу нужны совместимые библиотеки и оптимизированные реализации all-reduce. Именно здесь большой кластер проверяет зрелость платформы лучше, чем одиночный benchmark.
Как Z.AI выглядит на фоне США
Американские компании тоже планируют площадки мощностью в сотни мегаватт и больше. Microsoft, Amazon, Google и Meta заключают долгосрочные энергетические соглашения и строят крупные кампусы.
Разница Z.AI заключается в цепочке поставок. Американские проекты опираются на зрелый стек NVIDIA и международный рынок капитала. Китайский проект работает при ограниченном доступе к этому оборудованию и большей зависимости от локальных производителей и финансирования.
Поэтому 1 ГВт не следует читать как таблицу лидеров. Мощность говорит о размере энергетического подключения. Она ничего не сообщает напрямую о количестве полезных training tokens на один мегаватт или о стоимости готовой модели.
Что теряется в модельных бенчмарках
MMLU, HumanEval и MATH сравнивают ответы моделей, а не устойчивость инфраструктуры. В таблице результатов не видно, сколько раз перезапускался кластер, насколько хорошо работает сеть и сколько инженерного времени ушло на обход ограничений платформы.
Мне как раз интересна эта невидимая часть. Чистый ответ модели появляется после довольно грязной работы: неисправных узлов, несовместимых библиотек, перегретых стоек и долгих ночных прогонов.
Гигаваттная площадка не делает модель автоматически лучше. Она лишь повышает потолок экспериментов, которые компания может проводить одновременно.
Цепочка поставок и охлаждение
Кроме ускорителей проекту нужны серверы, оптические модули, коммутаторы, системы питания и запасные части. У каждого слоя свой срок поставки. Проблема в одном компоненте может оставить дорогие ускорители без работы.
Охлаждение тоже нельзя вывести из мощности одной строкой. Реальный расход воды зависит от климата, технологии охлаждения и режима повторного использования. Пока Z.AI не раскрыла площадку и инженерную схему, утверждения о конкретном источнике энергии или расходе воды остаются предположениями.
В предыдущем тексте вероятные детали были поданы как установленные. Из сообщения о мощности нельзя вывести тип градирен, напряжение подстанции или выбранную сетевую топологию.
Российский контекст
Российские компании сталкиваются с похожей проблемой доступа к ускорителям, хотя рынок, санкции и доступные поставщики отличаются от китайских. Опыт Z.AI показывает, что альтернативный стек можно масштабировать, если одновременно инвестировать в железо, сеть и программные инструменты.
Из него не следует, что такой путь дешёвый или быстрый. Менее зрелые библиотеки увеличивают время отладки, а более слабый ускоритель может потребовать больше устройств для той же задачи. Национальная доступность оборудования не отменяет стоимость эксплуатации.
Для российских команд практичнее следить не за числом гигаватт, а за доступностью конкретного стека: компилятора, kernels, collective libraries, профилировщиков и специалистов, которые умеют всё это чинить.
Часто задаваемые вопросы
Один гигаватт много для AI?
Да, это крупное энергетическое подключение. Но оно описывает площадку, а не потребление одной training job. Для сравнения проектов нужны фактическая загрузка, PUE и производительность под реальной нагрузкой.
Почему слабый китайский чип может быть полезен?
Потому что доступный ускоритель можно закупать, ремонтировать и включать в долгосрочный план. Недоступный H100 не участвует в расчётах, каким бы быстрым он ни был. При этом разницу в производительности всё равно придётся компенсировать количеством оборудования и инженерной работой.
Изменит ли проект работу обычного пользователя?
Непосредственно нет. Пользователь по-прежнему увидит модель через API. Косвенный эффект зависит от того, сможет ли Z.AI выпускать модели с приемлемой ценой и скоростью, используя собственную инфраструктуру.
Вывод
Проект Z.AI показывает физический масштаб современной AI-разработки. Он не подтверждает равенство китайских ускорителей с NVIDIA и не раскрывает эффективность кластера. Зато он даёт конкретный объект для разговора об энергетике, поставках и программном стеке, которые обычно скрываются за словом «облако».