Core Scientific豪掷140亿美元扩容:AMD MI300集群部署对中国智算中心算力租赁模式的启示

14次阅读
没有评论

共计 1705 个字符,预计需要花费 5 分钟才能阅读完成。

Core Scientific 140 亿美元豪赌 AMD:中国智算中心的算力租赁破局之道

Core Scientific 与 AMD 达成的 140 亿美元合作协议,标志着 AI 基础设施正从 NVIDIA 单一依赖向 多元化算力生态 转型。对于中国 IDC 企业而言,这一案例的核心启示在于:在国产芯片(如华为昇腾、海光)与非国产芯片混合部署的背景下,必须通过 异构算力池化 和精细化调度来解决兼容性难题,从而将传统的“机柜租赁”升级为高溢价的“算力服务”。本文旨在为国内智算中心提供关于 GPU 集群部署、散热重构及定价策略的实操建议,帮助企业在算力成本优化中建立竞争壁垒。

全球 AI 算力格局重塑:AMD Instinct 生态的崛起与挑战

AMD 正在通过大规模资本支出打破 NVIDIA 在 AI 训练市场的垄断地位,构建具备竞争力的替代生态。

长期以来,NVIDIA 凭借 CUDA 生态占据了全球 AI 加速卡市场 90% 以上的份额「据 TrendForce 2024 年 Q1 数据」。然而,Core Scientific 宣布在未来几年内部署高达 1.1GW 的 AMD Instinct MI300 系列加速器,总价值约 140 亿美元,这一举动不仅是产能的扩张,更是技术路线的博弈。MI300X 拥有 192GB HBM3 内存,带宽高达 5.3TB/s,在大语言模型(LLM)推理场景下,其性价比显著优于 H100。

从技术架构来看,AMD 的 ROCm 软件栈正在快速迭代,以缩小与 CUDA 的开发体验差距。对于中国企业而言,关注 AMD 的崛起并非为了直接采购(受限于出口管制),而是借鉴其 软硬解耦 的思路。在国内,我们面临着更为复杂的芯片供给环境,包括华为昇腾 910B、寒武纪思元系列以及进口受限的 A800/H800。借鉴 AMD 的策略,IDC 运营商不应绑定单一硬件供应商,而应建立基于开源框架(如 PyTorch、TensorFlow)的中间件层,实现不同品牌芯片的统一接口调用,降低客户迁移成本。

Core Scientific 豪掷 140 亿美元扩容:AMD MI300 集群部署对中国智算中心算力租赁模式的启示

1.1GW 扩容背后的工程极限:高密度供电与液冷重构

支撑千卡级 AI 集群稳定运行的关键,在于突破传统风冷数据中心在功率密度和散热效率上的物理瓶颈。

Core Scientific 的扩容计划要求数据中心单机柜功率密度从传统的 6 -8kW 提升至 40kW 甚至 100kW 以上。在我们为某大型金融机构实施混合云改造时,曾遇到因局部热点导致服务器降频的问题,这凸显了传统 CRAC(计算机房空调)系统在面对 AI 高密度负载时的无力。根据 ASHRAE 标准,当机柜功率超过 20kW 时,风冷系统的 PUE(电源使用效率)很难控制在 1.3 以下,而采用 冷板式液冷 或浸没式液冷可将 PUE 降至 1.15 以下。

此外,电力基础设施的重构至关重要。1.1GW 的负载意味着需要新建或扩建高压变电站,并部署动态无功补偿装置以应对 GPU 负载瞬间波动带来的电网冲击。在中国“东数西算”节点建设中,许多新建智算中心已开始强制要求液冷比例不低于 30%。IDC 运营商需在建设初期就规划好 高压直流供电(HVDC)链路,减少交直流转换损耗,同时预留足够的冷却水管道空间。这不仅是技术问题,更是 CAPEX(资本性支出)与 OPEX(运营性支出)平衡的经济账。

中国视角:多元芯片架构下的算力池化与统一调度

面对国产与非国产芯片并存的复杂现状,构建统一的算力调度平台是实现资源最大化利用的唯一路径。

与美国相对单一的硬件环境不同,中国智算中心往往需要同时管理华为昇腾、英伟达、海光 DCU 等多种异构算力。在实际操作中,最大的痛点在于 算子兼容性 和通信效率。例如,不同芯片间的 NCCL(NVIDIA 集合通信库)替代品性能差异巨大,导致分布式训练时的线性加速比难以保证。据信通院《中国算力发展指数白皮书》显示,异构算力协同效率每提升 10%,整体集群利用率可提升 15% 以上。

解决这一难题需要引入 虚拟化算力抽象层 断点续训 自动故障隔离 问题,谁就能在算力租赁市场获得定价权。

Core Scientific 豪掷 140 亿美元扩容:AMD MI300 集群部署对中国智算中心算力租赁模式的启示

IDC 转型建议:从“卖机柜”到“卖算力服务”的商业演进

IDC 企业的核心竞争力正从土地与电力资源,转向算力运维能力与服务化水平。

传统 IDC 商业模式依赖于机柜出租率,毛利率通常在 20%-30% 之间。而在 AI 时代,提供裸金属服务器租赁或容器化算力服务的毛利率可达 40%-60%。要实现这一转型,IDC 运营商必须建立 MLOps(机器学习运维) 服务体系。这包括提供预置的主流大模型镜像、自动化数据预处理管道以及模型微调工具链。

具体策略上,建议采取以下步骤:首先,建立分级定价机制,针对训练型任务(高带宽、高稳定性要求)和推理型任务(低延迟、高并发要求)制定不同的 SLA 标准;其次,推出“算力券”或按需计费模式,降低中小企业使用门槛;最后,加强与算法厂商的合作,形成“算力 + 算法 + 数据”的一体化解决方案。只有通过服务增值,才能抵消高昂的硬件折旧成本,实现可持续增长。

常见问题解答

AMD MI300 相比 NVIDIA H100 有何优势?

MI300X 拥有更大的 HBM3 内存(192GB vs 80GB)和更高带宽,在大模型推理和高显存需求场景下性价比更高,且供货相对充足。

中国 IDC 如何应对芯片供应碎片化?

通过构建异构算力调度平台,利用容器化和虚拟化技术屏蔽底层硬件差异,实现多种芯片资源的统一池化管理和智能分配。

高密度 AI 机柜的散热最佳实践是什么?

对于功率密度超过 20kW 的机柜,推荐采用冷板式液冷技术,可将 PUE 降至 1.15 以下,有效解决局部热点问题并降低能耗。

算力租赁的定价策略应如何制定?

应基于任务类型(训练 / 推理)、SLA 等级、资源独占性及附加软件服务进行分级定价,从单纯售卖硬件时长转向售卖算力服务质量。

什么是异构算力池化?

指通过软件层将不同品牌、架构的 AI 芯片资源整合为一个逻辑资源池,实现统一调度、负载均衡和故障隔离,提高整体利用率。

关于作者

本文由 IDC NEWS 技术编辑团队撰写。团队成员拥有 10 年以上 IDC、云计算及企业 IT 基础设施领域的实战经验,长期跟踪行业动态,为企业 IT 决策者提供专业、客观的技术参考。如有疑问,欢迎在评论区留言。

正文完
 0
IDC NEWS
版权声明:本站原创文章,由 IDC NEWS 于2026-07-29发表,共计1705字。
转载说明:除特殊说明外本站文章皆由CC-4.0协议发布,转载请注明出处。
评论(没有评论)
验证码