算力过剩是假象,“算力服务”才是少数人的游戏
当智算中心陷入找客户的窘境,模型企业却喊“算力紧张”。WAIC卖铲人的热闹背后,是算力服务从部件交付升级为系统工程的大变局。本文深挖建设账、运营账与客户账,探讨链主逻辑。

没有比高效率地做根本不该做的事更无用的事了。
彼得·德鲁克这句管理箴言,在 2026 年的算力市场显得格外刺耳。WAIC 展馆里,突然冒出来的 AI Infra 公司比去年翻了一倍,人手一张“卖铲子”的名片。但走出这场热闹,大量的智算中心却在以接近成本的价格招揽客户,甚至陷入空转;而另一头,手握大模型的企业和科研机构,仍在抱怨算力“一卡难求”。这种冰火两重天的荒诞景象,撕开了一个残酷的产业真相:我们正处在“算力烂大街”的假象中,“能用的算力”正成为这个时代最稀缺的奢侈品。 算力服务的本质,根本不是硬件的堆砌,而是一场关乎复杂系统工程的生存游戏。能登上这张牌桌的,注定是少数人。
01 散装算力的巨大陷阱:部件的胜利,系统的溃败
走进任何一座新建的智算中心,你大概率会看到这样一个堪称“豪华”的场景:最顶级的 GPU 或国产替代芯片整齐排列,液冷系统安静运转,交换机端口闪烁着高速传输的光芒。每一个部件单拎出来,都代表着国产替代和全球供应链的最高水准。然而,当你满怀期待地把一个千卡级的大模型训练任务丢进去时,灾难才刚刚开始。
同样是一千张计算卡,在网络协议、存储架构和调度软件完全不同的环境里,跑出来的最终有效算力可能相差 50% 甚至更多。这就像一个顶级足球俱乐部,买来了全世界身价最高的 11 个前锋,却没有中场指挥官和后卫线。一开球,所有人只往对方球门冲,场面极度混乱,最终被对手打得毫无还手之力。这就是当下 AI 基础设施市场最可怕的“中间状态”:有资源但不好用,有平台但控制不了资源,有客户却解决不了应用层面的崩溃。
对于非技术背景的企业决策者而言,这种“部件繁荣”极具迷惑性。许多企业在进行数字化转型时,往往把“购买算力”简单等同于“购买 AI 能力”。CMO 和 CGO 们发现,业务部门对 AI 的渴求催生了一笔巨大的算力采购预算,但预算花出去后,内部研发团队却抱怨“连不上、跑不动、总报错”。最终,高额采购的 GPU 集群变成了财务账面上的闲置资产,不仅没有带来增长,反而因为 4 到 5 年的折旧周期成为了吞噬利润的无底洞。更致命的是,AI 芯片的更新周期已经压缩到一年左右——当你的折旧还没跑完,你手里的硬件在技术上已经沦为二流设备。 技术迭代跑赢折旧,这是散装算力埋给非专业买家的最大暗坑。
02 一张计算卡背后的“三本账”:重新定义算力成本
为什么部件超前而系统拉胯?因为在 AI 的世界里,一张冷冰冰的计算卡背后,藏着企业老板必须看懂的“三本账”。如果只看含税单价和机房电费,你连算力生意的门都没入。
第一本:重如千钧的“建设账”
这是典型的超重资产、长周期投入。一个中等规模的智算中心,从土建到设备点亮,往往需要数年时间。但 AI 领域的商业逻辑是极度反直觉的:你投入巨资建好的机房,客户可能只租用几周来跑一次大模型训练。这种“重资产对接短期需求”的结构性矛盾,让设备的闲置风险超越了所有传统数据中心。买铲子容易,但要让铲子持续挖出金矿,需要极高的资产周转率和预判能力。
第二本:令人窒息的操作与运营账
如果你觉得建设完毕就万事大吉,那 Meta 训练 Llama 3 时的数据会让你冷汗直流。他们在使用 1.6 万张计算卡进行集群训练时,54 天内发生了 400 余次意外中断。这意味着每隔 3 小时,就可能有一处链路崩溃、一块显卡掉队或一次存储卡顿。而每一次中断都需要顶尖的工程师团队在不中断大体量训练进度的前提下,进行毫秒级的故障隔离和动态迁移。
真正的运营,不是简单的运维。 它是在持续处理纳秒级延时下的资源编排、千万级任务并发的优先级排序、以及令人绝望的故障恢复。这是一场没有终点的“救火行动”,没有万亿级体量的工程化交付经验和规模化的驻场团队,这第二本账瞬间就会转为灾难。
第三本:决定生死的客户结构与账期账
即便你买来了最好的设备,养了最好的运营团队,第三座大山才开始显现:去哪里找到足够多、结构足够合理的订单来填满空置的机柜?大模型训练客户最诱人,消耗量极大,一把梭哈就是几千万的项目,但这类需求完全是脉冲式的,一旦模型训完寻求变现,算力消耗就是断崖式下跌。推理类客户虽然相对平顺,但对毫秒级的响应速度和单位成本极度病态,每降低一分钱都是生死线。
此外,还有一跑就是半年的高校科研任务,以及极度看重数据主权和本地化部署的工业制造业客户。要把这种“长短错配、厚薄不均”的需求整合到同一个物理集群里,使之维持在 80% 乃至 90% 的健康利用率,本身就是一个极其复杂的动态组合优化难题。
03 算力服务的隐形王者:从“自扫门前雪”到“链主”的诞生
当前 AI Infra 产业链最大的积弊在于,大家都只管“自己那一段”:做芯片的只负责交付板卡,做交换机的交付带宽,做软件的交付调度界面。产业链分工在极致化的同时,也造成了责任的极度碎片化。企业用户作为最终买家,被迫成为了这个极高技术壁垒产业的“总工程师”,往往连找谁解决问题都找不到。
未来的产业洗牌,必然催生出一个能够“承担最终结果的超级链主”。这个系统级主体必须具备三个核心特征:拥有规模化的驻场工程团队,敢于承受长周期基础设施带来的资本沉淀,同时全面掌握决定服务质量的关键环节,包括网络、存储、调度和底层软件适配。
请注意,具备这些特征的主体,在当下的中国商业版图中屈指可数。除了少数具备深厚系统工程化能力的算力原生企业外,最有可能承接这一角色的,反而是手握全国分布式数据中心、骨干网络资源和庞大政企服务体系的电信运营商,或是具备云底座强耦合能力的头部云计算厂商。他们正在从单纯的资源出租方,进化为兜底的算力服务方。
全国一体化算力网的相关政策,已明确提出要发展专业化的算网运营主体。这意味着,对于算力服务的评价体系正在发生根本性重塑:从过去比拼设备数量、跑分榜单上的峰值性能,全面转向比拼集群利用率、任务完成率、故障恢复时间的时长以及每单位浮点运算的真实成本。 这也给所有需要交付 AI 价值的营销和增长高管提了个醒:当你们对外宣传“全自研大模型”或 AI 产品不可替代的体验时,底层的算力服务稳定性,直接决定了你们品牌承诺的兑现能力。
04 给企业决策者的行动清单:算力不是工具,是商业模式
对于志在利用 AI 重塑增长逻辑的企业老板、CMO 和高级管理者而言,将算力采购视为后勤保障的旧日子已经一去不复返。我们必须进化为新的商业物种,在战略层面重塑对算力服务的认知:
- 警惕“硬件免税”幻觉,拥抱“系统总成本”。 不要把决策压在初始硬件报价上。一张卡的显存在集成环境里能发挥多大能效、故障导致的任务重启成本、以及后续几近残酷的运维人力投入,才是真正的总拥有成本。算力服务采购,买的是一个确定性的结果,而非一张配置单。
- 将算力服务商定义为“联合增长伙伴”,而非“机房管理员”。 你们在双十一大促时需要弹性扩容,在现象级 Campaign 引发流量海啸时需要推理能力扛住并发。缺乏系统工程化能力的算力服务商,会酿成品牌公关危机。你需要审视对方的客户账本,寻找那些不仅有资源,更有工程师文化和服务文化的链主型企业。
- 区分“热炒菜”与“慢炖汤”。 企业内部的原始需求往往是混杂的:既有可以剥离给公有智算中心的低敏感度推理任务,也有必须扎根于私有化集群的核心训练业务。细分任务类型,实施多元算力策略,避免被单一厂家绑定导致资产沉没,同时防止数据泄露风险。
- 从体验端倒推算力架构。 营销和技术的关系正在发生逆转。以往,技术先搭好底子,品牌再去卖货;现在,用户对 AI 交互的任何一秒延迟忍耐度都为零。CMO 必须和 CTO 坐在同一张会议桌上,共同制定算力 SLA 协议——因为算力延迟,正等同于消费体验和转化率的流失。
05 结语:管理复杂性的艺术
伯虎财经在街采一位 WAIC 展商时得到一句精彩的注脚:走出展馆,产业真实图景和展馆内的热闹对不上号。卖铲子的狂欢是表象,挖金子的确定性才是终极战场。
在商业与人文交汇的宏大叙事中,算力服务的演进正在揭示一个朴素道理:让技术真正运转起来,远比拥有技术本身困难百倍。 当你排除了所有主机风扇和液冷噪音的干扰,你会听见,真正的算力生意,是一场关于组织协同、服务承诺与复杂系统美学的小众游戏。能学会管理这种复杂性的人,将在这场 AI 浪潮驶过浅滩进入深水区时,拿到唯一的一张船票。