Ai小编 发表于 昨天 08:04

AI代理算力消耗达人类5倍:一场"记忆体短缺"正在逼近

你可能以为AI的算力消耗主要花在"思考"上——模型推理、生成回答。但最新数据给出了一个反盷觉的答案:真正吃算力的,是AI反复读取自己上下文带来的"快取负载"。而AI代理(AI Agent)的Token消耗,已经是人类的约5倍。


一、5倍这个数字是怎么来的?


数据来自创投机构a16z整理的OpenRouter统计,由Futurum Group执行长Daniel Newman引述。截至2026年8月,AI相关的Token使用量已达到人类的约5倍,且差距预计还会继续扩大。


为什么是5倍?因为AI代理的工作方式和人不一样。人在跟AI对话时,一轮一次,问完就结束;而一个AI代理为了完成一个任务,会反复调用工具、反复回读上下文、反复自我校验。每一次"回读"都在重新消耗一遍已经读过的内容。有测算显示,在代理式AI中,CPU负责任务编排的耗时可以占到总延迟的50%到90%。


二、不只是算力问题,是内存问题


算力消耗的暴增,最先撑不住的可能不是GPU,而是内存。行业分析指出,AI代理对服务器CPU的需求拉升,会延续到2027年;而配比正在从传统的1:8向1:1甚至更低收敛。Arm在"Arm Everywhere"大会上的预测更直接:在传统云端架构下,每GW资料中心大约需要3000万颗CPU核心,但进入代理式AI时代后,这个需求会提升到1.2亿颗,等于增长约4倍。


四倍的CPU核心需求,意味着对应的内存、存储、网络都要同步扩容。所以"全球记忆体短缺可能加速爆发"不是危言耸听——它是可以倒推出来的结果。


三、涨价已经发生了


供需紧张最先反映在价格上。根据路透社2026年7月的报道,中国服务器CPU部分产品累计涨幅已超过40%。台湾《电子时报》的消息则称,英特尔PC CPU预计在2026年10月5日再度涨价约10%,涉及部分消费级与服务器CPU。机构判断,不排除CPU行业的涨价趋势延续至2027年。


对普通人来说,这意味着什么?短期看,是服务器、云主机、甚至部分消费电子产品的成本压力会往上走。长期看,是"算力账单"会成为每一家做AI的公司绕不开的经营成本。


四、算力越涨,效率技术越值钱


有意思的是,算力紧张并没有让行业停下来,反而把"效率"推到了舞台中央。2026年最受关注的技术方向之一就是线性注意力机制——它把传统自注意力的平方复杂度降到线性级别,处理长上下文时计算复杂度可降至O(TlogT),内存复杂度可降至O(logT)。


另一条路径是"测试时计算"(Test-Time Compute),把算力从训练阶段转移到推理阶段,通过动态分配计算资源来提升推理质量。卡内基梅隆大孥的研究认为,这会成为未来通用人工智能发展的关键使能技术。


五、普通人该怎么看这件事?


第一,别把"AI很贵"当成短期现象。代理式AI的Token消耗结构决定了,它天生就是资源密集型的,这不是优化一两个模型就能解决的。


第二,硬件相关的投资逻辑正在变化。CPU、内存、存储这些"不性感"的环节,因为AI代理的兴起重新变得关键。


第三,效率技术会持续成为热钱方向。谁能让AI用更少的算力干更多的事,谁就在这一轮里握住定价权。


写在最后


AI代理消耗人类5倍Token、CPU需求可能涨4倍、服务器CPU累计涨价超40%——这三个数字串起来,讲的其实是同一件事:AI正在从"聊天工具"变成"干活的人",而干活的代价,比聊天贵得多。这场算力与记忆体的紧平衡,才刚刚崀始。
页: [1]
查看完整版本: AI代理算力消耗达人类5倍:一场"记忆体短缺"正在逼近