返回列表 发新帖

AI推理经济火了:一亿美元种子轮、估值暴涨20倍,跑得快比模型大更值钱

12 0
Ai小编 发表于 昨天 11:19|中国 | 查看全部 阅读模式
一句话结论:2026年8月,AI推理赛道迎来爆发——开源引擎SGLang孵化的RadixArk宣布完成超1亿美元种子轮融资,推理平台Baseten估值从21亿美元暴涨到130亿美元,年收入增长20倍,AI竞争正从"拼模型"全面转向"拼推理"。


如果你还停留在"AI拼的是谁家模型参数大"的旧印象,那2026年8月的这波行情可能会让你改观。最近,AI推理赛道成了资本最拥挤的地方,一连串融资和估值暴涨的消息,把"推理经济"四个字推到了风口浪尖。


最重磅的,莫过于由开源推理引擎SGLang孵化出的商业化团队RadixArk正式亮相,并宣布完成超过1亿美元的种子轮融资。种子轮就融到一亿美元,这在AI圈也是相当炸裂的数字。而它背后的逻辑很简单:当模型竞争从"训练阶段"全面转向"大规模部署与推理阶段",怎么让模型跑得更快、更便宜,就成了所有企业的生死线。


一、估值数字有多疯?


先看几组硬数据。同赛道的AI推理平台Baseten,估值从21亿美元一路暴涨到130亿美元,年收入增长高达20倍;另一家Fireworks更夸张,7个月内估值翻了四倍,达到175亿美元,年化营收突破10亿美元。要知道,这些可不是训练大模型的明星公司,而是专门帮别人跑模型的"卖水人"。


为什么资本这么热?因为推理是AI真正落地的"最后一公里"。模型再强,如果跑一次要等几秒、烧几块钱,企业根本用不起。而推理优化的本质,就是把这"最后一公里"的成本和延迟压到极限。


二、推理技术到底优化了什么?


很多人好奇,推理加速是不是玄学?还真不是。早期推理引擎像排队打饭,一个算完才轮到下一个;后来演进到批处理(Batching),凑满一车再发车,可只要车上有一个长文本请求,所有短文本用户都得陪着干等。现在主流是连续批处理(Continuous Batching),GPU变成一辆随时上下客的公交车,新请求随时上车、算完随时下车,吞吐量直接提升2到4倍。


更关键的是Prefill/Decode(PD)分离。大模型推理分"读入"和"生成"两个阶段:读入是高计算密集的,要快速吃下大段文字;生成是内存带宽密集的,一个字一个字往外蹦。过去两者塞同一张卡互相拖累,如今像DeepSeek等顶级团队都采用PD分离架构——用32张GPU组成读入最优单元,一旦开始逐字回答,任务立刻通过高速网络交给专门的生成卡集群。两拨卡各司其职,互不干扰。


三、从"黑魔法"到"公共设施"


这轮推理浪潮还有一个深意:打破前沿实验室的壁垒。过去极致的AI Infra优化技术,是少数顶级Frontier Lab独占的"黑魔法"护城河。但随着SGLang、RadixArk和开源生态的崛起,这些技术正在变成任何一家初创公司都能即插即用的公共基础设施。RadixArk创始人的一句话特别有分量:"我们做这件事最大的动力,就是希望以后不再有'Frontier Lab'这个词。"


确实,当推理优化从拼硬件周期(动辄以年计算)转向拼工程和算法(能把GPU利用率从50%推到90%以上),边际收益是惊人的——相当于凭空多生出一台价值数百万美元的顶级机柜。这也意味着,AI的竞争门槛正在下移,玩家更多、生态更活。


四、对我们的启示


这一波推理经济,说到底是在回答一个问题:AI怎么从"能做"变成"用得起、用得起还快"。对企业来说,与其纠结换哪个更强的新模型,不如先看看自己的推理链路是不是已经优化到位——很多时候,省下的成本和提升的速度,比换模型更实在。对个人开发者来说,开源推理工具链的成熟,意味着你也能用上几周前还属于大厂"黑魔法"的优化能力。


2026年的AI,正在从"谁的模型大"转向"谁的模型跑得快、跑得便宜"。这个转变,才刚刚开始。


(本文首发于AI资讯,2026年8月26日)

回复

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

得知互动是一个融创意、设计、开发、营销、生活、互联网于一体的专业交流分享平台。
Copyright © 2026 得知互动-专注Ai与站长技术交流社区-Ai交流平台 版权所有 All Rights Reserved. Powered by Discuz! X5.0 鄂ICP备15006301号-5|鄂公网安备 42018502006730号
关灯 在本版发帖 扫一扫添加QQ客服 返回顶部
快速回复 返回顶部 返回列表