币海NEWS

首页  >  全球资讯 >  社会热点 >  AI大模型推理拆解:Token工厂的分工调度与算力赛道财富密码

AI大模型推理拆解:Token工厂的分工调度与算力赛道财富密码

股海柠檬精 来源: 2026-09-23 06:48
x    facebook    telegram    复制链接
重点摘要
当大模型越来越聪明,背后的算力工厂运转越来越精细时,未来决定AI战争胜负的,到底是英伟达这种造铁疙瘩的人,还是那些天天在后台优化调度代码的程序员?

AI大模型推理拆解:Token工厂的分工调度与算力赛道财富密码

当你向AI大模型抛出一个问题,到屏幕上开始一个个蹦出字的这零点几秒里,你以为它只是查了下字典?

错!它背后其实疯狂地启动了一整座等级森严、分工极其变态的重工业工厂。

最近,硅谷研究机构SemiAnalysis发布了一份剥洋葱式的深度研报。他们把这个被称为Token工厂的推理过程,彻彻底底地拆解了出来。看完这份报告你就会明白,未来真正能在这个赛道里赚到大钱的,不仅是造芯片的,更是那些精通车间管理的人。

先来搞懂现在的AI大模型(也就是MoE架构)到底是怎么干活的?

以前的AI模型特别笨,你问一个问题,它要把所有的知识库(也就是参数)全部翻一遍。但现在变聪明了,模型里装了一个精准的路由器。这就好比你去了超级医院的大厅,分诊台护士直接把你送到了最对口的两个老专家面前,其他医生根本不需要搭理你。

这就带来了一个致命的变化,数据该存在哪,成了一门昂贵的生意。

研究机构发现,AI在跟你聊天的时候,它要拼命记住你前面说过的话(也就是KV状态)。这里面分出了残酷的三六九等:

目前正在跟你聊的、热乎乎的数据,必须住在离芯片最近、寸土寸金的HBM黄金地段;

刚聊完的上一个话题,立马被扔进二线的CPU内存里暂存;

至于昨天聊过的那些老黄历,直接被发配到廉价的网络硬盘里等着落灰。

这就戳破了目前科技圈一个巨大的幻觉,很多老板以为买显卡,内存容量越大越好。但这份报告极其明确地警告,错了!带宽比容量更值钱!

在达到够用的门槛之后,你再去拼命堆内存容量,纯粹是在白烧钱。因为数据只有在被极速调取和计算的瞬间才能产生利润,它如果在内存里趴着睡大觉,除了耗电一无是处。所以,让你的芯片跑得快,远远比装得多更重要。

那么既然硬件这么贵,怎么才能把这帮显卡牛马榨干?

这就要引出研报里关键的底层逻辑了——也就是四个分工完全不同的工作阶段,预填充、中间填充、解码注意力,还有解码专家。

听名字别觉得晕,其实可以把这四个阶段,想象成工厂里的四个工种。有的是专门搞重体力计算的,有的是专门搞快速记忆的。这四种活对硬件的要求简直是天差地别。如果让短跑运动员和马拉松选手用同一套训练方案,那绝对是一场灾难。

因此谁能在这个极其复杂的流水线里,当好那个拥有上帝视角的厂长(也就是调度系统),谁就捏住了这门生意的最大利润池。

如果在某一个环节,比如AI写了一篇几千字的超长小作文,把解码工位给堵死了,后面的任务就会疯狂排队,整个系统瞬间陷入潮汐式的瘫痪。那些顶级的工程师,现在每天都在绞尽脑汁地设计各种缓冲区和红绿灯,就是为了让整个算力工厂的车间,能一直保持满负荷的印钞状态。

现在整个AI硬件圈正在因为怎么建这个工厂,爆发现激烈的路线之争。

一派认为,既然四道工序要求不同,那就造四种不同的专用机器,搞分离式流水线。

另一派则认为,来回搬运数据太麻烦了,必须把所有的活都在同一台超强机器上搞定。

而这场辩论最后的赢家,完全取决于人类到底能不能造出一块既能搞极高强度计算、又能实现极高内存带宽的全能终极明星芯片。就连黄仁勋的英伟达,现在都在为这场豪赌做两手准备。