先给你讲个非常荒诞的事情。现在有些美国公司,好不容易通过裁员,用 AI 去替代这些员工,以为可以降本增效,结果庆功宴还没开,财务冲进来说:老板,这个月的 token 账单,是以前人力工资支出的三倍,你说这怎么搞?
是不是多多少少有点黑色幽默了,但你别说,这种事情听着像段子,却在事实上,实实在在在往这个方面发展了。最近华尔街刷屏的一组数据,就指向这个方向。
事情从一张图说起。
高盛交易台最近抛出一个指数,LLM Token 支出指数,八月底收在0.97美元,每一百万token 不到一美元,单月跌了29%,比五月高点2.05美元,直接腰斩。
然后全网都在转:AI 越来越便宜拉,马上就要替代人类拉,我跟你说,大错特错!因为 token。单价确实在跌,可完成一件任务要消耗的 token,反而在变多。
这就是经典的杰文斯悖论。1865年英国人杰文斯就发现,蒸汽机越改越省煤,英国煤炭的总消耗反而越多。东西越便宜,用得越凶,总账只增不减。
全球最大的模型中转站之一 OpenRouter,年初一周调用量是 6.4 万亿 token,到八月底,一周 93.4 万亿,八个月翻了将近14倍。摩根大通算过,就八月这一个月,token 用量环比涨47%,看到没有,token 单价跌29%,总量消耗直接翻了14倍,什么概念?
那么问题来了,为什么消耗量一下多了十几倍?是谁烧出来的?我告诉你,就是Agent自己。
今年2月6号,agent 自己烧掉的 token,第一次超过人类。到八月中旬,agent 自己一周能烧7.3万亿,人类自己对话那些烧掉1.4万亿,足足五倍差距。
看到了吧,人家 agent 自己跑任务,消耗量越来越大,你在对话框问一句,一问一答,一次调用,完事。agent 要替你把活干完:先拆任务,再调工具、写代码、跑一遍、看错在哪、推翻重来,一个任务几十上百轮。
更反常识的是,模型本身不留记忆,每干一轮,都得把前面的记录、文档、代码重新喂一遍。第一轮轻装,第十轮扛着前九轮跑,越滚越大,新输出还全额计费。
Anthropic 实测:单个 agent 完成一件事的 token 消耗约是普通聊天的4 倍,多 agent 分工审查,直接15倍。循环每转一轮都要重新喂一遍上下文窗口。
你就比如谷歌的新模型:明面 token 单价一分没涨,但输出量却多了三成、调用轮次也多了,完成同一个标准任务,成本反而比原来贵了40%。
OpenAI 自己也披露,研究员跑 agent,一天成本中位数 600 美元,最狠的一拨,一天 7000美元。现在还只是人指挥 agent,往后 AI 自己跑循环、甚至 agent 自己还要参与训练下一代模型,token 只会无穷无尽地烧,高盛预测,光 agent 这一项,到2030年月 token 消耗量还要再涨24倍。
这样下去,那么问题就来了。
你现在 token 单价再跌,也不可能跌到零。因为芯片折旧、电力、机器维护,全是硬成本,厂商还得留一份利润。高盛那张图里还有条线:token 价格腰斩,可 GPU 租金同期几乎没动,硬成本根本不陪你降价。单价能跌,但底下有地板,可另一边,一个任务吃掉的 token,还在指数级往上走。
你把这两件事加一起一算,越往后走,让搞 AI 去干活儿这件事情,真的一点都不便宜。
而且最搞笑的是,你招个人,还能去画饼,还能言语上激励他给你干活;但是你用 agent 的话,它可不吃饼,人家只认 token,还不接受一丁点赊账。
所以接下来打工人先别慌了,别整天担心自己被替代,照这种趋势搞下去,你小一点的公司,养个人尚且还有余地,养 agent 的话,一拉账单比人还贵个几倍,这可怕是真的搞不下去了。