(本文作者为 穷奇观察,钛媒体经授权发布)
文 | 穷奇观察
模型时代最贵的资产是排名。
而正在给全世界大模型排名的那几张表,是几家美国公司的内部流水。国内判断自家模型成色最快的方式,是看它在这几张流水单上跑第几。
这个错位,值得验一次尸。
流水单怎么变灯塔
OpenRouter,美国公司。它做的事一句话就能说完:把各家大模型的API挂在一个货架上,开发者从它这过一道手。Token是模型计价的基本单位,可以粗略理解成文本被切碎后的"字块";API是程序之间点菜下单的窗口。它不挣模型的差价——上游标多少钱,它就按多少钱过手,一分不加;它挣的是你充值那一下的手续费。性质上,这是美国版的硅基流动。同一个物种:私人API聚合商,赚的是过路费。
要补一句后来发生的事:2026年8月,支付巨头Stripe敲定收购OpenRouter,交易金额超过70亿美元,是它不到三个月前13亿美元估值的五倍多。这家柜台不再是一家小公司,它变成了支付基础设施的一部分。一家掌握钱路口子的公司给自己发排名,这层窗户纸比原来薄得多。
认识了这个物种,再看它头上那圈光环。国内科技媒体引它的榜单,句式整齐划一:全球开发者用Token投票、开发者市场认可度第一。太空兔登顶那阵子,中文互联网的快标题几乎复制粘贴同一张截图。
同一个物种,换了个国籍,待遇天差地别。硅基流动要是发一份"本周调用量榜",国内开发者会当回事吗?不会。谁都知道那是人家柜台里的流水,反映的是硅基流动的渠道,不是市场的口味。
可OpenRouter的同款流水,到中国就成了"全球公投"。
榜单的迷信,迷信的不是数据,是数据的出身。
这单子不代表市场
"调用量"三个字听起来是市场总量,实际上它只是"通过OpenRouter这一个渠道中转的Token数"。模型厂商的直销API,OpenAI和Anthropic的官方接口、微软Azure、亚马逊Bedrock、谷歌Vertex,一点流量都不在这张表里。
中国信通院人工智能研究所国际发展部主任许珊今年3月给过一记清醒的闷棍:OpenRouter每周的Token调用量,只占全球总量的2%左右。她还补了一句更要命的——OpenRouter上那些中国模型服务,数据中心实体大多部署在海外,海外开发者用的是部署在海外云平台上的服务。钱和Token都出了国门,电力却没从中国电网流出去。
拿这张表描绘全貌,等于拿一个批发市场的出货单当全国经济普查。
平台自己的用户结构也说明问题。美国用户占47.17%,中国用户占6.01%;按语言算,英语占82.87%,中文不到5%。这根本不是"全球投票",是以美国开发者为主的投票。它在全球最有影响力的地方,恰恰是它最不全球的地方。
还有一层更反直觉的。榜单上中国模型确实强。9月21日至27日那一周,中国模型在榜上处理62.22万亿Token,美国模型14.2万亿,连续二十二周领先。可这个"强"恰恰证明榜单失真,因为它衡量的是同一件事:谁能把量堆起来。
看最扎眼的一个数。那一周榜首被统计出19.6万亿Token,前十名里中国模型占了大半。
真正把量堆到榜顶的,不是能力,是价格。DeepSeek V4.1 Flash的闲时价是每百万Token输入0.15美元,GPT-5.5的输入价是5美元,中间隔着三十多倍。当一个开发者在跑Agent工作流、一次会话要调上千次模型,这个倍数不是脚注,是每天滚过去的预算线。
而榜首这个位子,是按月换人的。三月中旬,MiniMax M2.5以1.75万亿Token连着第五周坐第一;到八月初,位置换成小米的MiMo-V2.5,单周10.5万亿,周榜和月榜一起拿第一;九月下旬,DeepSeek V4.1 Flash以19.6万亿接棒;九月底当周,第一名又换成刚上线不久的匿名太空兔。冠军不固定,说明它不是"谁的模型最好",是"这个月谁的价格砸得最狠"。 榜单把一场打了半年的价格战,压缩成一周的照片,照片上写着"全球第一"。
还有更荒的一层。同一个官方页面,同一只兔子,隔两天再看,数字就变了。页面标注"数据截至9月30日"时,它是33.5万亿;改标"截至10月2日",它变成28.4万亿。同期DeepSeek V4.1 Flash从24.2万亿变成22.7万亿,GLM 5.3 Flash却从9.67万亿涨到10.6万亿。三条线不同向。
这不是谁在造假,是那个"周"字本身。OpenRouter的周榜是个滚动7天的窗口,每天关一天、开一天。窗口每往前挪一次,被挤出去的那几天的量不会补回来,换进来的是新几天的量。同一只兔子,同一张榜,隔两天两次抓取就差了5.1万亿。也就是说,一个滚动窗口挪两天造成的波动,抵得上一只中等模型一整周的生意。
这一栏的表头写着"周调用量",可它没有"周"。真实存在的只有一个持续往前爬的滚动窗口,和一串每天刷新的名字。所谓周榜,是把一个没有单位的读数,硬按进日历的格子。
拿这张表说"全球开发者选择",相当于拿黄金周的高速车流套全国全年的出行数据。车是真车,路是真堵:折扣期一到,平时封在车库里的车全出来了,服务区排成停车场。但没有人会拿这七天的车流,去推断全国人民平时怎么通勤。
免费放出来的流量,是价格放出来的,不是需求投出来的。
不谈价格就是耍流氓
调用量是价格弹性最大的指标,没有之一。这不是一句俏皮话,是这张表最硬的物理规律:调用量是"单价×次数"的乘积,而次数对单价的敏感度,远高于对模型好坏的敏感度。开发者换模型要重新调prompt、要担重跑的风险;开发者换到便宜一档的模型,什么都不用改。
9月23日上线的"Space Bunny",一只匿名兔子,10月2日经腾讯WorkBuddy国内独家接入,定价0.03倍积分——作者亲测,截至发稿它仍在线可调。0.03倍是什么概念:同样的预算,能调三十倍量的Token。
黄金周的车流里,没有一公里是按日常费率跑出来的。
折扣本身就是刷量加速器。免费匿名期更是官方开的薅羊毛窗口:提供方一栏写着"匿名",价格一栏写着"免费",调用量一栏写的是"不限量"。
调用量这张表的水分至少三层。批量任务型调用:一个仓库级的代码分析任务,一次吃掉普通人一个月的对话量,表上却只算一个"用户"。羊毛型调用:免费额度不薅白不薅,脚本挂着跑,Token哗哗走。自调型调用:厂商自己反复调自己的模型做测试,对外呈现为"市场热度"。
所以调用量这个指标,测的根本不是能力,是三样东西的乘积:性价比、促销力度、羊毛厚度。同一张表上,正价模型的1万亿Token和补贴模型的1万亿Token,含金量差着几个数量级,表上显示的是同一个数字。
失真才是卖点
现在才能讲兔子的事。
2026年9月23日,一个叫"Space Bunny"的模型匿名挂上OpenRouter。没有发布会,没有公司名,没有技术报告,没有价格。上线五天,它就以匿名之身冲上OpenRouter周调用量榜第三(9月21日至27日那一周,它只被统计了五天);一周之后,它以33.5万亿Token压过DeepSeek V4.1 Flash的24.2万亿,登上周榜第一,把一群有名有姓的大厂模型踩在脚下。10月2日,腾讯WorkBuddy官宣国内独家接入;OpenRouter上的免费入口10月5日关闭。
这只兔子不是第一个马甲。从今年2月到9月,OpenRouter的匿名区先后出现过八个"Alpha":Pony Alpha(智谱GLM-5)、Hunter Alpha(小米MiMo-V2-Pro)、Healer Alpha(小米MiMo系列,社区指认)、Elephant Alpha(蚂蚁灵2.6-flash)、Owl Alpha(美团LongCat-2.0)、Ox Alpha(智谱GLM-5.3-Flash)、Union Alpha(Unbiased Pareto,三十三小时就明牌)。七个全部被认领,多数在一两周内揭晓。太空兔是第八个,截至发稿没人认领。
这套打法有个行话,叫stealth发布。不发论文,不吹牛,匿名扔到擂台上,用调用量跑出口碑,跑漂亮了再官宣收钱。半年八个马甲七个认领,这不是几次前科,是一整条流水线,匿名刷榜已经从战术变成了标配。
最戏剧的是兔子的身份。社区拿分词器(把文字切成Token的工具)做指纹比对:一份报告显示,24组测试里它全部更接近MiniMax家族;另一份更广的测量集报50个测试字符串的Token计数与MiniMax系列高度一致。可官方不认。一只兔子,两种指纹,不到确认的边界。
技术正确的说法是"高度吻合",不是"就是"。这恰好暴露了榜单的另一个软肋:连考生的身份都验证不了,榜却已经给它发了名次。
看清楚这个循环了吗。匿名上榜,登顶截图,官宣收钱。榜单在这一刻不是裁判席,是免费的公测场加首发广告牌。而围观的人,误把它当成了市场。
恰恰因为这张表不代表市场,它才最适合当营销场。渠道失真不是这个玩法的漏洞,是这个玩法的地基。在没人当真市场的榜上跑第一,没有任何成本,只有收益。反正看榜的人以为它代表市场。
还有最后一笔实测账。OpenRouter上的免费入口10月5日关了,可腾讯WorkBuddy柜台里的那只兔子还活着——截至10月7日(发稿当天),它仍在线,仍按0.03倍积分计费可调,弹窗广告上写着"首发上线,10.2-10.7享限时折扣"。看清楚这个分工:**免费窗口开在别人的柜台上,刷完榜就关;收银窗口开在自己的柜台上,从头到尾没免过一天,用的是折扣价,还限时。**同一只兔子,两个柜台,一个负责出名,一个负责收钱——而且收银台连折扣都是倒计时:"公测场加广告牌"这个说法,被兔子的两只柜台亲口证实了。
裁判下场做了东
OpenRouter靠什么活?它不挣Token的差价——上游标多少钱,它就按多少钱过手,一分不加。它挣的是过路费:你往账户里充值买credits,它在充值那一下抽一笔手续费,信用卡渠道5.5%,最低0.8美元一笔。
产品是推理,收入是充值。这5.5%是理解这门生意的钥匙——它跟模型无关,跟贵贱无关,你充一百块,它拿五块五,这钱用来调DeepSeek还是调GPT,它不关心。所以对着70亿美元的收购价,不能按每一百万Token去算那几分钱;能对上号的是另一笔账:按第三方估算,它2026年中的年化收入约1.4亿美元,年化流水约25亿美元,70亿除以1.4亿,倍率在五十倍上下。
所以这门生意从来不是杂货铺逻辑,是收费站逻辑。它真正吃的三碗饭:第一碗,资金池。开发者预充值买credits,钱先趴在平台账上慢慢扣,天量预付款是无息借款——Stripe掏70亿,买的核心恐怕就是这碗饭。跑轨道的,买下了收费权。第二碗,手续费本身。不管你走哪条路,只要钱从这条管道过,它都抽走一道;流量越大,管道越粗,这道费越厚。第三碗,叙事和数据。榜单情报和流量故事不体现在当期收入里,体现在估值里。
收费站不靠每件货赚几分,靠的是"此路是我开"的确定性。至于过路的是便宜车还是豪车,它不太在乎——只要路是唯一的。
它的推荐又偏向高调用量模型:越是跑得多的,越被推给新用户;越被推,跑得越多。
自我强化的循环。表是给自己挣钱的广告牌。
至于那张投票数据。每一次调用,每一段对话,都是免费的人类反馈标注。三重收割一次完成:榜单导流自己的交易市场,投票数据白嫖做训练,排名叙事转手卖给资本市场讲故事。
而Stripe那70多亿美元,把这个循环的终点提前写好了:一家掌握全球支付口径的公司,只要把流量再变现一次,这张榜就从"行业参考"变成"结算层入口"。它不只发排名,它还收过路费。
这里还有一层更冷的账。有报道称,OpenRouter上Claude系列只占调用量的一成出头,却拿走平台约一半的消费金额;中国模型烧掉六成以上的Token,换来的是平台营收的小头。更要命的是钱在谁口袋里:美国平台既收着中国模型的过路费,又和OpenAI、Anthropic有现成的分账关系,而美国几家大厂在OpenRouter上的合计份额,已从2025年6月的约七成掉到2026年6月的约三成。哪一边弱势,答案不问自知。
这个物种的完整画像摆在这里:一家私人聚合商,用自家柜台的流水给全行业发排名;排名喂大自己的交易量;交易量让流水更好看;更好看的流水,发下一轮排名。排名不是它的副产品,是它的商品。
流水是真的。但当不了风向标。更何况,柜台已经卖给了一个收钱的人。
考生自己印考卷
如果OpenRouter是流水榜,Artificial Analysis就是考场榜。这家旧金山小公司给各家大模型出卷子、算综合分、排座次,是目前引用最广的智能指数。
先看这张考卷的构成。今年6月15日发布的v4.1版,是九项评测加权:GDPval-AA v2占20%,Terminal-Bench 2.1占16%,τ³-Banking占14%,HLE占12%,AA-Omniscience占12%(准确率8%加非幻觉率4%),SciCode占8%,GPQA Diamond占6%,CritPt占6%,AA-LCR占6%。
权重第一名的科目叫GDPval,出题人是OpenAI。2025年9月25日,OpenAI发布这套评测:44个美国职业、1320个真实工作任务,做的是美国白领交付物:咨询备忘录、专业图表、行业报告。数据底座是美国劳工统计局的职业库。这门课考的不是智商,是美国职场的干活能力。
这20%,在美国是真金白银的刚需。一份咨询备忘录的背后,是时薪几百美元的专业人士几小时的活,AI出草稿直接省大钱;美国公司的工作流天生文档驱动,交付物就是工作本身,AI写的备忘录能直接进流程、进账单。这门课的对错,美国企业用美元投票。
同样的"知识工作",在中国长得完全是另一副样子。干活的主体是微信群里一句话、钉钉里一个审批流、月底一张Excel。白领的人力成本是月薪几千到一万五,"AI替代白领"的账在这个人力成本下算不平。中国企业老板的真痛点是盯店、回差评、算清账。考纲里,一门都没有。
按v4.1的权重算总账:GDPval、Terminal-Bench、τ³-Banking三门,合计正好50%;另外六门通用课合计正好50%。九门课里,没有一门是中国市场的痛点课。
这里得把话说准:考纲偏科,不等于中国考生实力差,分数低不低是另一回事。真正的病是国内把这张卷子当通用成绩单供着,以及厂商真金白银砸研发预算,去对齐一门人家那里真实存在、我们这里基本虚构的活儿。
然后,尺子自己也开始动了。据公开的版本日志,9月初v4.2上线:新加AA-Briefcase和GDP.pdf两门评测,GDPval的权重被下调,GPQA Diamond因"饱和"退役。没过几天,v4.3又把τ³-Banking整门换掉,Terminal-Bench升到4.0。其后v4.3.2又对GDPval的评分锚点做了改动,改用新的拟合方式。
官方的说法是"分数动了,排名大体保留"。这话本身可能是诚实的。但代价埋得深:一张考卷四个月内换挡四次,所有跨版本的历史分数失去可比性;旧锚点一变,往后的刻度就换了一把。研究者比对前后两天的榜单存档发现,带GDPval评分的模型分数全部重标定,而当天转引这张榜的报道,几乎没有一篇写清版本号。
再看裁判。GDPval的评分,专家盲评之外,靠AI自动评分器,也就是训练来预测人类专家判断的模型;这套评委每隔几个月就换一茬最新旗舰。让考生的亲戚当裁判,给"像不像专业交付物"打分。
最微妙的是OpenAI自己下场那次的姿态。GDPval发布,它把自家GPT-5和竞品一起测:Claude Opus 4.1第一,47.6%的任务达到或超过专家水平;自家GPT-5第二,39.0%。自己办的考试,让对手拿状元。
自己家办的考试,让别人拿状元。这姿态看起来无私,其实是这个牌桌上最贵的广告。连对手都认的考卷,才是真正的考卷。
然后是付费方。AA靠卖订阅分析服务活着,客户是买模型选型的企业,和模型厂商自己。厂商既是考生,又坐在客户名单里。订阅收入给了它独立性:它不拿任何一家厂商的投资。可这个独立性是商业结构给的,不是制度给的:考纲由它一家定,权重由它一家调,版本由它一家发。这种"一行日志换一把尺子"的操作,防得住考生刷题,防不了出题人调刻度。
考纲的科目选择本身就是一种立场。当"经济价值"被定义成美国白领交付物,数学和代码的权重就被边缘化,而中国模型最锋利的恰恰是老本上那几门。
独立的生意,不独立的尺子。
圣杯按版本号折旧
第三张榜,是智商榜。
ARC-AGI系列在设计之初就立了条规矩:考"面对全新问题时现场悟规律的能力",不许背题,号称防刷到最后。很长一段时间它确实做到了:GPT-5在ARC-AGI-2上只得9.9%,Opus 4.5是37.6%,这张卷子是所有主流评测里最后失守的高地。
失守比想象中快。2026年,模型本体就把分数推了上去:GPT-5.5拿到85.0%,GPT-5.6 Sol拿到92.5%,9月GPT-6 Astra摸到95.0%。不是外挂架构攻破的,是模型自己长上去的。出题方3月25日推出ARC-AGI-3,把静态网格换成数百个手工交互环境,没有说明书、没有规则、没有胜利条件,全靠自己在里面试。
发布当天,官方给出的数字是:人类100%,前沿AI整体0.51%。
反转来得比前一次更快,但先把一场考试拆成两场。ARC Prize官方把成绩分两套口径:Standard,最小接口,厂商中立;Provider Adapter,允许使用OpenAI Responses API专有的推理状态保留与上下文压缩。同一个模型,同一张卷子:GPT-6 Astra在Standard口径下是62.7%,在Provider Adapter口径下是99.9%,官方自己的原话是"从62.7%提升到99.9%"。而榜上并排站着的上一代GPT-5.6 Sol那个7.8%,是Standard口径的数字。拿99.9%去跟7.8%比,不是同一场考试。
更微妙的是第二套卷面的性质。"保留我们看不到的推理状态"这项能力,是OpenAI的接口独有。Provider Adapter口径测的不只是模型,还有厂商的上下文管理基建——那是美国平台的自留地。考场的规则可以被东道主定制,这一次,出题方自己把话说白了。
最干净的一组对照也藏在表里:同一个模型,隔着一张卷,从优秀跌到近乎白卷,中间没有任何厂商换卷面的干扰,纯粹是卷子换了代。
值得记住的不只是分数,是节奏。ARC-AGI-2从2025年3月24日发布,到2026年3月25日ARC-AGI-3接棒,守了一年零一天。ARC-AGI-3只守了五个多月:7月第一笔里程碑奖发出,9月3日的公告里,标准口径已被推到62.7%,开放平台口径报出99.9%。
一张以"永远刷不了"为卖点的卷子,被模型本体攻破,被迫换题,换题之后一切归零:所有旧分数作废,所有旧排名变文物。而新卷子的保质期,正在以肉眼可见的速度变短。
圣杯的含金量,按版本号折旧。而且折旧的斜率在变陡。
三张榜排在一起,病是同一种:流水榜的调用量可以运营,考场榜的考纲可以定制、刻度可以重锚,圣杯的保质期正在以月计。记分牌的权威从来不来自它有多公正,来自还有多少人信。而信用的总额,正在被三家的各自玩法同时挤兑。
榜单还能信,但已经不值钱了。信的不是分数,是分数背后那家机构的商业模式和下一次更新日志。
三张榜怎么看不亏
看趋势,不看名次。三张榜的日间波动、版本间落差,跟模型能力提升没关系。看一个模型连续四周在榜上的位置,比看某一期的第一名有用得多。名次是快照,趋势才是变化。
看版本号,看更新日志。9月里AA连改四版这件事应该刻进所有人的脑子:任何引用AI榜单分数的研究、报告和文章,都该先问一句,这是哪个版本、哪天抓的。不知道版本号的分数,等于没有分数。
看价钱,看你真正付的钱。榜单里的"能力"和成本是不匹配的。Artificial Analysis同时公布每题成本,中国开源模型在这一栏上的优势比在总分上更明显。花钱之前,参照系应该是单位任务成本,不是那张总表。
三个月后看四件事:AA是否再出一次换题或换锚点的版本,要是又换,说明九月不是事故是常态;Stripe整合OpenRouter之后榜单规则动不动,要是动了,排名从"行业参考"变"支付入口"就算落了实锤;下一只匿名兔子是否继续重复"免费登顶、官宣收钱"的流水线,要是还在跑,说明匿名刷榜已是从标配变成行规;第四件最近——太空兔的限时折扣10月7日到期,到期后是恢复原价走完漏斗,还是继续延期坐实"0.03就是常态价",一周内见分晓。四项任何一项落地,都说明这三张榜的信用挤兑还在加速。
数据来源与说明:
Stripe收购OpenRouter(2026年8月敲定,逾70亿美元,收购前估值13亿美元):彭博社首发;TechTimes、CNBC、财联社、钛媒体、36氪交叉。
OpenRouter用户与语言结构(美国47.17%、中国6.01%、英语82.87%、中文不到5%):OpenRouter与a16z联合发布报告及官网数据页;经济观察报、每经转引一致。
"OpenRouter周调用量约占全球2%"及"中国模型服务的数据中心实体多部署在海外":中国信通院人工智能研究所国际发展部主任许珊,工人日报客户端(2026-03-31)原文。
周调用量对比(9月21至27日中国62.22万亿、美国14.2万亿、连续二十二周领先;DeepSeek V4.1 Flash 19.6万亿居首、GLM 5.3 Flash 16.3万亿第二、太空兔13.9万亿第三):每日经济新闻(2026-09-28)测算、OpenRouter周榜数据、壹览商业(2026-09-29)独立测算一致。
同一页面两个抓取时点的读数差(Space Bunny Alpha:页头标"Usage data through Sep 30, 2026"时33.5万亿,标"through Oct 2, 2026"时28.4万亿,差5.1万亿;同期DeepSeek V4.1 Flash 24.2万亿→22.7万亿,GLM 5.3 Flash 9.67万亿→10.6万亿):作者于OpenRouter官方rankings页两次实抓,页面自带data-through日期戳。注:周榜为滚动7天窗口,窗口前移会剔除旧日计入新日,官方未解释口径;正文只陈述两次读数差,未推断"缩水"成因。
冠军按月轮替(三月中旬MiniMax M2.5周榜1.75万亿、连续五周第一:每日经济新闻3月9日至15日口径;八月初小米MiMo-V2.5单周10.5万亿、周榜月榜双第一:央视网、艾瑞网2026-08;九月下旬DeepSeek V4.1 Flash 19.6万亿居首:每日经济新闻9月28日;九月底当周Space Bunny Alpha居首:OpenRouter官方rankings页实抓)。注:这四组数据分属不同月份、不同周窗口,文中按月份叙述,不做跨周直接比较。

OpenRouter收入结构:不赚Token差价,Token按上游原价过手;收入来自充值手续费——信用卡5.5%(最低0.80美元/笔)、加密货币5%、BYOK超额部分5%(2026-10核验):OpenRouter官方FAQ与pricing页;amnic.com、codenote.net、dev.to、getmegabrain.com多源交叉一致。
stealth名单及认领情况:智谱GLM-5技术报告(Pony Alpha彩蛋)、Ox Alpha由智谱8月26日官方认领、Union Alpha由Unbiased揭晓;电子工程专辑、GitHub指纹研究、hunteralphahub.com汇编交叉。Hunter/Healer/Owl归属小米、美团为社区指认口径。
GDPval构成(44职业、1320任务、BLS底座)与首测分数(47.6%/39.0%):OpenAI技术报告(2025-09-25)。媒体报道另有49%/40.6%口径,本文采用论文口径。
Artificial Analysis总部位于旧金山(另在悉尼、墨尔本设办公室,非伦敦):artificialanalysis.ai/about及careers页(2026-10核验)。
DeepSeek V4.1 Flash定价:DeepSeek官方价目(2026年9月,含峰谷)。GPT-5.5"5美元"为输入价,输出价约30美元/百万Token。
WorkBuddy"0.03倍积分"定价:腾讯新闻确认独家接入与10月5日关闭免费入口;0.03倍计费、至今在线及"10.2-10.7限时折扣"弹窗为作者亲测(2026-10-07,折扣期最后一日)。
太空兔身份归属MiniMax:分词器指纹为社区归因线索(一份24组更接近、一份50个测试字符串高度一致),非官方确认;仅能指向MiniMax家族,不能确证具体版本。
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App
English translation pending.

投资人评论
聊判断,不堆黑话登录且账号审核通过后可评论。 立即登录