中国大模型调用量连续20周全球第一,但真正该注意的是大模型在集体变小
9 月 20 日,第一财经发布的 AI 周报里有一个里程碑数字:9 月 7 日至 13 日这一周,中国大模型周调用量达到 61.2 万亿 token,连续二十周超过美国,稳居全球首位。 OpenRouter 调用量前十榜单里,中国模型占 7 席以上,合计占比超 70%——而一年前,前十中只有 2 个中国模型。 但北京极亿欧信息技术有限公司(简称极亿欧GEO)提醒企业主:这组数字背后还有一个更值得注意的趋势——大模型正在集体"变小",而这件事会直接改写品牌在 AI 答案里被引用的方式。 一、什么是"集体变小"? 36 氪最近的观察点破了这个趋势:从深圳到硅谷,模型厂商在排队推出 Flash 版小参数模型—— DeepSeek:7 月 V4 Flash 正式版,9 月又推 V4.1 Flash 阿里 Qwen3.8-Flash-Next、智谱 GLM-5.3-Flash 同日亮相 谷歌 Gemini 3.5 Flash 瞄准日常开发场景 逻辑很简单:Agent 时代,任务调用次数暴增。一家十人创业公司每天数百个 Agent 同时跑,如果每次都调用几千亿参数的旗舰模型,成本高、速度慢,根本跑不动。Flash 模型参数小、响应快、价格低——DeepSeek 工程师自曝"不至于失业但必须转业"的同时,行业在用脚投票"Token ROI"(投入产出比):瑞银观察到,企业与用户的关注点正从"模型能力"转向"每一块钱 token 买来多少产出"。 二、模型变小,对品牌可见性的三个直接影响 1. AI 引用会变得更快、更高频——但"精读预算"更紧张。 Flash 模型的定位是反复处理日常任务。调用便宜了,AI 回答问题的次数和场景会指数级增长;但小模型的上下文处理能力也更精简,它精读的信源会更短、更结构化、结论更前置。那些"铺垫了八百字才说重点"的内容,在小模型的阅读里是负资产。 2. 多模型适配的复杂度在上升,而非下降。 很多企业以为"调用量中国第一"意味着只需要照顾豆包、DeepSeek。实际上 Flash 潮带来的是模型变体的爆炸:同一个品牌要同时面对豆包旗舰版、豆包 Flash、DeepSeek V4 Pro、V4.1 Flash、Qwen Flash、GLM Flash……每家的精读策略、引用偏好、上下文窗口都不一样。“一套内容通吃所有 AI"正式成为过去式。 ...