参数竞赛重启:各大模型的现状,和接下来值得等的东西

参数竞赛重启:各大模型的现状,和接下来值得等的东西

过去一个多月,“参数量”这个词重新回到了 AI 新闻的标题里。7 月 16 日,月之暗面开源 Kimi K3,总参数 2.78 万亿,是目前全球最大的开源模型;8 月 3 日,阿里发布 Qwen3.8-Max,2.4 万亿;8 月 12 日,马斯克的 Grok 4.6 上线,1.5 万亿。加上今年 1 月就上线的百度文心 5.0(2.4 万亿),“两万亿俱乐部”在一个夏天里凑齐了三家中国公司和一家美国公司。

这事放在三年前不算新闻,放在去年就有点反常。2025 年 DeepSeek R1 横空出世的时候,行业的主流叙事还是“小模型够用了”——R1 用远小于 GPT-4 的成本打平第一梯队,所有人都在讲效率、讲蒸馏、讲参数规模不重要。一年之后,参数竞赛回来了。

我把最近几周各家的官方公告、技术报告和靠谱媒体的报道翻了一遍,把确定发生的、官方承认的、只是传闻的消息分开。这篇算一份中场盘点:各家现在到哪了,接下来半年有什么值得等。

先解释一件事:为什么参数又能卷了

答案是一个老技术的全面成熟:MoE,混合专家。原理不复杂——把一个巨大的模型拆成几百个“专家”网络,每次提问只唤醒其中一小撮,其余的沉睡。总参数决定模型“知道多少”,激活参数决定“回答一次花多少钱”,这两件事从此可以分开卷。

Kimi K3 总参数 2.78 万亿,但每次只激活 16 个专家、约一千亿参数,单次推理的成本大概和两年前一个千亿级模型差不多。DeepSeek V4-Pro 是 1.6 万亿激活 490 亿,激活率 3%;Qwen3.8-Max 是 2.4 万亿激活 950 亿。今年所有上万亿的旗舰,激活率普遍压在 3% 到 8%。

换句话说,这轮竞赛卷的是万亿参数的体格、千亿参数的饭量。谁能让大模型用得省,谁才敢把参数做大。

还有一层原因不好听但真实:公开的高质量数据快被用完了,海外模型又从 6 月起限制中国厂商调用 API,靠“蒸馏”变强的路变窄了。想再上一个台阶,各家只能回头砸参数、砸算力、自建数据循环。

MoE 蜂窝舱墙:总参数 2.78T、专家 896 个、每次唤醒 16 个

中国:把万亿参数开成了大路货

Kimi K3:全球最大开源模型,和一次被迫的暂停

K3 是这个夏天最值得细说的模型。2.78 万亿参数、896 个专家每次激活 16 个、原生多模态、100 万 token 上下文,7 月中旬发布并开源。技术报告里最有意思的是 KDA(Kimi Delta Attention):把随对话无限膨胀的 KV 缓存压缩成固定大小的状态矩阵,让百万上下文的算力开销大幅下降。这家公司从早期就押注长上下文,现在长上下文成了全行业的军备。

成绩摆在那里:前端代码竞技场全球第一,SWE-bench Verified 76.8%。商业上的剧情更戏剧:估值半年从 43 亿美元涨到 350 亿美元,API 收入占七成;然后 7 月 19 日,因为算力不够,暂停了 C 端新用户订阅。全球最大的开源模型,自家付费入口先关了——这个细节比任何跑分都更能说明这一轮竞赛的成本烈度。

灯塔:2.8T 全球最大开源模型,封条「暂停新用户订阅」

Qwen3.8-Max:十几天交付一个完整项目

8 月 3 日发布,2.4 万亿参数,和文心 5.0 并列国内最大。官方演示里最抓眼球的一件事:模型花了十几天自主编程,独立交付了一个有 265 次 commits 的完整项目。视觉理解竞技场全球第二,仅次于 Claude 系列。一周后,27B 的同源版本开源。旗舰闭源、小模型开源,阿里这两条腿走了几年,是它和字节、百度路线最大的不同。

DeepSeek V4:看点在注意力,不在参数

V4-Pro 是 1.6 万亿参数、490 亿激活,100 万 token 上下文,最大输出 384K。架构上的两招值得记一下名字:CSA 把长记忆做稀疏压缩,HCA 用更激进的压缩换密度,效果是同样跑 100 万上下文,单 token 推理算力只有上一代的 27%,KV 缓存降到 10%。商业上,DeepSeek 完成了传闻已久的首轮外部融资,估值站上 500 亿美元,同时把编程智能体框架 Harness 开源了出来——我们之前写过它源码里那 505 份 AI 工作笔记,感兴趣的可以翻翻。

字节、智谱,和其他几家

字节豆包 Seed 2.0 系列总参数约一万亿,两亿用户跑在上面,今年总投入约 2000 亿元人民币;视频模型 Seedance 2.5 单次生成 30 秒 4K 画面。智谱 GLM 5.2 以 753B 总参数、40B 激活的规格 MIT 开源,终端任务基准拿了 81%。MiniMax 靠 Lightning Attention 把上下文做到 400 万 token,年初在港股上市,视频模型 H3 在编辑榜排第一。阶跃星辰不声不响,智能体方案装进了 4200 万台手机。腾讯混元 3 月把旗舰模型的输入价上调了 463%——API 单边降价的时代,至少在腾讯这里结束了。百度文心 5.0 是 2.4 万亿的原生全模态模型,今年 1 月上线正式版。

2T 俱乐部拱门:门内三亮牌、门外两排队牌

美国:有人在稳定发货,有人卡在半路

Anthropic:唯一“按点发车”的前沿实验室

Claude 5 今年发完了全家:6 月的 Fable 5(旗舰)、6 月底的 Sonnet 5、7 月 24 日的 Opus 5(通用主力,价格是旗舰的一半,官方称前沿智能接近 Fable 5)。官方节奏是四到八周一个新模型——在别家普遍跳票的年份,守时本身就是竞争力。中间有个插曲:Fable 5 发布三天后因美国出口管制指令在全球暂停访问,7 月初恢复;Sonnet 5 原定 8 月底涨价,最后宣布不涨了。下一代 Fable 5.1 有 8 月发布的传闻,官方没确认。

Anthropic 心电图:4-8 周一次的发布节奏

OpenAI:Astra 到底什么时候来

官方确认的部分:GPT-5.6 系列 7 月上线,分 Sol、Terra、Luna 三档;以及一个叫 Astra 的内部模型确实存在——OpenAI 发过一篇 Astra 解开的十个数学和理论计算机开放问题,又发过安全声明,说“无法排除”它达到网络安全能力的 Critical 门槛。至于“10 万亿参数”,那是爆料的说法,官方从未确认;发布时间一推再推,预测市场上 8 月底前亮相的概率只剩两成多。

一个背景值得知道:自 2024 年 5 月的 GPT-4o 之后,OpenAI 已经两年多没有完成过一次真正的下一代全规模预训练。GPT-5.6 很强,但它属于 GPT-5 系的迭代;Astra 才是那个“下一代”,而卡住它的不是算力,是安全评估。更后面还有一个代号 Doug 的更大项目,据称可能用英伟达下一代 Vera Rubin 芯片训练,爆料说最迟 11 月发布。

亮灯列车与巨大轮廓 Astra:安全评估闸门

Google:Flash 月更,Pro 跳票

DeepMind 今年 Flash 系列发得勤,3.5、3.6、3.7 几乎月更,3.7 还限时半价。但真正的旗舰 Gemini 3.5 Pro 从 6 月跳到现在:彭博社 7 月报道它卡在编程能力不达内部目标,发布推迟数月,Alphabet 市值当天蒸发约两千亿美元;国内媒体报道布林亲自接管了 Gemini 团队;官方只说“近期”推出,顺带确认 Gemini 4 已经开始训练。8 月初还有一场组织地震:Hassabis 卸任 DeepMind CEO 转任董事长,效力谷歌 27 年的 Jeff Dean 和几位元老离职创业。一家不缺算力不缺人才的实验室,被“发布质量”卡住了——这说明大模型的工程不确定性,没有因为算力变多而下降。

到站屏:Flash 月更绿点,3.5 Pro「近期」

xAI:马斯克的节奏

8 月 4 日 SpaceX 财报电话会上,马斯克给出路线图:Grok 4.6(1.5 万亿)8 月,Grok 4.7(2.1 万亿)一个月后,Grok 5 年内——用上全部 25 年的 SpaceX 火箭工程数据,参数传闻 6 到 10 万亿。顺带一提,早期媒体传 Grok 4.6 是 2 万亿,被马斯克本人修正成 1.5 万亿。这家公司的算力扩张同样激进:年底 2GW,2027 年底冲 10GW。信不信由你,但过去一年马斯克说的模型发布时间,兑现率不算差。

Meta:开源旗手的转身

4 月,Meta 发布 Muse Spark——第一个闭源、只走 API 的推理模型,同时成立超级智能实验室。8 月 10 日扎克伯格发了一篇 6500 字公开信《The Future is for Everyone》,说未来会“谨慎选择开源什么”,配套放出一个 30B 的本地小模型安抚社区。而训练了两年多、2 万亿参数的 Llama 4 Behemoth,至今没有发布。8 月白宫的前沿 AI 管理框架由 OpenAI、Anthropic、Google、微软、xAI 共同参与设计,Meta 没有座位——开源权重模型管不住,索性不管。

微软和苹果:一个脱钩,一个入乡随俗

微软今年 Build 大会上亮出 MAI 自研模型家族,8 月起 Copilot 的默认引擎换成自研模型,年化收入已到百亿美元量级;与 OpenAI 的排他条款早已松绑,Azure 里照卖 OpenAI、Anthropic、xAI 全家的模型。一边自研,一边分销,微软不再把宝全押在 OpenAI 身上。

苹果 AFM 3 在端侧做了个漂亮的 MoE:20B 参数每次只激活 1 到 4B,完整权重存在闪存里,收到指令后只把需要的专家搬进内存,iPhone 上能跑到每秒 30 个 token。中国版更值得注意:路透社 8 月报道,苹果与阿里合作为中国市场专门训练模型,7 月已完成备案,集成通义千问,预计随 iOS 27 推送——这会是外国公司第一次在中国跑自己的 AI 模型。对了,苹果 7 月起诉了 OpenAI,理由是商业秘密侵占,他们统计有 400 多名前苹果员工现在在那边上班。

Mistral 一句话带过:Large 3 以 675B 参数开源,卖点是数据主权——推理可以选择只在欧盟境内完成。

殊途同归:全行业在做同一道题

把各家技术报告摆在一起看,2026 年的标准技术栈高度趋同:MoE 打底,激活率 3% 到 8%,外带一个常驻的共享专家;注意力层做压缩——Kimi 的 KDA、DeepSeek 的 CSA 加 HCA、智谱的 DSA、MiniMax 的 Lightning Attention,名字不同,目标一致:让长上下文变便宜。100 万 token 上下文从卖点变成标配。推理侧则普遍引入“思考分档”——Claude 的五档 effort、DeepSeek 和 GLM 的 effort level——把“想多深”变成一个可以按预算拧的旋钮。

这不是巧合。Agent 是这轮参数竞赛真正的需求侧:一个智能体跑完一次任务可能消耗几十万 token,上下文不够长、单价不够低,这门生意就不成立。

四条流带汇入漏斗:让长上下文变便宜

接下来半年:值得等的,和别太信的

确定性相对高的:9 月初的 Grok 4.7(2.1 万亿,马斯克口径);秋季 iOS 27 和中国版 Apple 智能;Q4 的 Grok 5(年内,马斯克口径);年底前后的 Gemini 3.5 Pro(官方口径“近期”);2027 年上半年的 Qwen 4、Kimi K3.5 或 K4、GLM 6——其中一部分已官宣在训,一部分只是行业推测。

六浮标时间线:实心=官宣、虚影=传闻

传闻,听听就好:Astra 的 10 万亿参数、Grok 5 的具体参数、Fable 5.1 的发布时间。这三个数字目前都没有任何官方确认。

野村证券 7 月底的研报给了一条行业共识线:3 万亿参数是中国厂商的下一个里程碑,普遍预期在 2026 年底到 2027 年出现。而 OpenAI 的 Doug 和更后面的项目,据传会摸到 10 万亿到 100 万亿的区间——如果 Astra 的 10 万亿传闻是真的话。

最后泼三盆冷水

一,这轮“参数新闻”里 rumor 的密度极高。10 万亿也好 2.78 万亿也好,参数量正在变成营销数字,马斯克自己就把 Grok 4.6 从传说的 2 万亿修正到 1.5 万亿。判断模型强弱,比参数量靠谱的是独立榜单和在自己真实任务上的测试。

二,延期成了常态。Gemini 3.5 Pro 跳票数月,Astra 反复推迟,Behemoth 训练两年不发。大公司的时间表达听听就好,尤其是“最迟 X 月”这种句式。

三,参数变大不等于变得好用。SemiAnalysis 年中的判断是 Scaling Law 仍然有效,但边际成本越来越高;高质量数据枯竭是真实约束。接下来一年的分水岭可能不在谁的参数大,而在谁的数据反哺循环跑得顺、谁的单 token 成本压得低。

三盆冷水:参数是营销数字、延期是常态、参数不等于好用

对我们这种用模型干活的小团队,这轮竞赛的实际影响其实挺正面:开源旗舰追平闭源,API 单价一路下探,100 万 token 上下文让“把整个代码库喂给模型”从比喻变成了日常操作。参数竞赛是巨头的事,成本下降是所有人的事。

下一篇,我们打算把 K3 和 Qwen3.8 拉到自己的真实项目里跑一跑,看看“全球最大开源模型”落到日常活儿上到底是什么体验。

往深了看:参数、token 这些词反复出现,我们有个「图解AI」连载专门把它们讲透——第一期就是《token:AI 眼里没有字》,搜「图解AI」可以从头读。关注不迷路,下期讲上下文窗口。


注:本文信息截至 2026 年 8 月 18 日,以各公司官方公告、技术报告及彭博社、路透社等报道为准;所有未经官方确认的参数和时间,文中均已标注“传闻”“据称”或“爆料”。各家跑分可在 Artificial Analysis 和 LMArena 自行查证。

返回博客