过去八周,AI 圈最大的事不是美国巨头又发了什么,而是中国厂商的发布密度突然拉满。7 月 17 日月之暗面端出 Kimi K3,7 月 31 日 DeepSeek 和字节同天出手,8 月 3 日阿里放出 Qwen3.8-Max,中间还夹着智谱的 GLM-5.2。五款重磅模型在两个月里轮番亮相,被市场叫成「八周五连发」。
更值得留意的是海面下的动静:斯坦福《2026 人工智能指数报告》给出的判断是,中美顶尖模型的综合性能差距已大幅收窄;而海外市场的反应更直接——不少美国企业和硅谷初创,正出于成本考量把业务流量切到中国模型上。性能够用、价格便宜到离谱、部署又灵活,选型的天平就这么悄悄倾斜了。

图 1:八周五连发——五款国产大模型密集登场
八周五连发,密度前所未有
放在以前,旗舰大模型从训练到发布动辄一两年,OpenAI 和 Anthropic 的迭代节奏基本以年计。这一轮国产模型的输出密度,把行业节奏整个拉快了。
先看最先引爆的 Kimi K3。7 月 17 日发布、7 月 27 日全栈开源,总参数 2.8 万亿,是目前全球参数规模最大的开源大模型。它用的是 896 个专家的混合专家架构,每次只激活 16 个,配合自研的 KDA 混合线性注意力机制,硬是把长文本计算量从平方级拉回接近线性——翻译成人话:读同样的内容,算力消耗少一个量级。开源也不只是丢权重,月之暗面连支撑训练的三项基础设施(MoE 训练框架 MoonEP、线性注意力算子 FlashKDA、智能体训练环境 AgentEnv)一起给了社区,等于送菜谱还搭灶台。模型托管平台 Hugging Face 的 CEO 发文说,K3 上线 30 分钟点赞破 4000,登顶 Trending,是平台历史上最快的一次。
阿里的 Qwen3.8-Max 紧随其后,8 月 3 日发布,总参数 2.4 万亿,单次推理只激活 95B。在权威榜单 Arena 上,Qwen 系列整体排全球第二,仅次于 Anthropic 的 Claude;编程能力在 CodeArena 排第四,视觉理解在 Vision Arena 排第二。最特别的是,这是千问第一次把 Max 级别模型的权重开源,下周连 27B 的小版本一起放出来。阿里还同步上了企业级 Agent 产品「千问办公」,AI 办公软件的竞争也跟着升了一级。
同一天前后,字节的 Seedance 2.5 把视频生成时长从 15 秒拉到 30 秒,支持多轮延长和长叙事;MiniMax 则开源了首款多模态生成模型 H3,2K 分辨率原生视频生成,成本压到 0.8 元/秒。视频生成这一角,也从「能生成」卷到了「生成得长、生成得稳」。
成本差了几十倍,这笔账谁都会算
性能追上是「八周五连发」的一面,另一面是价格。DeepSeek-V4-Flash 正式版 7 月 31 日上线,总参数 2840 亿、激活 130 亿,定价输入 1 元/百万 token、输出 2 元,缓存命中的输入价格更是低到 0.02 元。美国研究机构 Artificial Analysis 的独立评测给了个直观坐标:DeepSeek-V4-Flash 每项智能任务的加权平均成本是 3 美分,不到 Anthropic 旗舰 Claude Fable 5(3.15 美元)的百分之一;Kimi K3 是 86 美分,OpenAI 的 GPT-5.6 Sol 是 1.86 美元。

图 2:单任务成本对比——差距以十倍计
这个差距落到真实账本上很吓人。有开发者实测,接入 DeepSeek-V4-Flash 执行一次本地文件阅读加全网检索汇总,消耗 51 万 tokens,账单是 0.53 元人民币。换 GPT-5.6 Sol 同等的量,成本要高几十上百倍。也正因为如此,OpenRouter 平台的数据显示,截至 7 月 26 日的近 28 天里,中国模型份额约 63.5%,美国模型约 35.5%;周调用量中国模型 33 万亿 token,美国 2.34 万亿,中国模型连续十三周领跑全球。全球主流大模型调用榜前六,全是中国的团队。
当然,性价比模型也有自己的代价。DeepSeek-V4-Flash 的 Agent 能力评测(DeepSWE)较预览版提升了 6 倍以上,直追顶级闭源模型,但综合推理能力仍与一线旗舰有差距,官方也坦诚定位是「轻量高效」。有意思的是,公测上线不到一周,8 月 6 日 DeepSeek 就发了涨价预告,说近期要整体上调 API 定价——需求涨得太快,算力供给吃紧了。低价撕开市场的策略已经奏效,接下来就是产能和价格的再平衡。
开源是底气,换底座是结果
硅谷公司愿意换底座,靠的不只是便宜,还有「东西是自己的」。闭源模型像下馆子,菜好吃,但配方和食材你永远带不走,吃一次付一次钱;开源模型是把菜谱连灶台一起给你,可以自己炒、改配方,甚至卖改良版。对金融、政务、医疗这类数据敏感行业,能本地部署、数据不出门,比省那点 API 费重要得多。
全球最大开源模型平台 2026 春季报告显示,中国研发的开源模型下载量已占全球总量的 41%;过去 12 个月里,国产模型有 9 个月保持着全球开源模型的规模上限。Kimi K3 的全栈开源和 Qwen3.8-Max 的 Max 级权重开源,等于把「怎么炼出这种模型」的方法论也交给了社区——两年前这是想都不敢想的事。

图 3:开源生态网络——全球开发者接入中国模型
换个角度看,这场「换底座」也是成本结构重构的注脚。美国闭源旗舰训练动辄烧数亿美元,单款模型生命周期只有 12-24 个月,只能靠高 API 定价回收;中国厂商走开放权重路线,靠 MoE 架构和推理优化把单次调用成本压到极低,再靠规模和生态赚钱。单次调用变便宜,总调用量反而暴增——算力需求不是变小了,是换了个更大的盘子。
对普通用户来说,这轮竞争最直接的好处是:几块钱就能让 AI 干完过去要花几十块甚至上百块的活,手机上那些 AI 功能也会越来越不心疼流量和费用。接下来要盯的两个信号,一是 DeepSeek 的涨价最终落在什么幅度,二是 Qwen3.8-Max 下周开源后,私有化部署会带来多大一波落地潮。价格战没结束,只是换了个打法。


微信扫一扫打赏
支付宝扫一扫打赏
