8 月 26 日晚,智谱正式以 MIT 协议开源 GLM-5.3-Flash(320B-A18B),确认其就是刷屏一周的匿名模型"牛来"(Ox Alpha);阿里同日开源 Qwen3.8-Flash-Next,作为下一代 Qwen4 架构首个公开权重预览版(176B 总参、每 token 仅激活 6B)。两个模型都把旗舰级多模态能力压到极低推理成本,国产算力(商汤大装置、昆仑芯)同步完成训练与适配。
据《华尔街日报》8 月 27 日报道,英伟达已于上周暂停 7 月推出的 AI 云服务商融资分成计划部分协议。该计划以信用支持换云收入分成、客户卖不掉算力还可由英伟达租回。暂停原因是内部员工对反垄断审查和"芯片厂商干预客户经营"边界的担忧。摩根士丹利同日首次覆盖英伟达信用评级给中性,警告其正把资产负债表变成"资产负债表即服务"。
锁定 HBM4 供应与联合开发,SK 电讯建 2GW Vera Rubin AI 数据中心,2027 年上线;SK 海力士同日在印第安纳动工美国首个 HBM 封装基地。
较 2024 年初增长千倍,部分国产模型调用量暴涨 6800%;"十五五"算力网新增直接投资 4 万亿元,智算规模达 2185 EFLOPS。
Anthropic、谷歌、微软、AWS、甲骨文及 CrowdStrike、Okta 等联署,引用智能体沙箱逃逸事件;欧盟 CRA 9 月 11 日生效。
125B 主模型 + 51B N-gram Embedding,采用 GDN+QSA 混合注意力新架构,原生 262K 上下文可扩展至 100 万,权重已上线 Hugging Face 与魔搭。
智谱和阿里选在同一个晚上发版,不是巧合。两家都用 Flash 命名、都主打"旗舰能力 + 极低价格"、都用 MIT 或宽松许可,目标明确:在 DeepSeek V4-Pro 8 月 17 日大幅涨价后,抢占"便宜大碗旗舰"的生态位。对中小开发者而言,现在的选型逻辑已经从"用不用国产模型"变成"用哪个国产模型"。
智谱已经是第二次用匿名模型先免费跑一周赚流量(上次是 GLM-5.2)。Ox Alpha 在 OpenRouter 登顶的故事比任何官方 benchmark 都有传播力——它让海外开发者在不知道厂商的情况下用脚投票,再揭晓"中国造"。这种打法对品牌信任的建立效率,远超传统发布会。
Qwen 把训练成本降 90%、每 token 只激活 6B,智谱把价格压到 Claude 的 1/40——这不是"性价比优化",而是推理成本的代际坍塌。当旗舰级多模态推理便宜到可以不计成本地嵌入每一个工作流,Agent 经济的单位经济学才真正成立。但反过来说,模型层的利润空间也在被同步压扁,纯模型公司的商业模式需要重新论证。
智谱 GLM-5.3-Flash 跑在商汤大装置上、昆仑芯开源当日适配——这意味着从训练到推理的国产芯片栈已经能支撑 320B 级 MoE 多模态模型的 day-0 交付。在英伟达收益分成计划因反垄断被叫停、HBM 供应链向美国本土转移的背景下,国产算力与国产模型的深度绑定正在从"备选方案"变成"主路径"。