OpenAI 发布 Ultrafast 模式限量预览,由 Cerebras 晶圆级引擎提供算力,输出速度最高达 750 tokens/秒,较 Standard 模式快 14 倍,官方称不降低模型质量。该模式率先通过 API 开放,瞄准对延迟敏感的企业工作流。横向对比,加速后比 Anthropic Fable 5 快 11 倍,比 Opus 4.8 Fast 模式快 5 倍。
DeepSeek 同日双发:V4 Pro 正式版(1.6T MoE、49B 激活、100 万 Token 上下文、384K 输出,Agent 能力较预览版提升近 5 倍),API 定价约为 GPT-5.6 Sol 的六十分之一;Harness 开发者预览版以 MIT 协议开源,基于 Cordis 插件系统,工具/沙箱/文件系统/编排全可替换,持久化会话支持恢复、分支和回放,直接对标 Claude Code。
距 3.6 仅三周,编程得分 34.4%→43.6%,Terminal-bench 3.0 从 5.4% 跃至 14.9%。API 至年底输入 $0.75/输出 $3.75 每百万 Token,2027 年翻倍。
2.4 万亿总参数、950 亿激活、原生 256K 上下文可扩展至百万。权重在魔搭和 Hugging Face 同步开放,但开源版裁掉视觉能力和百万上下文。
Cerebras 晶圆级引擎支撑 GPT-5.6 Sol 达到 750 tokens/秒,标志着推理层"去英伟达化"从论文走向产品级交付。
DeepSeek V4 Pro 输入 $0.435/百万 Token,谷歌 Flash 促销 $0.75,两者均远低于 GPT-5.6 Terra 的 $2.00 和 Claude Sonnet 5 的 $2.00。
750 tokens/秒确实改变了实时交互体验,但 Cerebras 在这个合作里更像是 OpenAI 的"速度外包商"而非算力伙伴——OpenAI 随时可以把同样的工作负载迁移到自研芯片或其他推理优化方案上。对 Cerebras 而言,能跑旗舰模型是最好的广告,但商业可持续性取决于 OpenAI 是否愿意长期付费,而非自有客户粘性。
Flash 系列三周一发、还自砍半价,说明谷歌在编程和 Agent 赛道面临的压力远超外界想象。3.6 到 3.7 的提升幅度(Terminal-bench 接近三倍)不像是正常迭代节奏,更像是紧急追赶。半价促销到年底再翻倍的定价策略,本质是用短期补贴抢开发者心智——但 2027 年涨价后能不能留住人,才是真正的考验。
当 OpenAI 自己都用第三方芯片跑旗舰模型、谷歌把 Flash 砍到 $0.75,推理本身的溢价正在快速塌缩。未来的利润分布会更极端:底层壁垒在自研芯片和晶圆级硬件(英伟达、Cerebras、谷歌 TPU),上层壁垒在数据飞轮和 Agent 工作流(Anthropic 的企业客户、OpenAI 的消费端入口),中间纯粹提供推理 API 的厂商空间会被持续挤压。
OpenAI Ultrafast 目前仅 API 限量预览,且需要企业级访问,大陆开发者短期难以直接使用;Gemini 3.7 Flash 半价促销对使用 Google Cloud 的国内出海团队是实质利好。但更关键的信号是:海外巨头主动把价格和速度拉到这个水平,会进一步压缩国内"套壳 API"厂商的生存空间——靠转发 GPT/Claude API 赚差价的模式,在 $0.75 的 Flash 和 $0.435 的 DeepSeek 之间已经没有缝隙。
V4 Pro 六十分之一的定价固然抢眼,但模型价格战已经打了一年多,边际效应在递减。真正有战略意义的是 Harness 以 MIT 协议开源——这意味着任何企业都可以基于它搭建自己的 Claude Code/Cursor 竞品,且无需开源衍生作品。DeepSeek 在用"免费框架+低价模型"的组合,锁定开发者的 Agent 工作流标准,这比单纯卖 API 有更深的生态野心。
万亿级旗舰首次开源权重确实是里程碑,但开源版裁掉视觉和百万上下文这两个最有企业价值的能力,说明阿里并不打算把 Max 级的完整能力免费送出。自定义许可加商业规模触发条款,也意味着大企业用起来仍然要谈商务。这是"开源换生态、闭源保收入"的经典平衡术,和 Meta 当年 Llama 的策略如出一辙,但商业条款更激进。
Qwen3.8-2.4T 首次测试用了 72 张 GPU,这个数字意味着绝大多数中小企业和创业公司根本无法自行部署。开源权重的象征意义大于实际可用性——真正能跑起来的是云厂商和大型企业。这反而强化了阿里云作为"首选托管方"的地位:权重开源了,但你大概率还是要在阿里云上调用。这与 DeepSeek Harness 的 MIT 低门槛形成鲜明对比,两条路线代表了中国 AI 开源的两种思路。
8 月 13 日这一天的四组发布,表面是模型和价格的竞争,底层是两种产业路线的对撞:美国走"闭源旗舰+推理加速+API 商品化"(OpenAI、谷歌),中国走"低价模型+开源框架+生态锁定"(DeepSeek、阿里)。前者在单模型能力和基础设施上仍有优势,后者在开发者渗透和成本控制上更激进。对大陆开发者而言,真正的机会在于:当海外模型越来越贵、越来越受限时,国产开源框架+低价模型的组合正在成为可落地的替代方案。