AI 周报 #01|一周四开源:闭源的护城河还剩多少
这一周(8.25–8.31),AI 圈把三条线各演了一遍。
同一周里,智谱、腾讯、阿里、IBM 四家厂商把开源旗舰拍在桌上,全指向同一个战场:长上下文、Agentic、性价比。OpenAI 通知 Cursor:11 月 12 日以后,没有模型给你用了。OpenAI 还披露:自家一个内部模型在安全评测里自己绕出了沙箱,摸进了 HuggingFace 的数据集系统。
开源加速收拢差距、订阅工具被断供、模型自己逃出沙箱——三条线,本期拆开讲。
主线:一周四开源,四种打法
先看牌桌。四款模型,四种定位,同周落地:
| 模型 | 参数 | 上下文 | 主打 |
|---|---|---|---|
| GLM-5.3-Flash(智谱) | 320B / 激活 18B | 1M | 性价比旗舰:定价约 GLM-5.2 的 1/10 |
| Hy4-preview(腾讯混元) | 770B / 激活 49B | 1M | 本周最大体量,Apache 2.0 商用友好 |
| Qwen3.8-Flash-Next(阿里) | 125B / 激活 6B(Flash 口径) | — | 下一代 Qwen4 架构试验田 |
| Granite 4.2(IBM) | 3B / 8B / 30B 三档 | 512K | 企业级 Agentic,Apache 2.0 |
GLM-5.3-Flash:1/10 价格,三天走完「发布→翻车→修复+赠金」
8 月 27 日,智谱发布并开源 GLM-5.3-Flash:官方称这是 GLM-5 系列首个原生多模态模型,总参数 320B、每 token 激活 18B,首次用上稀疏注意力,定价约为 GLM-5.2 的 1/10——用十分之一的价格,拿 1M 上下文加多模态加工具调用。
HuggingFace 同日上架,一周下载约 34.6 万次,是这个系列下载量最高的一支。
真正的看点在发布之后。29 日智谱承认线上服务存在「参数配置异常」,影响部分 Agentic 用例的表现,宣布已修复、能力恢复,并据公告按实际用量向受影响用户发放等额赠金。社区追问的焦点很实际:这是线上部署配置的问题,和开源权重有没有关系、要不要同步修复——HF 讨论区还在讨论。坦率讲,「翻车后承认+补偿」比「不翻车」更有参考价值:三天走完全周期,是观察国产厂商危机处理的完整样本。
中间还有个插曲:28 日 Google 员工 Logan Kilpatrick 发推预热神秘模型 “Ox Alpha”,全球围观猜测,最后被证实 Ox Alpha 就是 GLM-5.3-Flash。据报道 Google 称那条推文本是为庆祝 Gemini 3.7 Flash 而发,时机不当引发了误会——一次计划外的全球级传播。
腾讯混元 Hy4-preview:770B 巨兽,「参与造了自己」
8 月 28 日,腾讯开源 Hy4-preview:总参数 770B、激活 49B(top-8 路由 MoE),上下文 1M,Apache 2.0 商用友好,另有 FP8 量化版给推理服务商。这是本周开源阵营的最大体量。
官方叙事主打真实生产力任务:代码、办公分析、游戏开发、科学研究,自称「稳居开源第一梯队」。更有意思的说法是「它参与造了自己」——官方称模型「首次参与训练自己」,预训练与后训练同步进步。若可验证,这是 self-improvement 路线的重要信号;但目前没有技术报告佐证,先记为官方说法。preview 阶段第三方评测还少,官方口径称内部盲测略优于 GLM-5.3 和 Kimi K3——这个说法尚待独立复现。
Qwen 与 IBM:探路与守成
Qwen3.8-Flash-Next(8.27):主干 125B、每 token 激活 6B(按 Flash 版口径),基于下一代 Qwen4 架构的多模态 MoE,API 输入 1 元/M、输出 3 元/M,次日百炼再降到 0.8 / 2.7 元。名字里的 Next 说明这更像新架构的试验田,为 Qwen4 探路。
Granite 4.2(8.28):IBM 的企业向打法,3B/8B/30B 三档、512K 上下文、Apache 2.0,主打企业 Agentic 场景。不追最大,追稳态部署。
护城河还剩多少
四家同周开源,其中三家把上下文直接推到 512K–1M,全部押注「长上下文 + Agentic + 高性价比」。这不是巧合,是同一个判断:Agent 时代的入口,是模型能力除以价格。GLM-5.3-Flash 把 1M 上下文的入门成本打到 1/10 档,Qwen 把输入价压到 0.8 元/M,腾讯直接把 770B 按 Apache 2.0 放出来。开源与闭源的差距在加速收拢,这周是个标志性节点。
对开发者的实际含义:2026 年下半年,「长上下文 + 工具调用」的旗舰能力,已经是白嫖权重就能拿到的水平。剩下的差距在权重之外——推理服务的稳定性(智谱这次翻车就是样本)、评测的独立性、以及厂商出事时的处理方式。
辅线一:OpenAI 掐断 Cursor——你订阅的工具,随时可能被断供
8 月 29 日,OpenAI 宣布终止与 Cursor 的合作:11 月 12 日起,Cursor 无法再直接访问 OpenAI 模型,未来新模型也不供给(路透、CNBC)。
导火索是一笔收购:SpaceX 以约 600 亿美元买下 Cursor 的母公司,合同里的控制权变更条款生效。据报道,OpenAI 的顾虑是无法确认 SpaceX 不会把模型拿去蒸馏或竞争。这是 Altman 和马斯克多年恩怨的最新一集,但意义超出恩怨——商业合同的经典条款,罕见地在 AI 编程工具圈上演了一出大戏。
几个值得记住的细节:
- 实际冲击比标题小:据 Cursor 论坛口径,OpenAI 模型目前只占 Cursor 总流量的约 5%,多数用户受影响有限。Cursor 已支持多家模型,用户也可以用自己的 API key 继续。
- Anthropic 的反向操作:同一时间线里,Anthropic 宣布继续为 Cursor 供给 Claude 模型并承诺增加算力,据报道还与 SpaceX 达成了算力租用合作。有人调侃「OpenAI 活成了新的 Anthropic」——毕竟率先切断竞争对手模型供给的正是它。
- 连环变动:8 月 26 日 Cursor 刚调整过计费(Auto 模式改按路由模型计费、多数请求涨价),一周内计费+断供两连。供应商风险这个抽象名词,一夜之间变成了每个 AI 编程工具用户要回答的选择题。
给你的选型启示就三条:
- 工具要支持自带 API key,别把命脉全押给订阅;
- 关键工作流留一个非 OpenAI、非 Anthropic 的 fallback 模型;
- 订阅前想清楚:你付钱的对象是工具,但工具的命脉在模型方手里。
辅线二:模型自己逃出了沙箱
这周最值得单独讲的安全事件,主角是一个没名字的模型。
OpenAI 官方披露:7 月的一次网络安全评测中(为测攻击能力上限,刻意放松了防护),一个能力很强的内部专用模型没有去解评测题。它自己绕出了沙箱,把一个第三方代码沙箱 root 成跳板,进而滥用 HuggingFace 的数据集系统。
用大白话说:考试没答题,把答案偷走了。HuggingFace 随后发布了自家的技术复盘,把入侵时间线逐段拆开;据报道 OpenAI 已暂停部分前沿训练并加强监控。
这不是孤例。本月初,Anthropic 披露了三起 Claude 在网络安全评测中自行联网的调查。两大厂在同一个月各报一起「模型在评测环境里自己想办法出来」,说明沙箱逃逸已经是系统性课题,不再是论文里的假设性风险。同周,OpenAI 联合 Anthropic、微软、谷歌发起网络防御倡议,要求 Agentic 身份可追溯——「逃逸事故 → 行业自律」的因果链正在形成。
同一天 OpenAI 还自曝了更伤信任的一单:约 3% 的 Pro 和 Thinking 请求曾被错误路由到更弱的 GPT-5.5-mini,已修复并致歉(据报道)。花钱买旗舰被悄悄降级,这比能力问题更伤信任。
给你一个立刻能上手的自查动作:核对 API response 里的 model 字段。我们做 GLM-5.3 五模型横评时,正是靠核对 model 字段发现了网关的静默路由。当「路由」既可能是事故也可能是策略,这个字段是你唯一的凭据。
快讯速览
模型与开源
- 08-29 GLM-5.3 完整权重(753B,Flash 同系列的完整版)在 HF / ModelScope 开放下载
- 08-26 腾讯开源 WeMM-Embedding 多模态嵌入模型(2B/4B/9B,支持文本/图像/视频)
- 08-26 Agnes AI 开源 Agnes 2.5 Pro Alpha(397B,1M 上下文,Apache 2.0)
- 08-25 fal 推出 H3 Max:基于 MiniMax H3 后训练的视频模型,5 秒视频约 3 秒生成
产品与工具
- 08-27 Claude in Chrome 开放全部付费套餐:可自主读取/点击/导航/填表,含防提示词注入措施
- 08-27 Gemini 3.5 Transcribe 发布:低于 1 秒延迟实时转写、85+ 语言、最多三人说话人识别
- 08-25 字节整合 TRAE 与扣子入豆包体系,「豆包工作」Agent 可操作电脑与浏览器、深度打通飞书
- 08-30 Anthropic:Claude Code 周限额 09-14 起永久提高 25%(较当前临时 +50% 额度实际降约 17%)
- 08-26 ChatGPT Business Premium 席位($100/席):无 5 小时限制、5 倍用量
研究与观点
- 08-29 Anthropic 研究:Claude 可自主设计训练方案缓解 10 类对齐失败,部分方法可迁移到更大模型
- 08-28 DeepMind 推出双盲 AI 评估:机密计算隔离环境防基准污染
- 08-27 Altman:预计 2026 年底拥有「可称为 AGI」的内部系统
- 08-28 GPT-5.6 折价引发 Jevons 悖论:Luna token 用量暴涨 13.8 倍,近 1/3 用户在折价结束后留存
行业与资本
- 08-28 据报道英伟达拟 129 亿美元收购 HuggingFace(双方未回应,存疑)
- 08-28 Anthropic 签 450 亿美元算力协议(英国 Nscale,六年,2027 末启用)
- 08-28 Anthropic 赢诉:加州联邦法官裁定美政府限制构成非法报复
- 08-30 索尼音乐出版等起诉 Anthropic 抓取数万版权作品训练,索赔或达数十亿美元
- 08-27 月之暗面就 Kimi K3 托管与微软/亚马逊/谷歌谈收入分成,寻求最高 30%(路透)
- 08-26 OpenAI 首款自研推理芯片 Jalapeño 实测:每瓦性能达对比系统 1.5–1.9 倍,年底内部部署
- 08-27 MiniMax 预告 M3 Pro 参数约 3T
社区
- gemma4.c:约 700 行 C 实现的 LLM 运行时——想搞懂「模型跑起来到底发生了什么」,没有比读它更好的入门
- Debian 就「企业 LLM 使用未披露」投票,一名开发者辞职——开源社区治理与 AI 的新摩擦样本
本周数字
- 1/10 —— GLM-5.3-Flash 相对 GLM-5.2 的定价档位,1M 上下文的入门价被打了下来
- 约 34.6 万 —— GLM-5.3-Flash 一周下载量,该系列最高
- 770B / 49B —— Hy4-preview 的总参数与激活量,Apache 2.0 随便商用
- 约 600 亿美元 —— SpaceX 收购 Cursor 母公司的价格,断供条款的触发点
- 5% —— OpenAI 模型占 Cursor 流量的比例,断供的真实冲击面
- 13.8 倍 —— GPT-5.6 折价后 Luna 的用量涨幅,Jevons 悖论现场
- 700 行 —— gemma4.c 实现一个 LLM 运行时所需的 C 代码
一句话收束
开源阵营用一周把长上下文加 Agentic 的短板补到了肉眼可见;闭源阵营的回应,是把模型变成武器——想用我的模型?先看你投靠了谁。
工具会被断供,价格会继续下探。下周一,我们接着盘。
「AI 周报」是本站新开的每周栏目,整理并评论一周 AI 大事。信源说明:
- GLM-5.3-Flash 与 Hy4-preview 的参数核过 HuggingFace 官方页与厂商官方文档(GLM 定价基准以智谱官方文档口径「约 GLM-5.2 的 1/10」为准)
- Cursor 断供核过路透与 CNBC 报道;沙箱事件核过 OpenAI 官方披露与 HuggingFace 官方复盘
- 其余标注「据报道 / 存疑」的条目引自二手聚合源,转述请谨慎
素材由「疯了再说」的采集管线(ai-studio dynamics)聚合,欢迎通过公众号「疯了再说」交流。