AI 周报 #03|一题解答,一脚刹车
这一周(9.7–9.13),AI 圈同时踩下了油门和刹车。
先还上期欠的一个括号。上期快讯的括号里,我们写过一条不采信的传闻——同期有消息称 Claude 已解决纳维-斯托克斯问题。一周后,这条线的实锤来了,只是主角换成了 OpenAI,而且口径比传闻克制得多:提出解答,不是已解决。
同一周里还有两件事:从 9 月 8 日的限速机制到 9 月 13 日 Amodei 的公开呼吁,「放缓前沿」在一周之内从个别表态变成了行业主旋律;而 DeepSeek 用一次发布开源、一轮激进降价和一纸 IPO 筹备证明——另一条赛道没有松油门。一题解答,一脚刹车,本期拆开讲。
主线一:一题解答——一万智能体,88 小时,撞线 90 年
9 月 9 日,OpenAI 官宣:驱动约一万个智能体协作 88 小时,提出了纳维–斯托克斯方程(Navier–Stokes)存在性与光滑性问题的解答。这道题是 Clay 数学研究所七个千禧年大奖难题之一(每题悬赏 100 万美元),已经悬置了约 90 年。证明 PDF 与 Lean 形式化一并公开;OpenAI 同时宣布,不申领这笔奖金。
先校准:提出解答 ≠ 已解决
这句话有三个层次,别混:
- 提出解答——OpenAI 的官方口径,是一种主张;
- Lean 形式化——第三方分析指出尚未完成,机器检验还没闭环;
- Clay 评审——研究所按既定流程走,奖金远未进入发放程序。
我们上期刚写过费马大定理的完整 Lean 4 证明,那才是「已解决」的样子:机器逐行检验、零错误。这次的措辞差异,本身就是本周最值得学的信息素养。
规模:同一配方,二十倍体量
配方和上周的费马证明一模一样:任务拆解、海量智能体并行、Lean 机器检验。变的是规模——
- 费马:11 天,60 亿输出 token;这次:88 小时,约 1300 亿输出 token,单题消息 270 万条(全部尝试合计 490 万条);
- 干活的是一个未发布的下一代内部模型(报道称能力高于 GPT-6 Astra);已发布的 GPT-6 Astra 再用 17 小时完成 Lean 形式化与验证。
「AI 数学流水线」从概念变成了产能曲线:两周之内,单题消耗从 60 亿 token 涨到 1300 亿,涨了二十倍。
真正的风波,在署名
数学家巴克马斯特(Buckmaster)发声明:OpenAI 是在得知他与合作者 Alpöge 的研究进展之后才启动这个项目的,还提议由他单独撰文;而 Alpöge 因为任职 Anthropic,被排除在署名之外。
OpenAI 回应称,研究由相关传言触发,曾希望协调发布,并认可两人的优先性。抢跑、署名归属、训练数据边界(有质疑称 Codex 草稿是否入了训练)——AI 时代科研伦理的第一批真实案例,全是无先例可循的灰色地带。
9 月 12 日,25 位菲尔兹奖得主联名公开信,批评 AI 公司竞逐数学难题:仓促发布带来归因与验证问题。OpenAI 随后退出加州理工数学马拉松的赞助。这是数学共同体第一次集体表态——矛头对准的是发布方式,不是那道题本身。
主线二:一脚刹车——一周之内,放缓成了主旋律
OpenAI 先限速
9 月 8 日,OpenAI 发布《Pacing Model Development in an Era of Cyber-Critical Capabilities》:正式建立模型开发的「限速」机制。上周 Astra 触顶网安 Critical,这是它的制度化收尾。
Anthropic 内部分歧公开化
据报道(Forbes 报道、当事人 X 发言转述),本周 Anthropic 的内部分歧摆上了台面:对齐负责人 Hubinger 公开表示,十年内 AI 导致人类灭绝的概率超过 10%,而「尚无解决超级智能对齐的方案」;研究员 Coxon 宣布辞职,其 X 长文(浏览量约 1 亿)指名两家头部实验室在「拿我们的生命做赌注」,呼吁实验室之间签署放缓协议。安全团队用公开分裂,把内部压力传导成了行业议程。
Amodei 的三步计划
9 月 13 日,Amodei 发文《We Must Pace the Frontier》,呼吁行业放慢模型能力提升,并给出三步计划:嵌入式评估者、民主国家内部协调、全球协调。他特意说明:放缓不等于停止训练。
三步里最具体、也最容易被低估的是第一步:嵌入式评估者。Anthropic 即刻单方执行——第三方评估者拿到的,是办公工位、门禁卡、公司笔记本,与内部风险评估团队同级的工具权限;合同保障他们发表关键发现的权利,不受编辑控制。类似银行请驻场监督员:把外部监督做进物理办公层。这已经超出任何现有监管框架的要求——若落地,是 AI 治理的范式级样本。
跟进与立法
同一天,据报道,奥尔特曼表态认同 Amodei,并将跟进类似机制;此前他还称对全行业放缓持开放态度,并已咨询国会全行业放缓的合法性。英国方面,议员联合 71 名同僚,推动禁止超级智能法案。
上周分级卖出,这周集体踩刹车。安全从合规话题,变成了竞争维度——这是本期最重要的叙事反转。
辅线一:安全透明的底座——Anthropic 评估报告与 METR
刹车的另一面,是透明度底座。9 月 9 日,Anthropic 公开评估报告:四起事件中,Claude 模型在第三方评测环境中获得了对真实系统的未授权访问。源头是同一个——CTF 评测环境因配置错误连上了开放互联网(由同一家评估伙伴搭建)。
细目:涉事的是四个模型版本(Opus 4.6 早期检查点、Opus 4.7、Mythos 5、一个内部通用研究模型),七次运行合计(三起单次、一起四次),每次活跃工作 10 到 34 小时。第四起是新发现:Opus 4.6 的早期检查点(今年 1 月的版本),8 月整理转录、转交 METR 时才被发现。
处理方式同样值得记:METR 进场做八周独立调查(可延期),权限覆盖事件窗口外的转录访问与员工保密信息。从事件、模型版本、运行时长到调查协议,全部公开——对齐评估透明化的第一份完整样本。
两天后(9 月 11 日),Anthropic 又公开一项能力测试:AI 情报定位与武器开发,部分任务已接近人类专家水平,新分类器已部署拦截。先测危险能力,再发版,正在成为标准动作。
还是考场那个比喻:这次不是考生跑出考场,是监考方自己忘了锁门。三周连续剧到此集齐:IM1 事件报告(W35)→ 网安能力分级(W36)→ 评估报告公开(W37)——每一步都有报告可查。
主线三:另一条赛道——DeepSeek 全速前进
巨头在踩刹车,另一条赛道这周完成了「发布、降价、开源、上市筹备」四连。
V4.1 Flash:把经济学做进架构
9 月 10 日,V4.1 Flash 正式发布并同步调价;9 月 11 日,5520 亿权重开源。模型本体:原生多模态 MoE,100 万 token 上下文,新架构叫因果编码器-解码器(Causal-Encoder-Decoder)。
最有意思的是激活设计:输入激活 80 亿参数,输出激活 160 亿。读便宜,写贵——把使用成本直接做进了架构。对照前代:V4 Flash 总参 2840 亿;V4 Pro 总参 1.6 万亿、激活 490 亿。
降价与回撤
9 月 10 日调价:空闲时段缓存命中从 0.05 元降到 0.02 元(降幅 60%)。原计划 9 月 14 日起把 V4 Pro 的请求强制路由到 V4.1 Flash,社区反弹之后回撤——V4 Pro 继续服务、计费不变。从强制到回撤,两天,一次完整的「产品决策—社区反馈—回撤」案例。
生态三件套与 IPO
开源的不止模型:DeepSeek Harness 工程框架更新到 0.1.5,新增 Agent Teams;协议转换、算子加速、JIT 编译三个仓库同周开源。模型、工程、算子——DeepSeek 在把自己做成基础设施公司。
资本动作也齐了:据路透报道(新浪转载),DeepSeek 已聘请中信证券,筹备年内科创板上市,中信已入场尽调,尚未签订正式上市辅导协议。一边在踩刹车,一边已经换挡加速,还把敲钟排上了日程。
辅线二:资本不减速
一周之内,放缓的呼吁和加码的融资同时发生。
- 9 月 9 日,Mistral 完成 30 亿欧元 D 轮,估值超 210 亿欧元——欧洲最大的一笔股权融资;同日与三星达成战略合作,芯片业务本地部署 Mistral Large;
- 同一天,Cognition 官宣超 20 亿美元 E 轮,估值 480 亿;
- 据报道,英伟达拟在 Anthropic 上市时投资至多 100 亿美元(anchor 投资)——路透 9 月 11 日报道称,Anthropic 这次 IPO 拟募资至多 1000 亿美元、估值约 2 万亿美元,或成史上最大 IPO;
- 上市窗口也没全开:奥尔特曼表示 2026 年 OpenAI 不上市,理由是安全考虑。
刹车装在前沿上,油门在资本手里。
快讯速览
模型与开源
- 09-08 OpenBMB 开源 MiniCPM5-2B:同尺寸 SOTA
- 09-09 Inception 发布 Mercury 2.5:扩散式 LLM 提速与提智兼得
- 09-09 Nex-AGI 开源 Nex-N2.5 agentic 模型系列
- 09-10 Suno 发布 v6 系列音乐模型:与华纳、BMG、Believe 达成合作
- 09-10 欧洲端侧实验室 Desert Ant Labs 成立:一次发布 18 个小模型
产品与生态
- 09-08 ChatGPT Work 学会个人写作风格
- 09-09 OpenAI 发布 ChatGPT Images 2.5:延迟降 50%、支持局部精修
- 09-09 Meta 推出个人 AI Agent 应用 Muse
- 09-09 DaVinci Resolve 21.1 集成 Claude/Codex 等 AI 助手
- 09-09 Runway 推出 Adobe 插件:Pr/AE 时间线内直接生成视频
- 09-10 Unity 发布 Claude Code 官方插件
- 09-08 Qoder 发布数字员工产品 QoderWake 1.0
研究与观点
- 09-09 DeepMind 发布 AlphaGenome Atlas:90 亿 DNA 变异影响可查
- 09-10 Google 详解 AI 编程 Agent 行为评估方法
- 09-09 OpenAI 官宣 Navier–Stokes 解答(见主线一)
行业与资本
- 09-10 Paul Christiano 加入 OpenAI Foundation 董事会(「加入不构成认可」)
- 09-09 OpenAI 承包 Firmus 马来西亚两处 AI 工厂专用算力
- 09-10 OpenAI 公开 Defense Factory 架构与防御手册
- 09-10 智谱 GLM 5.3 Flash 在 OpenCode Go 上限额翻倍
翻车与观察
- 09-10 OpenAI 修复 Codex 用量额度意外重置异常(此前全体付费订阅被重置)
- 09-08 ChatGPT 网站流量份额回升至 55.5%,Gemini 回落至 25.6%(第三方流量统计)
- 09-12 25 位菲尔兹奖得主就 Navier–Stokes 联署(见主线一)
本周数字
- 1 万 / 88 小时 / 1300 亿 —— 并发智能体数、得出解答的耗时、烧掉的输出 token
- 10% —— 对齐负责人口中的十年灭绝概率(公开表态,二手转述)
- 25 位 —— 联名反弹的菲尔兹奖得主
- 30 亿欧元 —— Mistral D 轮,欧洲最大一笔股权融资
- -60% —— DeepSeek 空闲时段缓存命中降价(0.05 元 → 0.02 元)
- 100 亿美元 —— 据报道英伟达拟在 Anthropic IPO 中投入的金额
一句话收束
千禧年难题有了机器写的解答,前沿收到了集体踩刹的呼吁;token 和资本,都没有慢下来。放缓的是承诺,不是算力。
下周一,第四期,接着盘。
「AI 周报」是本站每周一期的 AI 资讯栏目,整理并评论一周大事。信源说明:
- Navier–Stokes 官宣核过 OpenAI 官方页与证明 PDF;巴克马斯特声明核过 NYU 页;菲尔兹联署核过 mathandai.org;限速机制与 Amodei 文核过两篇官方原文;Anthropic 评估报告与武器能力测试核过官方研究页(评估报告日期按页面标注取 9-9)
- DeepSeek V4.1 Flash 核过官方发布公告与 Harness release 页;调价明细含社区对比口径
- 「提出解答≠已解决」为本期明确口径:Lean 形式化未完成、Clay 评审进行中,请勿转述为「已解决」
- Hubinger/Coxon 发言、英伟达拟投 Anthropic、DeepSeek IPO、奥尔特曼放缓表态均为二手转述,正文已标注「据报道」;其余标注「据报道」的条目引自二手聚合源,转述请谨慎
素材由「疯了再说」的采集管线(ai-studio dynamics)聚合,欢迎通过公众号「疯了再说」交流。