今日速览
- OpenAI 宣布内部多智能体系统给出 Navier–Stokes 千禧年问题解答(伴随 Euler 方程反例),三万级并发 agent、约 3000 亿 token 的规模首次披露;但该证明尚未经外部数学家独立验证,OpenAI 明确表示不认领千禧年奖,且同一天卷入了与 NYU/Anthropic 研究员「抢跑与署名施压」的争论——这是本窗口最重要也最需要审慎解读的事件。
- OpenAI 发布 ChatGPT Images 2.5 及 API 模型 GPT-Image-2.5 Flare/Sunburst:细节更清晰、编辑更精准、延迟较 2.0 最多降 50%,新增 Sketch 手绘转图;即日向 ChatGPT 全档位与 Codex 推送。
- Mistral 完成 30 亿欧元 D 轮融资,投后估值超 210 亿欧元(三星电子领投,欧洲科技史上最大股权融资),继续押注「主权、开放权重」路线。
- GPT-6 Astra 官方确认已全面推送 Plus/Business/Pro/Enterprise 全档位(Work/Codex 与 API 均已开放);此前 Altman 就「混乱的发布节奏」致歉(跟进,非新模型发布)。
- Runway 发布 Adobe 插件:在 Premiere Pro / After Effects 内直接生成、重绘时间线素材并落回工程。
- GitHub 24h 增星(精确快照差):绝对增量 archify +1833 继续领跑;ECC +1462(首次有精确基线并发布 v2.2.1);markitdown +1489;相对增速 codex-with-chatgpt +22.8% 全场第一;awesome-gpt-image-2(GPT-Image 模板库)受 Images 2.5 发布带动 +788。
- CoSER 今日无实质更新。
AI 新闻
- OpenAI:内部多智能体系统给出 Navier–Stokes 千禧年问题解答,另附 Euler 方程正则性反例
- 事件时间:公告发布于 2026-09-08(页面日期);解法实际由 agent 在 09-05(启动后约 88 小时)得出,09-06 完成 Lean 形式化验证(由 GPT-6 Astra 再花 17 小时)。媒体与当事数学家文章均为 09-07/09-08。
- 为什么重要:Navier–Stokes 存在性与光滑性是克雷数学研究所七大千禧年问题之一(单项 100 万美元奖金)。OpenAI 首次披露「训练中的内部模型(明显强于 GPT-6 Astra)+ 约 1 万个并发 agent 协作」的工作方式:NS 结论为「有限时间内形成奇点」(官方表述 C/D 版),并提供 Lean 形式化证明仓库。即便最终未被数学界验证,这也是「AI agent 冲击千禧年难题」规模与成本第一次被量化。
- 关键变化/数字(多为厂商自述):全部尝试问题共 490 万条消息、约 3000 亿输出 token(TechCrunch 按 Astra 现价折算约 2250 万美元算力);其中 NS 相关 270 万条消息、约 1300 亿 token;Euler 反例由约 100 个 agent 用约 50 小时完成。注意:厂商披露,独立验证尚未完成。
- 争议(同日):NYU 教授 Tristan Buckmaster 与 Anthropic 研究员 Levent Alpöge 于 09-07 晚公布三个证明(多孔介质方程、Boussinesq、3D 无压缩 Euler 的强制有限时间爆破解,均带 Lean 验证),并指称 OpenAI 在 09-03 得知其进展后投入巨量算力抢先,且 Bubeck 曾提出「去掉 Alpöge 署名」「你为什么要毁掉自己的职业生涯」等方案。OpenAI 一方(Bubeck 声明 + Altman 回应)否认使用其提示词/证明,称 OpenAI 09-01 起在听到「有人解出千禧年题」的传闻后独立启动,并承认双方存在沟通。
- 现状/来源:OpenAI 的完整证明(约百页手稿)仍只在其内部,Buckmaster 本人也未看过;对该项「已解决」结论应先保持怀疑,等待独立复核。 OpenAI 官方说明;TechCrunch 争议报道;Buckmaster 声明 PDF
- OpenAI 发布 ChatGPT Images 2.5 + API 模型 GPT-Image-2.5 Flare / Sunburst
- 事件时间:2026-09-08。
- 为什么重要:新一代 SOTA 图像模型——光照更自然、纹理更丰富,参考图主体保持更好,多轮编辑一致性提升;生成延迟较 2.0 最多降 50%;新增 Sketch 功能(在 ChatGPT 里手绘草图作为视觉指引直接成图)。当前全网每周经 ChatGPT Images 与 API 生成超 30 亿张图。
- 开放方式/许可证:即日向 ChatGPT、ChatGPT Work、Codex 全档位(桌面/移动/网页)推送;API 提供 Flare(默认,质量高于 GPT-Image-2 且延迟低 50%)与 Sunburst(更长生成时间、更精细控制)两款。模型架构/参数量/上下文未披露(官方未披露);延续 C2PA 元数据 + 隐形水印。
- 已接入生态:Adobe Firefly、Manus、Runway 首次公开使用反馈(厂商引用)。
- 来源:OpenAI 官方公告
- Mistral 完成 30 亿欧元 D 轮融资,投后估值超 210 亿欧元(欧洲科技史上最大股权融资)
- 事件时间:2026-09-08 官宣。
- 为什么重要:Mistral 以「主权、开放权重 AI」定位拿到欧洲史上最大单笔股权融资:三星电子领投,Scaleup Europe Fund(EQT 管理)与 PSG Equity 联合领投,Advent、BlackRock 系基金、卢森堡大公国首次进入,老股东 a16z、ASML、Bpifrance、NVIDIA、Korelya 跟进。对「非美国模型」合规需求和企业主权 AI 叙事都是强信号;也说明资本仍把「欧洲本土前沿模型」当战略资产。
- 来源:Mistral 官方公告;Bloomberg(三星领投);European Startups
- Runway 发布 Adobe 插件:在 Premiere Pro / After Effects 内直接生成与重绘
- 事件时间:2026-09-08(北京 09-09 凌晨推送)。
- 为什么重要:把生成式工具塞进剪辑师最常用的时间线工作流——在 Pr/AE 里选择素材即用 Aleph 2 重绘整段(保留时长),逐帧比较后落回工程;插件免费下载,生成走现有套餐额度。是「AI 视频编辑介入专业后期管线」的又一落地形态。
- 来源:Runway 官方
- Dwarkesh(Dwarkesh Patel):预训练进步主要来自「数据」而非「模型改进」
- 事件时间:2026-09-08 发布(分析性研究,非官方,方法规模较小)。
- 为什么重要:对 2019–2025 各年代代表性「模型配方 × 数据语料」组合做的受控实验(多条 scale curve、多 seed),发现计算效率提升中约 3.24 倍来自数据改进(数据 12.0×、模型 3.7×,@1e19 FLOPs),且两者贡献基本独立(88% 方差由加性效应解释)——意味着「数据墙」与合成数据能否补齐,比很多人以为的更关键,对研究预算分配有直接含义。
- 局限(原文自述):小规模公开语料、GPT-2/OLMo-2 时代结论,未覆盖合成数据;对前沿超大模型的普适性待验证。
- 来源:原文
最新论文
本窗口 arXiv 无新增批次:最近公告批次仍为 09-04(美国劳动节导致公告暂停,本窗口内四类目无新提交、无窗口内实质修订),该批次相关精选已在 09-06/09-07 两期覆盖,不予重复。本窗口真正的科研产出是下面两项(已在新闻节报告):
- Navier–Stokes 有限时间奇点证明(OpenAI 内部模型):附 Lean 形式化 + 评测仓库,代码/形式化证明已开源(值得独立复跑);论文为首次公开,未经同行评审。来源:论文 PDF
- Buckmaster & Alpöge 三篇强制爆破解证明(多孔介质 / Boussinesq / 3D 无压缩 Euler,均带 Lean 文件,09-07/08 公开):指出其可复现性最强的一环正是公开的 Lean 验证文件;两项工作方向不同(强制 Euler 与无强制 Euler 等),需区分看待。
GitHub 增星加速榜
口径:连续快照精确差值(2026-09-08 08:02 基线 → 2026-09-09 08:08 复采,实际 24.09 小时);所有数字均为 GitHub API 实采,非 Trending 估算。
- tt-a1i/archify
- 项目简介:让 AI agent 直接产出「可验证的架构/工作流/时序/数据流图」的 Agent Skill——自包含 HTML、带动效与可导出,面向靠 agent 写技术方案与架构文档的开发者,解决「图丑且不可控」的痛点。
- 为什么受关注:连续第 N 天绝对增量第一(+1833),已连续多日霸榜;「verifiable + self-contained」差异化成立,09-08 新增 Gitee/本地仓库证据支持,实用性继续加厚。
- 近期动态:09-08 三个提交——viewer 字体内嵌保证页面自包含(#256)、支持 Gitee 与纯本地仓库的证据收集(#354)、桌面阅读器示例保持可打包(#325);最新 release 仍为 v2.16.0(08-30)。
- 新增 Stars:+1,833(精确 24h 快照差值);当前 Stars:54,681;增长率:+3.47%/24h
- 仓龄/最近实质提交:约 5 个月(2026-04-15 创建)/ 2026-09-08
- 许可证:MIT
- 成熟度/风险:持续高增量叠加高频维护,结构健康;星数已大,短期热搜成分需按月观察是否转为稳定增速。
- affaan-m/ECC
- 项目简介:定位「agent harness 性能优化系统」——整合技能、本能、记忆、安全与研究优先开发方法,面向 Claude Code/Codex/Opencode/Cursor 等多 agent 环境的开发者。
- 为什么受关注:上次因无基线只能估算,本次首次拿到精确基线差 +1462、并将于 09-08 发布 v2.2.1 维护大版——「性能优先 + 长上下文/成本优化」叙事继续踩中当下 agent 成本焦虑。
- 近期动态:09-08 17:52Z 发布 v2.2.1(整合 2.2.1 维护补丁);09-07 连发三提交(Windows 所有权路径测试修复、release 评审缺口收敛、CI 失败套件暴露修复)。
- 新增 Stars:+1,462(精确 24h);当前 Stars:254,283;增长率:+0.58%/24h
- 仓龄/最近实质提交:约 8 个月(2026-01-18 创建)/ 2026-09-08
- 许可证:MIT
- 成熟度/风险:星数体量巨大且为个人整合型项目,高星规模与工程深度需持续留意(完整性风险,区别于官方仓库)。
- microsoft/markitdown
- 项目简介:微软开源的「任何办公文档→Markdown」转换器(Word/Excel/PPT/PDF/OCR/音频等),是「把文档喂给 LLM」的 RAG/文档智能管线第一公里事实标准。
- 为什么受关注:单日 +1489、高位稳定增长;09-04 发布 v0.1.8b1 预发布版后继续吸星,说明「默认入场券」级依赖的属性稳固。
- 近期动态:09-07 README 更新;上一正式版 v0.1.7(07-29),当前渠道为 v0.1.8b1(09-04,含多格式修复)。
- 新增 Stars:+1,489(精确 24h);当前 Stars:181,661;增长率:+0.83%/24h
- 仓龄/最近实质提交:约 1.8 年(2024-11 创建)/ 2026-09-07
- 许可证:MIT
- 成熟度/风险:微软主仓库、下游依赖极广,风险低;仅需关注预发布版到正式版节奏。
- DietrichGebert/ponytail
- 项目简介:一句话行为引导型 Agent Skill——「让 AI agent 像最懒的资深工程师一样思考:最好的代码是没写出来的代码」,面向被 agent 产出一堆垃圾代码困扰的开发者。
- 为什么受关注:单日 +1226、连续多日高增量;meme 化表达持续精准戳中 agent 编程「少写代码、多判断」的痛点,叠加本周 agent 密集发布放大关注。
- 近期动态:09-07 有提交;内容层仍为概念单点。
- 新增 Stars:+1,226(精确 24h);当前 Stars:132,168;增长率:+0.94%/24h
- 仓龄/最近实质提交:约 3 个月(2026-06-12 创建)/ 2026-09-07
- 许可证:MIT
- 成熟度/风险:内容轻量、星数含较强 meme/情绪成分;引入工作流前请实测效果而非看星数。
- XiaoDuoYa/codex-with-chatgpt
- 项目简介:把 ChatGPT 当「规划大脑」、Codex 当「执行引擎」的桥接方案(MCP 层转发),面向想要「大模型负责想、代码智能体负责做」组合的开发者。
- 为什么受关注:单日 +613、相对增速 +22.76% 全场第一;09-04 发布 v0.1.2(结构化 MCP 输出、更可靠的隧道、Windows 打磨)后口碑扩散,属「小而实用」的典型。
- 近期动态:09-04 v0.1.2 release + MCP 结构化输出提交(#322/#238);官方发布 12 天即 3.3k 星。
- 新增 Stars:+613(精确 24h);当前 Stars:3,306;增长率:+22.76%/24h
- 仓龄/最近实质提交:约 12 天(2026-08-28 创建)/ 2026-09-04
- 许可证:MIT
- 成熟度/风险:极新、单一路线,观察重点是其桥接模式能否稳定兼容两方 API 变化。
- freestylefly/awesome-gpt-image-2
- 项目简介:「Prompt as Code」的 GPT-Image 工业级提示词引擎与模板库——530+ 案例逆向工程、20+ 套工业级模板,面向想稳定出高质量 GPT-Image 效果的内容/设计师。
- 为什么受关注:单日 +788;与今日 OpenAI 发布 Images 2.5 形成生态联动(模板库紧贴新一代图像模型),发布约 4 个月冲到 2.9 万星。
- 近期动态:09-03 提交(集成 APIMart GPT-Image-2 生成);无独立 release。
- 新增 Stars:+788(精确 24h);当前 Stars:29,282;增长率:+2.77%/24h
- 仓龄/最近实质提交:约 4.5 个月(2026-04-25 创建)/ 2026-09-03
- 许可证:MIT
- 成熟度/风险:模板库内容质量参差、依赖模型版本稳定性;新模型发布期短期热度高,实际收益需按案例实测。
今日最值得跟进
- 「AI 解出 Navier–Stokes」先当「可验证的实验声明」读,别当结论:OpenAI 明确不认领千禧年奖、证明未经独立复核、手稿不公开;真正已公开且 Lean 可跑的,反而是 Buckmaster & Alpöge 的三篇(强制爆破解)。若布局科研或内容,优先消费「带代码可复现」的那部分,并跟进 Clay 官方是否受理。
- ChatGPT Images 2.5 API(Flare/Sunburst)已上线:对图片类产品/工作流是直接可用的升级点;注意 C2PA 水印与「Flare 快而便宜 vs Sunburst 精而慢」的定价取舍。
- Mistral 是欧洲主权 AI 的资本锚点:30 亿欧元之后,关注其开源权重发布与 API 定价——对合规敏感、不想全押美国模型的场景是替代选项信号。
- GitHub 方向:archify 适合做架构图生产力工具;codex-with-chatgpt 适合「ChatGPT 规划 + Codex 执行」组合尝鲜(v0.1.2);awesome-gpt-image-2 可在 Images 2.5 上快速做提示词迁移测试;ECC 星数巨大但为个人整合项目,谨慎纳入关键路径。
建议行动
- 若做图像产品:拉取 GPT-Image-2.5 Flare/Sunburst 各跑一组自测(延迟/质量/成本 vs 现行 gpt-image 管线),C2PA 合规一起测。
- 若关注模型能力:等第三方对「内部模型」与 Astra 的独立评测,别把厂商自述当结论;可先复跑 openai/NavierStokesAndEuler 的 Lean 形式化验证作为第一手校验。
- 若谈欧澳/海外合规:把 Mistral 融资后的 API 与新开源权重纳入观察清单;本周 OpenAI/NYU-Anthropic 的署名争议也在提醒「AI 辅助数学的贡献归属」尚无规则,做相关报道/合规时要措辞谨慎。
- Git 仓跟进:codex-with-chatgpt 正处快速迭代期,若采用请锁版本并跟踪 release;archify 持续观察其月均增速是否稳定。