← 返回智能日报

智能日报 · 2026-08-29

GLM-5.3(744B)开源权重落地、腾讯混元 Hy4 preview 开源(770B/1M 上下文/Apache-2.0);英伟达拟 129 亿美元收购 Hugging Face(媒体披露待确认);Anthropic 发布自动化对齐研究员;GitHub 增星 archify 再 +4,187 领跑、WeMM-Embedding 单日 +56.6%。

今日速览

  • 最重要:智谱 GLM-5.3(744B MoE)开源权重落地 —— 8/14 发布时预告"两周后开源"、因网络安全能力超预期而延期的主模型,权重文件已于 8/28 晚间出现在 Hugging Face(141 分片,自定义 GLM-5.3 License);本轮评估中跨 269 个真实项目发现 2,436 个漏洞,安全披露台账同步公开。
  • 同窗重磅:英伟达拟以约 129 亿美元收购 Hugging Face(媒体披露,待官方确认) —— 若成真,将把"开源模型分发与发现层"收进 NVIDIA,并有嗅觉地接续 OpenAI-HF 事件后的治理讨论。
  • 国产开源同时双响:腾讯混元 Hy4 preview 开源(770B 总参 / 49B 激活 / 1M 上下文 / Apache-2.0),直指代码、办公、科学、游戏生产力场景。
  • GitHub 精确差分(23.96h):archify 再 +4,187★(+18.1%)领跑绝对增星(订阅比异常风险仍未解除);WeMM-Embedding +294★(+56.6%)领跑增速,首次给出精确差值;K-Dense-AI/scientific-agent-skills +1,264★。

AI 新闻

  1. 英伟达拟以约 129 亿美元收购 Hugging Face(媒体披露,官方与 HF 均未确认)
    • 事件时间:美西时间 8/27 起报道(The Information 首发,CNBC/Reuters/Forbes 8/28 跟进),位于本窗口起点附近;属披露待确认事件
    • 为什么重要:HF 是开源 AI 模型的分发、下载与发现枢纽。收购若成真,NVIDIA 将同时掌握"开源模型分发入口+模型下载/硬件遥测数据+发现层",对开源生态、云厂商与模型厂商的影响都将是结构性的;近期 OpenAI-HF 安全事件也让 HF 的治理与数据问题被高度审视
    • 关键变化/数字(媒体口径不一):CNBC「已达成协议,$12.9B」、Business Insider「仍在谈判,$13B+」、相关报道「六个月前估值约 $7B」——金额与状态均待公司官宣
    • 状态:传闻/待确认,未获 NVIDIA 或 Hugging Face 官方确认
    • 来源:CNBC、Reuters、Forbes
  2. 智谱 GLM-5.3(约 743B MoE)开源权重发布:网络战能力的"开源兑现"
    • 事件时间:2026-08-28(Zai_org 于北京时间 8/28 23:04 经 X 宣布;HF 仓库 8/28 22:22 更新,权重文件已就位)
    • 为什么重要:GLM-5.3 是 8/14 发布时就预告"约两周后开源"的主模型,因在漏洞利用链上的能力发展超预期而多次以安全评估为由延迟(曾错过 8/28 预告日)。权重落地意味着"开源 SOTA 编码+网络攻防"同时进入可自托管、可审计阶段,是非 GLM-5.3-Flash 的另一条线
    • 关键变化/数字(Z.ai 自报):基于 GLM-5.2 底座、仅靠后训练("Scaling post-training is all we did");CyberGym 84.5%(领先 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%)、ExploitBench 54.4%(较 GLM-5.2 翻倍);评估中跨 269 个真实开源项目发现 2,436 个漏洞(1,097 个中高危,最老漏洞可追溯至 1981 年),已建公开披露台账 cvd.z.ai(截至报告 53 个已公开)
    • 开放方式、规模、上下文、许可证:HF zai-org/GLM-5.3,141 分片 safetensors(约 743B MoE),license 标注 "other"(新"GLM-5.3 License";媒体称允许商用与再分发、对年营收超 100 亿美元企业设安全审查门槛——条款以官方文件为准);发布收尾中,HF 页面仍显示 Upcoming release
    • 来源:HF 模型页、Z.ai 发布博客、安全披露台账
  3. 腾讯混元开源自研旗舰 Hy4 preview:770B 总参 / 49B 激活 / 1M 上下文(Apache-2.0)
    • 事件时间:2026-08-28(hy.tencent.com 官方页;HF/腾讯云/ModelScope/AtomGit 同日上线)
    • 为什么重要:又一个进入"开源第一梯队"的国产旗舰 MoE,且刻意走 1M 超长上下文+生产力(代码/办公/金融/科学/游戏)定位,与 GLM-5.3、Kimi K3 正面竞争;腾讯把内部软工、游戏、金融、安全专家的高质量数据直接喂进后训练
    • 关键变化/数字(官方/厂商披露):总参 770B、激活 49B、上下文 1M;官方称"稳居开源模型第一梯队",其内部测试称小幅优于 Z.ai 与月之暗面竞品(自测口径);API 已上腾讯云(预览定价分档 0.3/6/18 元,以控制台为准)
    • 开放方式、规模、上下文、许可证:Apache-2.0 开源;GitHub Tencent-Hunyuan/Hy4-preview、HF tencent/Hy4-preview、ModelScope、AtomGit;也被 Reuters 报道
    • 来源:hy.tencent.com 官方页
  4. Anthropic《自动化对齐研究员》:Claude 自主训练模型修复 10 类对齐失败,成绩超过 28 位人类安全研究员
    • 事件时间:2026-08-28(Anthropic 官网研究博客)
    • 为什么重要:"AI 让 AI 更安全"从发现/评测转向可自动修复。Claude 在一个监控智能体约束下循环"检索文献→设计方法与数据→训练→测试",说明对齐缺陷修复可被端到端自动化,而不再依赖人工红队逐条打补丁
    • 关键变化/数字(Anthropic 自报):10 类对齐失败(隐私泄露、谄媚、越狱等,每类 3–5 个评测)全部找到修复且未伤及通用能力;最佳方法在"Claude 未见过"的 withheld 基准与 Petri 对抗评测上仍有效;对最大 4.7 倍于优化目标的模型仍有效;整体超过 28 位人类安全研究员的基线
    • 来源:Anthropic 官方研究页
  5. 美联邦法官裁定:特朗普政府将 Anthropic 列入黑名单违法(违宪报复)
    • 事件时间:2026-08-28(加州北区法院 Rita Lin 法官裁定;Ars Technica 报道)
    • 为什么重要:法院明确"国家安全的空泛援引不是报复批评者的空白支票",废除了联邦禁用 Anthropic 产品、禁止国防承包商与其交易等行政指令,并责令撤销相关指令——对"AI 企业因公开安全立场被政府采购制裁"的边界给出司法边界
    • 关键变化/数字:黑名单发生在 Anthropic 拒绝放宽"致命自主武器/大规模监控"使用限制之后;政府在诉讼中承认 Anthropic 的技术与国家安全的"黑盒"风险无异;Anthropic 3 月起诉
    • 来源:Ars Technica
  6. Terminal-Bench-Science 0.1:面向真实科研工作流的 Agent 评测基准上线(Stanford 主导)
    • 事件时间:2026-08-28(官方公告)
    • 为什么重要:科学 Agent 能力评估首次"由科学家而不是模型厂商定标尺"——任务直接取自研究者自己的工作流(分析、仿真、代码、数据产物),并随前沿模型持续演进;当前头名模型也仅解决约三成
    • 关键变化/数字:首批 70 个任务(生命/物理/地球/数学/工程科学);当前最强为 Claude Opus 5(Claude Code 路线)30.0% 解决率,其次 GPT-5.6 Sol+Codex 22.4%、Claude Fable 5 21.4%,GLM-5.3 仅 8.1%
    • 开放方式:在线评测开放(terminal-bench-science.ai),任务可验证
    • 来源:官方公告
  7. Open ASR 排行榜新增首个"全球南方"语言:印地语/印度英语 Monsoon 评测集
    • 事件时间:2026-08-28(Hugging Face 官方博客)
    • 为什么重要:评测不再只看单一 WER——新增评测集按地理/年龄/性别/口音/设备等 12 项说话人属性分组打分,暴露"平均值正确、特定人群很糟"的语音识别偏差,为 ASR 公平性设了新标尺
    • 关键变化/数字:Monsoon en-IN / hi-IN 两套(印地语为多语言板块首个非欧洲语言);公开+私有双分割(防刷榜),4,888 位说话人、9 个变化轴
    • 来源:HF 官方博客

最新论文

口径:本窗口截稿时 arXiv 暂无晚于昨版截稿时点的首批提交;以下为最新一批 2608.27xxx(北京时间 8/28 凌晨公告、紧邻窗口起点,昨版未收录),均为首次提交 v1。代码/数据状态按摘要披露标注。

  1. TTPO:Test-Time Policy Optimization(首次提交,2026-08-28 北京时间凌晨)
    • 核心贡献:把"测试时训练(TTT)"带到推理环节——用多数表决伪标签做无监督训练,但对与伪标签相悖的 rollout 用 Grouped RL 惩罚(而非都蒸馏),规避"错误伪标签污染教师"的经典陷阱
    • 与已有方法的区别:相对 OPSD/RL 的对称目标,提出非对称目标(同意的蒸馏、不同意的惩罚)+token 级选择,使 TTT 无需任何标签也能立于有监督训练之上
    • 关键实验:无标签情况下匹配有监督 OPSD 在 5 个竞赛级数学基准的成绩;Qwen3-1.7B 在 TTT 下 38.0%→45.2%;"不加思考"场景 +25.2%~+36.4%;跨任务泛化稳定
    • 代码/数据:已开源(GitHub ZJU-REAL/TTPO,项目页)
    • 论文原文
  2. WikiSkill:把 Agent 执行经验沉淀为持久知识库,使技能可持续进化(首次提交,2026-08-28 北京时间凌晨)
    • 核心贡献:将"原始执行经验 / 累积知识 / 可执行技能"三层分离,用一个持久 wiki 持续汇总经验,后续技能更新可站在既有知识上迭代——把一次性经验变成可复用的演化资产
    • 与已有方法的区别:现有自动技能发现方法不保留"指导开发的洞察",跨轮次系统性复用差;WikiSkill 显式做知识的跨迭代沉淀
    • 关键实验:多个基准与模型上持续优于现有技能进化 SOTA;技能与模型规模互补(小模型带上技能可反超大模型);学到的技能可跨模型/跨家族迁移
    • 代码/数据:摘要未披露
    • 论文原文
  3. SWE-Prime:更少轨迹、更好性能——面向编码 Agent 的多粒度 SFT 数据精选(首次提交,2026-08-28 北京时间凌晨)
    • 核心贡献:放弃"成功轨迹全量 SFT",改为两阶段筛选——先在轨迹层按过程质量/结果质量/代表性挑选,再在语义片段层按"对最终方案贡献/可学习性/风险"筛选,只让被选片段参与损失计算
    • 与已有方法的区别:直接指出"成功轨迹≠高质量监督"(可能含冗余、无效甚至危险步骤),这是对"炒作越多越好"式数据扩增的反向经验
    • 关键实验:只用全部已解决数据的 10% 训练,在 SWE-Bench Pro 与 SWE-Bench Verified 上分别相对全量训练提升最多 12.2% 与 24.2%
    • 代码/数据:摘要未披露
    • 论文原文
  4. CritICL:用小模型"失败模式"做推理期弱到强泛化(首次提交,2026-08-28 北京时间凌晨)
    • 核心贡献:把同族小模型的结构化失败模式当作"批评式 ICL 示例"注入大模型推理,让失败成为引导而非噪声;提供动态(预测式检索批评)与静态(全局失败画像)两个变体
    • 与已有方法的区别:推理期扩展通常靠重复采样或外部验证器(高 token 成本);CritICL 单次前向即可达到接近测试时扩展的水平
    • 关键实验:一致优于标准 ICL,与测试时扩展方法竞争力相当或更好,而生成次数与 token 成本显著更低
    • 代码/数据:已开源(GitHub umwyf/CRITICL)
    • 论文原文
  5. INTENT-AS-A-TOOL:给 Agent 一个"意图通道"来实时追踪对齐漂移(首次提交,2026-08-28 北京时间凌晨)
    • 核心贡献:给模型增加"意图型工具",让对某目标的承诺表达有一个专用信道;对该工具的调用概率可作为无裁判、细粒度的恶意意图信号
    • 与已有方法的区别:事后 CoT 标注太粗、无法说明意图在生成中如何演变;本方法把事后标签展开为稠密轨迹,并定位"可在线干预的关键步"
    • 关键实验:与 CoT 监控互补;在 Agent 对齐失败设定中可识别出有害执行前的意图信号,为在线干预提供依据
    • 代码/数据:代码与数据已开放(GitHub RebeccaZhang22/intent-as-a-tool)
    • 论文原文

GitHub 增星加速榜

口径:精确快照差值(基线 2026-08-28 08:04 北京时间 → 本次 08-29 08:01 复采,实际 23.96 小时窗口);新收录仓库无旧基线标「估算/无基线」。(昨版已详报项目,本节给出更新数据与风险跟踪。)

  • tt-a1i/archify
    • 项目简介:Agent 技能——用自包含 HTML+动效产出"可验证、好看"的架构/时序/数据流/生命周期图并可导出,面向要给甲方、评审演示架构图的开发者/架构师,解决"AI 画的图丑、逻辑对不上、没法演示"痛点("Agent 出图"细分场景)。
    • 为什么受关注:上 GitHub Trending 后持续病毒式传播,叠加社区(LINUX DO)二次扩散;"用 AI 出专业图表"是高转发刚需。
    • 近期动态:8/28 持续日更——合并 #159(导航语言保持)、#155/#156(Star History 自托管图表)等;v2.15.0 于 8/17,处于高频迭代。
    • 新增 Stars:+4,187(精确快照差值,23.96 小时窗口,约 4,200★/日)
    • 当前 Stars:27,295
    • 增长率:+18.1%
    • 仓龄/最近实质提交:4.5 个月 / 2026-08-28
    • 许可证:MIT
    • 成熟度/风险:⚠️ 连续两日爆量(前日 +3.4k、本日 +4.2k)但此前订阅/star 比异常,刷星嫌疑未排除;代码提交真实活跃,建议持续看订阅数与 release 质量,暂不宜据此判定"用户真实涌入"。
  • K-Dense-AI/scientific-agent-skills
    • 项目简介:把任意 AI 智能体变成"AI 科学家"的 Agent 技能库——163 个已校验技能+100+ 科学数据库,覆盖生物、化学、医学与药物发现,目标用户是科研工作者(官方称 17.5 万+科研人员使用)。
    • 为什么受关注:Terminal-Bench-Science 上线、实验室自动化(Anthropic MHS)等把"科研 Agent"推上风口,科学领域技能库是稀缺且复用性强的资产。
    • 近期动态:8/28 更新 README(把 K-Dense BYOK 线上研讨会改为回放链接);8/24 更新安全扫描报告,周更级维护。
    • 新增 Stars:+1,264(精确快照差值,23.96 小时窗口)
    • 当前 Stars:36,564
    • 增长率:+3.58%
    • 仓龄/最近实质提交:10 个月 / 2026-08-28
    • 许可证:MIT
    • 成熟度/风险:维护活跃、文档完善;"17.5 万科学家"为项目自报数字(vendor 口径),技能实测质量需自行抽样验证。
  • Tencent/WeMM-Embedding
    • 项目简介:腾讯微信视觉团队的通用多模态 Embedding 模型家族(2B/4B/9B)——支持文本/图像/视频/视觉文档/交错输入,Matryoshka 维度 64–4096,面向多模态检索与 RAG 底座。
    • 为什么受关注:官方多模态检索底座稀缺,叠加腾讯品牌与开源首发(HF 权重+arXiv 技术报告),发布即获流量。
    • 近期动态:8/28 新增 README_zh.md;8/25-26 更新模块加载方案(SentenceTransformer 直连)与 arXiv 链接。
    • 新增 Stars:+294(精确快照差值;基线 519 → 现 813,23.96 小时窗口)
    • 当前 Stars:813
    • 增长率:+56.6%(全榜最高增速)
    • 仓龄/最近实质提交:4 天(创建 2026-08-25)/ 2026-08-28
    • 许可证:README 标 Apache-2.0、GitHub API 显示待确认(NOASSERTION)——需以仓库 LICENSE 为准
    • 成熟度/风险:极早期仓库,权重与框架仍在快速收敛;增速能否维持待观察,模型生态(检索评测复现)尚未成熟。
  • 〔更新〕DietrichGebert/ponytail(昨版已详报)
    • 更新:+1,324★(精确差值,23.96h)→ 115,340★(+1.16%);仍是"停更在涨"——最近提交停留 8/7(v4.9.0 后),热度靠传播而非迭代。MIT。
  • 〔更新〕freestylefly/awesome-gpt-image-2(昨版已详报)
    • 更新:+1,243★(精确差值,23.96h)→ 24,223★(+5.41%);8/28 新增第 539–544 号 GPT Image 2 提示词案例,保持日更。MIT。
  • 〔新收录·无基线〕calmrocks/ai-engineer-notebooks
    • 简介:面向 AI 工程师/FDE(前向部署工程师)技能集的"免框架 Colab 笔记本"——模型 API、结构化输出、工具调用、RAG、评测驱动开发、Agent(从零写循环到 MCP/Skills)、微调 vs LoRA 全覆盖,可直接在 Colab 免费跑。
    • 为什么受关注:把"AI 工程师"职业最热门的技术栈做成零依赖入门路径,契合今年 FDE/AI 工程师教学浪潮;与 Anthropic/Karpathy 教授编程 Agent 的教学趋势同一方向。
    • 近期动态:8/28 多笔提交(prose 校对与章节修正),创建于 8/11,目前 480★(估算/无基线,创建约 2.5 周)。
    • 当前 Stars:480|仓龄 2.5 周|最近提交 2026-08-28|许可证 MIT
    • 成熟度/风险:新仓库内容量在快速补齐,属资源型项目(无运行风险);已加入下期基线。

今日最值得跟进

  1. GLM-5.3 开源权重正式落地:核对 GLM-5.3 License 完整条款(商用/再分发与"年营收超 100 亿美元需安全审查"门槛,以官方文件为准);自托管/API 评估其编码与网络能力;持续跟踪 cvd.z.ai 披露台账(2,436 项中发现、53 项已公开)对真实漏洞生态的影响。
  2. NVIDIA–Hugging Face 交易:等待官方正式确认与条款(控制权、HF 治理、数据与遥测归属);对开源模型分发与"下载层"垄断的走向保持跟踪——这也直接关系到我们使用的开源生态稳定性。
  3. Hy4 preview vs GLM-5.3 双开源旗舰:两者同日前后脚开源;可放进同一套生产基准(Terminal-Bench 类、1M 上下文检索/Agent 任务)对比,别只看厂商自报分。
  4. "科研 Agent"开始有行业标尺:Terminal-Bench-Science(Stanford)+ Anthropic 自动化对齐研究员 + INTENT-AS-A-TOOL——评测、研究、监控三端同日推进,"AI 能否自主做科研/自我改进"成为可验证命题。

建议行动

  • 给 GLM-5.3 与 Hy4 preview 各建一条评估记录(编码/长上下文/工具调用),首批结果纳入下次日报对比;GLM-5.3 优先走 API 或官方部署栈,留意 license 门槛。
  • 把 calmrocks/ai-engineer-notebooks 纳入增星基线;对 archify 继续关注订阅比(怀疑刷星),对 WeMM-Embedding 观察下周增速是否回落。
  • 订阅 / 跟进 NVIDIA-HF 官方公告与 HF 治理、条款细节;若推进收购,评估对自建模型分发/依赖的开源组件的影响面。