今日速览
- 模型竞争从“更强”继续转向“每个任务更便宜”:OpenAI发布GPT-6 Sol/Luna,官方称API价格较GPT-5.6促销价低50%;Anthropic发布Claude Opus 5.5,称大多数工作达到Claude Fable 5.1水平,运行成本较Opus 5低40%。
- Agent的评测重点正在从终点分数转向过程风险:最新论文同时覆盖可训练状态、双控制安全、自演化过程、视频工具调用和长时游戏能力,说明“能不能完成”已经不够,还要看模型在哪一步失控、是否能稳定复现。
- GitHub绝对增星领先者:God's Eye View +3,477、ECC +3,376、Archify +3,091、Alibaba OpenCodeReview +3,074;但本次是与上次成功快照之间约96小时的精确差值,不应当解读为单日增星。
AI 新闻
- OpenAI发布GPT-6 Sol和GPT-6 Luna,把GPT-6 Astra的能力下放到更快、更便宜的型号
- 事件时间:2026-09-22 18:00 UTC;官方RSS同日发布。
- 为什么重要:前沿模型竞争开始直接围绕“单任务成本”展开。便宜型号如果保持足够的智能水平,会先改变Agent的路由、批处理和长链工作流,而不只是改变聊天产品的选择。
- 关键变化/数字:官方称两款模型API价格较GPT-5.6促销定价低50%;AIHOT根据原始公告整理的价格为Sol输入/输出$2/$10、Luna为$0.10/$0.50(每百万token)。这些数字仍应以官方价格页为准,不能等同于独立评测结论。
- 开放方式、规模、上下文、许可证:通过OpenAI API及相关产品提供;参数规模和上下文上限官方未披露;非开放权重,具体许可按服务条款。
- 来源:OpenAI官方公告
- Anthropic发布Claude Opus 5.5,以较低运行成本追平上一代更高档位
- 事件时间:2026-09-22;Anthropic新闻室同日列出。
- 为什么重要:Anthropic把“达到更高档模型的能力”与“降低运行成本”绑定,企业迁移模型时应同时比较质量、延迟、缓存和每个完整任务的成本,而不是只看单次token单价。
- 关键变化/数字:Anthropic称Opus 5.5在大多数工作上达到Claude Fable 5.1水平,运行成本较Opus 5低40%。这是厂商披露,仍需按自己的Agent任务复测。
- 开放方式、规模、上下文、许可证:通过Claude产品及开发者平台提供;参数规模和上下文上限官方未披露;非开放权重,具体许可按服务条款。
- 来源:Anthropic官方公告
- OpenAI为GPT-6改进提示词缓存,并加入更细的诊断与控制
- 事件时间:2026-09-22 21:00 UTC;官方RSS同日发布。
- 为什么重要:对长期运行的Agent,缓存命中率、显式断点和可观测性比一次性基准分更接近真实账单。提示词结构应从“能不能调用模型”升级为“哪些前缀稳定复用、何时失效、失效后成本是多少”。
- 关键变化/数字:官方公告列出更高缓存命中率、新诊断工具、显式断点和降低延迟/成本的控制;缓存折扣和具体适用条件以官方页面为准。
- 来源:OpenAI官方公告
- OpenAI公布第三方AI评估的优先级与原则,把独立安全评测推向标准化
- 事件时间:2026-09-22;官方RSS标注为Safety文章。
- 为什么重要:如果第三方评估要真正影响模型发布与采购决策,评测需要独立、可复核、具备安全边界,而不能只是厂商自报分数。对使用Agent的团队,这也提供了把外部红队、回归集和上线门槛制度化的方向。
- 关键变化/数字:OpenAI提出围绕严谨性、安全性和独立性的第三方评估原则;文章是治理框架,不是新模型发布,也没有给出一套已经完成的统一分数。
- 来源:OpenAI官方说明
- Epoch AI报告称,达到同等AI性能的成本过去三年平均每季度下降约47%
- 事件时间:2026-09-22。
- 为什么重要:如果这一趋势在更多任务上成立,模型选型会更快从“买最强模型”转向“按任务分层路由”:简单步骤用低价模型,难点再升级到前沿模型。
- 关键变化/数字:Epoch AI基于数学、硬科学和技能游戏等五类基准估算,刚达到SOTA的性能成本每季度下降约66%,两年后放缓到约32%;报告同时提醒基准针对性训练和数据不完整会影响结论,并公开数据与代码。
- 来源:Epoch AI原始报告
最新论文
- Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use(首次提交,2026-09-21 17:57 UTC)
- 核心贡献:用嵌套采样区分当前动作造成的奖励变化与后续随机性,找出多轮工具调用中真正值得训练的状态。
- 与已有方法的区别:不是对整条轨迹平均分配训练信号,而是诊断具体哪一次模型调用对任务成功有可学习影响。
- 关键实验:在BFCL v4中,针对missing-function任务训练被诊断出的状态,性能提升约14个百分点;训练其他状态则基本持平或变差。
- 代码/数据:arXiv页面未提供代码或数据链接,暂未披露。
- 论文原文
- DUMA-Bench: A Dual-Control Multi-Agent Benchmark for Evaluating LLM Agent Security(首次提交,2026-09-21 14:28 UTC)
- 核心贡献:把用户和Agent都能改变环境状态的“双控制”交互纳入安全评测,覆盖RAG投毒、跨Agent操纵和不安全输出等八类漏洞。
- 与已有方法的区别:多数安全基准假设用户被动、环境静态;DUMA-Bench测量用户行为与Agent行为共同作用时的安全性。
- 关键实验:评测5个模型家族、14个模型、8个领域;加入双控制后攻击成功率从26.9%升至41.1%。
- 代码/数据:arXiv元数据未披露代码或数据链接;论文标注为ACL ARR 2026 March Findings。
- 论文原文
- Beyond Endpoint Performance: Process-Level Evaluation of Self-Evolving Agents(首次提交,2026-09-21 14:28 UTC)
- 核心贡献:提出EvoPathBench,在冻结自演化Agent的记忆或技能等中间产物后,逐个检查能力何时出现、是否保持、是否因后续学习而退化。
- 与已有方法的区别:不只看最终任务分数,而是区分分布外泛化、无关学习后的保持能力和基于新证据的规则适应。
- 关键实验:相似未见任务上的提升在分布变化后经常减弱;保持损失集中在少数演化路径;没有方法实现可靠的规则适应。
- 代码/数据:arXiv页面未提供代码或数据链接,暂未披露。
- 论文原文
- VideoGen-Agent: Reinforcing Video Generation Agents(首次提交,2026-09-21 17:58 UTC)
- 核心贡献:训练多模态Agent协调增强、生成和验证工具,用多轮交互解决身份保持、物理一致性和多镜头结构等视频生成问题。
- 与已有方法的区别:把工具选择和中间观察纳入Agent策略,而不是只升级单一文本生成视频模型。
- 关键实验:在600条VABench提示上,基线得分从56.5升至75.6;更换更强生成工具后升至86.1且无需重新训练Agent;人工偏好率为84.3%。
- 代码/数据:arXiv页面未提供代码或数据链接,暂未披露。
- 论文原文
- GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay(首次提交,2026-09-21 17:59 UTC)
GitHub增星加速榜
口径:以下为GitHub认证快照的精确差值,旧快照为2026-09-19 08:02(北京时间),新快照为2026-09-23 08:01,间隔约95.98小时;因此“增长率”是该快照区间增长率,不是严格24小时增长率。
- God's Eye View
- 项目简介:在浏览器里把公开实时信号放到一个可探索的3D地球上,覆盖飞机、船舶、卫星、地震、交通和公共摄像头,并提供语音Agent控制。它解决的是把分散公开数据变成直观空间界面的问题,面向想快速观察全球事件和开发数据层的用户。
- 为什么受关注:视觉冲击强,且项目README称其曾登上GitHub Trending;近期新增天气、风场、雷达、云图和气旋轨迹,关注度与产品实质更新叠加。
- 近期动态:2026-09-22加入NOAA GFS、ECMWF IFS风场、MRMS雷达、GOES/NESDIS云图、闪电密度和气旋预警;同日更新数据来源与已知问题。天气功能提交
- 新增Stars:+3,477(精确快照差值,约95.98小时)
- 当前Stars:41,295
- 增长率:9.19%
- 仓龄/最近实质提交:约3.0个月 / 2026-09-22。README与数据来源更新
- 许可证:NOASSERTION(GitHub未识别到明确许可证)
- 成熟度/风险:数据源和外部API依赖多,且许可证未明确;适合观察和二次开发前先做数据授权、稳定性和成本核查。
- ECC
- 项目简介:面向Claude Code、Codex、OpenCode、Cursor等编码Agent的工程化增强套件,重点覆盖技能、记忆、性能优化和安全护栏。它试图把“会生成代码”变成可审查、可测试、可持续执行的Agent工作流。
- 为什么受关注:兼容多个主流Harness,且近期提交集中修复危险不可见字符、时序证据传递和破坏性SQL检测,直接踩中Agent安全与可靠性需求。
- 近期动态:2026-09-21修复gateguard对危险不可见Unicode、失败前置步骤和带引号破坏性SQL的检测,并补充回归测试。Unicode安全提交
- 新增Stars:+3,376(精确快照差值,约95.98小时)
- 当前Stars:265,423
- 增长率:1.29%
- 仓龄/最近实质提交:约8.1个月 / 2026-09-21
- 许可证:MIT
- 成熟度/风险:项目规模和测试投入较高,但技能会改变Agent行为;引入前应逐项审查权限、命令执行和更新来源。
- Archify
- 项目简介:把自然语言想法、学习计划、旅行路线或复杂系统转换成可交互、可定制、可分享的HTML视觉图。它面向使用编码Agent制作解释材料、架构图和工作流的人,而不是只输出静态图片。
- 为什么受关注:Agent Skill与可视化交付结合,降低了做交互式架构和流程图的门槛;README还提供画廊和场景指南,便于展示传播。
- 近期动态:2026-09-21迁移网站到Astro并保留视觉一致性;2026-09-22恢复README主视觉并替换品牌预览中的旧Logo。Astro迁移提交
- 新增Stars:+3,091(精确快照差值,约95.98小时)
- 当前Stars:69,891
- 增长率:4.63%
- 仓龄/最近实质提交:约5.3个月 / 2026-09-22
- 许可证:MIT
- 成熟度/风险:当前README标注开发版2.17.0-dev.1,功能迭代快;生成结果的可验证性和长期兼容性仍需项目级锁版本。
- Alibaba OpenCodeReview
- 项目简介:面向团队代码库的混合式代码审查工具,把确定性规则与LLM Agent结合,提供逐行评论、多语言规则以及OpenAI/Anthropic兼容接口。它解决的是把安全、并发、注入等规则检查与自然语言审查放进同一条流水线。
- 为什么受关注:安全代码审查是直接的企业场景,项目同时有Go实现、npm包、跨平台支持和OpenSSF最佳实践标识;近期安全提交增强了凭证命令校验。
- 近期动态:2026-09-22校验api_key_cmd/auth_token_cmd中的可疑Shell模式,并增加明文凭证处理与二进制文件标记;随后补充审查Agent的评论规范。安全提交
- 新增Stars:+3,074(精确快照差值,约95.98小时)
- 当前Stars:39,717
- 增长率:8.39%
- 仓龄/最近实质提交:约4.2个月 / 2026-09-22
- 许可证:Apache-2.0
- 成熟度/风险:增长快且安全功能在补强,但LLM评论仍需人工复核;应单独验证规则覆盖率、误报率和凭证处理边界。
- Matt Pocock Skills
- 项目简介:提供一组面向真实软件工程的可组合Agent技能,强调小而可改、跨模型工作,而不是一次性“氛围编程”脚手架。用户可以通过Claude插件市场或Skills CLI选择性安装,保留对项目流程的控制。
- 为什么受关注:技能标准逐渐成为编码Agent生态的共同扩展层,这个仓库的内容直接对应测试、PR、执行证据等工程环节,传播面覆盖多个Agent。
- 近期动态:2026-09-17更新执行证据描述并移除HTML产物章节,2026-09-18调整PR正文模板以便扫描。PR模板提交
- 新增Stars:+2,566(精确快照差值,约95.98小时)
- 当前Stars:267,830
- 增长率:0.97%
- 仓龄/最近实质提交:约7.6个月 / 2026-09-18
- 许可证:MIT
- 成熟度/风险:内容型仓库更新会直接改变Agent行为,缺少传统软件版本边界;应固定提交版本并建立内部变更审查。
- Ponytail
- 项目简介:通过技能和Hook让编码Agent更少说、少写和少调用,从而降低token消耗并减少无必要的代码。它面向已经在使用Claude Code、Cursor等Agent、希望控制长链成本和噪声的开发者。
- 为什么受关注:把“Agent效率”转译成开发者能感知的代码量、速度和成本,同时覆盖多个Agent并持续发布版本。
- 近期动态:2026-09-14发布v4.10.0,并加入Cursor原生hooks.json支持,补充安装、卸载和兼容性测试。Cursor Hooks提交
- 新增Stars:+2,387(精确快照差值,约95.98小时)
- 当前Stars:144,402
- 增长率:1.68%
- 仓龄/最近实质提交:约3.4个月 / 2026-09-14
- 许可证:MIT
- 成熟度/风险:README中的节省比例主要是项目自测,不能直接外推到所有模型和仓库;Hook对客户端版本敏感。
- Agent-Reach
- 项目简介:为AI Agent提供统一的互联网检索和内容读取入口,覆盖GitHub、YouTube、Reddit、X、B站、小红书等来源,并尽量隐藏各平台接入差异。它面向需要真实网页信息、又不想为每个平台单独维护连接器的开发者。
- 为什么受关注:Agent联网是刚需,项目用CLI和现成渠道降低接入成本;近期新增Boss直聘通道,扩大了求职和招聘信息场景。
- 近期动态:2026-09-15新增Boss直聘岗位搜索与JD全文,并细化CDP浏览器登录态、反爬安全校验和凭证恢复流程。Boss通道提交
- 新增Stars:+1,684(精确快照差值,约95.98小时)
- 当前Stars:84,800
- 增长率:2.03%
- 仓龄/最近实质提交:约6.9个月 / 2026-09-15
- 许可证:MIT
- 成熟度/风险:强依赖第三方网页结构、登录态和反爬策略;“能读到”不等于长期稳定或具备平台授权,生产接入需做降级和合规审查。
- VoiceStudio
- 项目简介:本地优先的语音克隆、声音设计、视频配音、听写、转录和有声书制作工具,支持本地API与MCP供Agent调用。它面向想在自有硬件上完成语音生产、又不想把音频全部交给云服务的个人和团队。
- 为什么受关注:把语音生成与Agent集成从演示推进到桌面工作流,且支持多语言、Docker和多个模型引擎;近期集成修复提高了实际部署可用性。
- 近期动态:2026-09-22修复/mcp路由、端口配置和Codex/通用MCP/API/Docker安装方式,并补充远程HTTPS与API密钥保护逻辑。MCP与集成提交
- 新增Stars:+1,542(精确快照差值,约95.98小时)
- 当前Stars:34,407
- 增长率:4.69%
- 仓龄/最近实质提交:约5.5个月 / 2026-09-22
- 许可证:AGPL-3.0
- 成熟度/风险:本地部署仍受显存、模型下载和后端引擎影响;AGPL会影响闭源集成方式,远程服务与音频数据边界也需单独审查。
今日最值得跟进
- 按完整任务成本重做模型路由表:用同一组真实Agent任务对比GPT-6 Sol/Luna、Claude Opus 5.5和现有模型,记录成功率、总token、延迟、重试次数与人工返工,不要只抄厂商榜单。
- 把双控制和过程级评测加入Agent验收:在工具调用、RAG、记忆更新和权限变更中,分别测试恶意用户、污染数据、失败前置步骤和后续状态漂移。
- 对快速增星项目做“能否进入生产”二次筛选:优先审查许可证、外部数据授权、第三方平台反爬、模型下载成本和更新锁定策略,再决定是否纳入内部工具箱。
建议行动
- 今天先为现有Agent补一张“每任务成本+过程失败点”记录表,并用至少20条真实任务跑一次GPT-6 Sol/Luna与Opus 5.5的A/B对比。
- 从DUMA-Bench的双控制思路抽取3类内部攻击样例,加入CI或发布前回归集;对凭证、Shell和不可见Unicode路径单独设置拒绝测试。
- 对GitHub榜单中的God's Eye View、OpenCodeReview和VoiceStudio先做许可证与外部依赖审查,未通过前只做沙箱试用。