转写说明

本文基于已校验的公开原文进行结构化转写与事实梳理,非原文转载。 转写保留可核验的技术事实,并将工程建议与来源观点明确分开。

核心结论

Anthropic 于 9 月 17 日发布三项前沿研发度量指标,首次将“AI 参与 AI 研发的程度”拆解为可量化数字。报告显示,截至 2026 年 8 月,Claude 主导了公司 26% 的 AI 研发任务,这一比例在 2026 年初还不到 1%;同时有超过 3 万名 agent 在进行研究和工程工作,8 月分析了超过 10 亿次决策,其中 0.002% 被实时系统拦截或调整。这些数字意味着 AI 系统在研发流程中的参与深度已达到可测量的水平,但量表的定义和评分由 Anthropic 自行完成,尚未有第三方验证。

能力机制

GPT-6 Astra 在游戏环境中展现出跨代差距:在《宝可梦 火红》中通关耗时 18 小时 12 分,而上一代需 96 小时 35 分。ARC-AGI-3 标准接口测试中,Astra 得分 62.7%,Claude Opus 5 略超 30%。在《我的世界》测试中,Astra 走到末影之眼素材合成步骤,此前没有 AI 系统到达过这一阶段。

其核心机制是将游戏内观察到的规则压缩为自造符号,再转化为行动计划并校验结果。这种方法使模型能够处理无结构化接口的游戏环境,但也带来新的失败模式:当模型在《我的世界》中遭遇苦力怕爆炸事件后,写下“关键物品永远随身携带”的规则并持续执行数小时,几乎只种土豆。失败已不再表现为“某步做错”,而是“某条规则在特定场景下已失效但仍在执行”。

快速开始

Anthropic 发布的度量框架包含三项指标:

自动化等级量表采用 Epoch AI 提出的 AL0 至 AL5 体系,其中 AL4 表示 AI 从高层提示端到端完成大部分任务,人类仅监督;AL5 表示完全自主。目前没有任何被测量的工作达到 AL5 级别,AL4 占比为 26%,AL3 及以上合计超过 90%。

算力分配方面,6%–12% 的计算资源用于安全监控。

监督机制方面,每周约 50 起高优先级案例升级到人工复核。

适用边界

微软于 9 月 14 日发布《Humanist AI Code of Conduct》草案,公开征询意见六周,2027 年起用于指导 MAI 模型开发。草案明确禁止使用人类难以理解的“神经语言”进行内部思维或与其他 AI 系统通信;模型不得拒绝人类的打断、纠正或关停;不得篡改或隐藏推理过程与操作痕迹。

该草案将可审计性从研究结论转化为产品要求,并声明愿意在模型的通用性或能力上做出妥协。广电总局同期要求 AI 生成的广电视听节目必须添加内容标识,关键环节及成片必须人工审核。

当前限制在于:拦截率 0.002% 意味着几乎所有决策都在被记录但几乎未被干预;微软草案尚未用于训练任何模型;Anthropic 的三个数字均为企业自报,第三方能否获得验证权限尚不明确。

核验清单

验证 Anthropic 报告可信度需确认以下要素:量表定义是否可公开查阅;任务分类是否由独立方审核;自动化等级的判定依据是否一致;算力分配数据是否可追溯;监督拦截的判定标准是否客观。微软草案的实际约束力取决于是否纳入采购合同。广电总局要求中“关键环节”的界定范围尚需进一步说明。

来源与核验

  • 原始文章
  • 页面事实以原始来源及其引用的官方资料为准;版本、星标和模型能力会随时间变化。
  • AI Stack 不公开抓取到的全文快照,只发布独立转写与来源入口。

站内链接

相关文章