
An Anthropic researcher just gave us a peek at self-improving AI
Given 10 benchmarks for specific misaligned behaviors, the automated systems were able to improve performance on every single one without degrading overall performance.
- 先核对来源和时间
- 把试用限制在可回滚范围
- 对缺少独立证据的结论保持观望
事件时间线
- 1事件时间线
- 2关键机制
- 3真实使用场景
- 4限制与复核
发生了什么
2026 年 8 月 28 日,Anthropic 发布了一篇题为《Automated Researchers Can Reliably Mitigate Alignment Failures》的论文。这项工作由 Anthropic 研究员项目成员 Chen Yueh-Han 主导,介绍了一个名为 Automated Alignment Researcher 的系统,简称为 AAR。
AAR 的核心流程是先从已有文献中检索相关资料,再据此提出具体的改进方法。每次训练仅持续约 30 分钟,并在多轮迭代中逐步提升基准成绩。在针对特定失调行为的 10 项基准测试中,AAR 全部带来了模型表现的提升。
论文指出,AAR 提出的最佳方法平均在 6 小时内就能超过有经验的人类所制定的方案,并且明确表示,由人类引导研究方向并未带来更强的表现。换言之,给系统划定方向并不比让它自主检索更有效。论文同时认为,自动化对齐后训练在近期可能变得真正实用。
在运行成本上,AAR 主要产生 API 推理费用,约为每小时 4 美元,而人类研究员的人工成本约为每小时 150 美元,自动化方案在单位时间开销上明显更低。
需要注意的是,AAR 仅在基准能反映真实对齐目标时有效,而如何建立并维护这些基准,以及供其检索的文献,都仍需大量后续工作。
时间线与证据
报道发布与论文公开发生在同一天,即 2026 年 8 月 28 日,TechCrunch 在当日发表报道,Anthropic 也在当日将论文《Automated Researchers Can Reliably Mitigate Alignment Failures》对外发布。论文的主导者为 Anthropic 研究员项目成员 Chen Yueh-Han,介绍的系统被命名为 Automated Alignment Researcher,简称 AAR。
从公开材料来看,论文给出的流程描述本身构成一条可追溯的内部时间线:AAR 先在文献库中检索已有研究,再基于检索结果生成具体方法,接着启动一次约 30 分钟的训练,并在多轮迭代中不断重复这一循环,使基准成绩逐步上升。
可被直接引用的表现证据集中在两点。一是覆盖范围,在 10 项针对特定失调行为的基准测试中,AAR 的方法均带来了模型表现的提升,没有出现倒退或持平的条目。二是与人类的对比,论文明确写到 AAR 提出的最佳方法平均在 6 小时内即可超过有经验的人类所给出的方案,并指出由人类指引研究方向并不会带来更强的结果。
经济层面的证据来自论文给出的成本数字。AAR 主要产生 API 推理费用,约每小时 4 美元;人类研究员的人工成本约每小时 150 美元,两者按小时计相差数十倍。论文还据此判断,自动化对齐后训练在近期有可能真正投入实用。
具体变化
在已建立的 10 项针对特定失调行为的基准上,AAR 的方法并非平均提升,而是逐项均带来改进,这一覆盖范围本身被论文作为可靠性证据反复提及。配合该结果,论文进一步给出了速度对照:AAR 的最佳方法平均在 6 小时内即可超越有经验人类提出的方案,意味着在小时级别的时间窗口里,自动化迭代就能产出可与人类工作相比较的改进。
与速度证据并列的是成本结构。AAR 的一次完整训练仅约 30 分钟,单次运行的 API 推理费用约每小时 4 美元;按此估算,一轮迭代的边际开销很低,多轮迭代累计仍远低于人类研究员按小时计费的成本。后者的人工成本被论文列为约每小时 150 美元,两类开销以同一时间单位衡量相差数十倍,这正是论文判断自动化对齐后训练近期有望实用所依据的经济基础。
除结果与开销外,论文还包含一条与流程直接相关的方向性发现:在 AAR 检索文献、提出方法、自行迭代的工作循环之外,由人类额外指定研究方向并不能带来更强的表现。换言之,引入人类引导并未在基准成绩上转化为可见增益,这一结论与 6 小时内超越人类方案的速度证据共同指向同一现象——在当前设定下,自动化循环本身已能完成从检索到改进的闭环。

对使用者的影响
对使用普通使用者而言,这项工作的意义并不在于 AAR 本身会被个人直接调用,而在于它所描述的成本结构正在改变安全研究的经济门槛。论文把自动化系统的开销锁定在每小时约 4 美元的 API 推理费用上,而人类研究员按小时计的人工成本约 150 美元,两者相差数十倍。这意味着把一部分原本依赖人工的失调排查任务交给自动化流水线,单位时间投入显著下降,迭代频次可以提高,研究节奏不再受制于资深人员的工时。
对开发基于大模型的产品的团队来说,这种落差直接转化为可重新分配的预算。原本用于支付安全审核人力的资金,可以在同一周期内支撑更多轮自动化实验,从而更快定位并修复特定失调行为。在 10 项针对特定失调行为的基准上,AAR 的方法逐项提升,这一覆盖范围意味着自动化循环在多种已知问题上已具备稳定改进能力,而不是仅在个别场景中偶然奏效。
使用者也需要注意其边界。论文明确写到 AAR 仅在基准能反映真实对齐目标时有效,而基准的建立、维护以及供系统检索的文献,都仍需大量后续工作。换言之,自动化降低了执行成本,但并未取消人类在目标设定与判据维护上的责任。
限制与未知
现有材料对 AAR 的能力给出了清晰的边界条件。论文原文把 AAR 的有效性直接挂钩于基准能否反映真实对齐目标,也就是说,10 项针对特定失调行为的基准上逐项提升这一成绩,只能在这些基准本身与目标高度吻合的前提下被解读为可靠性。一旦基准与真实目标出现偏差,自动化迭代的结果也就失去了评判价值。
材料同时点出了两条尚未解决的工作。基准本身需要被持续建立并维护,而 AAR 在检索阶段所依赖的文献库也需要不断扩充。这两项任务并未被 AAR 的自动化循环所覆盖,仍属于需要人类投入的环节,因此论文才把后续工作作为单独的限制项列出,而不是将其并入 AAR 的能力范围。
材料的另一处未知在于方向引导。在 AAR 自主检索、提出方法、迭代训练的工作流程之外,由人类额外指定研究方向并未带来更强表现,这一结论被论文以明确措辞给出。但材料并未进一步说明,在更长的时间尺度、更复杂的失调类型,或基准之外的真实场景中,自动化循环是否依然保持同等的相对优势。换言之,6 小时平均超越人类方案这一速度证据,与人类引导无法提升表现这一方向性证据,目前都被限定在论文所采用的设定之内,外推范围仍属未知。
此外,材料也未提供 AAR 在多次长时间运行后的稳定性数据,也未说明在 API 推理费用之外是否存在其他隐性开销,例如人工复核结果、文献整理或基准更新的投入。这些缺口与前文提到的基准与文献维护一道,构成了论文自我标注的全部未知项。
如何核对
要核对这篇报道中的关键数字,最直接的入口是 Anthropic 在 2026 年 8 月 28 日发布的论文原文《Automated Researchers Can Reliably Mitigate Alignment Failures》,其中关于 AAR 的流程描述、10 项基准逐项提升的结果、6 小时平均超越人类方案的速度判断,以及每小时约 4 美元 API 推理费用与每小时约 150 美元人工成本的对照,都应以原文表述为准。
核对时可以按两条线推进。一条是流程与结果线,确认 AAR 是否确实被描述为先检索文献、再提出方法,并以每次约 30 分钟训练在多轮迭代中逐步推高基准;同时核对 10 项针对特定失调行为的基准是否被原文明确为全部提升,以及“平均在 6 小时内即可超过有经验的人类方案”这一句是否以原文措辞出现,而不是被改写为更模糊的表述。另一条是经济线,原文给出的 API 推理费用约每小时 4 美元、人类研究员成本约每小时 150 美元应逐字比对,并确认这两项数字位于同一时间单位下,避免把单次训练开销误读为整轮迭代开销。
方向性结论同样需要回到原文核对。论文称由人类引导研究方向并不能带来更强的表现,这一表述与前面 6 小时速度证据并列出现,核对时应确认两者出自同一节,并留意原文是否对该结论附加了限定条件,例如是否仅针对论文采用的基准与文献范围。主导者身份也需要单独确认,原文署名的项目成员为 Chen Yueh-Han,核对时应留意其所属部门是否为 Anthropic 研究员项目,避免与公司其他研究岗位混淆。
报道层面,TechCrunch 在 2026 年 8 月 28 日发表的稿件可作为时间锚点,用于确认论文与报道是否同日公开,并对论文标题、作者署名、系统简称 AAR 等基础信息进行二次比对。
读者能做什么
在已经建立的 10 项针对特定失调行为的基准上,AAR 的方法逐项都带来了改进,没有出现持平或倒退的条目,这一覆盖范围本身被论文作为可靠性的直接证据。把这一事实与速度证据放在一起看,论文原文称 AAR 的最佳方法平均在 6 小时内即可超过有经验的人类所提出的方案。也就是说,在小时级别的时间窗口内,自动化循环就能产出可与人类工作相比较的改进,不必等待数日或更长的人工研究周期。
经济层面的事实同样来自论文原文给出的数字。AAR 一次完整训练约 30 分钟,运行主要产生 API 推理费用,约每小时 4 美元;人类研究员的人工成本被列为约每小时 150 美元,两者以同一时间单位衡量相差数十倍。论文据此判断,自动化对齐后训练在近期有可能真正投入实用。
在自主检索、提出方法、迭代训练的工作流程之外,由人类额外指定研究方向并不能带来更强的表现。这一结论与 6 小时内超越人类方案的速度证据一同出自原文,共同指向同一现象:在当前设定下,自动化循环本身已经可以完成从文献检索到方法改进的闭环。
论文同时明确写到 AAR 仅在基准能反映真实对齐目标时有效,而基准的建立与维护、供 AAR 检索的文献库的扩充,都仍需大量后续工作。自动化降低了执行成本,但目标设定与判据维护这两类工作并未被自动化循环所覆盖。
后续观察
读者在阅读这篇报道时,可以直接对照原文核实关键数字与表述。Anthropic 在 2026 年 8 月 28 日发布的论文《Automated Researchers Can Reliably Mitigate Alignment Failures》是首要依据,文中关于 AAR 的流程、10 项基准的表现、6 小时速度判断以及每小时约 4 美元与每小时约 150 美元的成本对照,都应以原文措辞为准,避免被改写成更模糊的版本。系统主导者署名为 Anthropic 研究员项目成员 Chen Yueh-Han,核对时可顺便确认其所属部门,避免与其他岗位混淆。报道层面,TechCrunch 同日发布的稿件可作为时间锚点,用来确认论文与公开报道是否同步。
读者在引用论文给出的经济数字时,应留意其单位口径。AAR 的 API 推理费用约每小时 4 美元,与人类研究员约每小时 150 美元的对比位于同一时间单位下,差距按此口径计算约为数十倍。该结论的成立有赖于“近期”这一时间限定,原文并未承诺这一经济优势在更长周期或更大规模下仍然维持,读者在向外转述时应保留这一边界。
读者还可把论文里的方向性结论放回同一节一起阅读。原文称由人类引导的研究方向并不能带来更强的表现,这与 6 小时速度证据并列出现,两者目前都被限定在论文所采用的 10 项基准与所检索文献范围内。一旦基准扩展或文献库变化,这一相对优势是否仍然成立,原文并未给出保证,读者在据此做判断时应把适用范围一并写明。
参考来源
本文由 AI X Tool 基于公开资料研究后原创整理,发布日期与产品信息可能变化,请以来源网站最新内容为准。