
Anthropic 被曝开展最新递归自我改进(RSI)实验,媒体报道称,Claude 在特定测试中击败了人类研究员,相关训练效率超过后者 1.5 万倍。这个结果如果经原始材料证实,意味着大模型正在从“执行研究任务”走向“参与改进研究流程”;但目前公开线索没有交代任务定义、实验规模、评价标准和效率计算方法,因而不能把标题中的“击败”直接等同于全面超越人类科研能力。
一项结果亮眼、细节仍不完整的实验
现有新闻线索显示,Anthropic 近期开展了 RSI 实验,核心比较对象是 Claude 与人类研究员,报道给出的两个结论分别是模型在实验任务中取得更好成绩,以及训练效率超过人类研究员 1.5 万倍。这里的“RSI”通常指递归自我改进,即系统利用自身能力改写、优化或辅助生成下一轮改进方案。
不过,线索并未提供 Anthropic 官方论文、技术报告或完整实验记录,也没有说明“研究员”承担的是算法设计、代码实现、实验调参,还是某一项受限的自动化任务。因此,“击败人类研究员”目前只能作为媒体对实验结果的概括,不能扩展解释为 Claude 已经在全部 AI 研究工作中超过人类。
真正关键的是比较口径,而不是单一胜负
这类实验最需要核对的是评价边界。一个模型可能在重复性代码搜索、参数试验或既定目标优化上明显快于人类,但这并不自动意味着它能独立提出有价值的问题、判断异常结果、选择长期研究方向,并对结论承担责任。若实验只测量某个封闭任务中的有效方案数量或单位时间产出,结论的适用范围就应限定在该任务内。
“超过 1.5 万倍”的效率数字同样需要明确分母和计算周期。它可能比较的是模型并行运行的尝试次数与单名研究员的实际操作时间,也可能只统计成功找到方案所需的机器时间;如果没有硬件配置、人工介入比例、失败尝试、成本和重复实验结果,这个倍数不能直接用来推导整体科研生产率,更不能据此判断 AI 研究已经实现普遍意义上的自我进化。
对 AI 研究流程的影响可能先于“完全自主研究”
即使最终数字需要收窄,RSI 实验仍然把一个重要问题推到台前:大模型是否能够承担研究流程中大量可验证、可迭代的中间环节。包括阅读已有代码、提出修改建议、运行实验、整理结果和生成下一轮候选方案在内的工作,本来就适合被拆分为机器可执行的步骤。模型一旦能够稳定完成这些环节,研究团队的瓶颈就可能从“写出一个方案”转向“设计可靠的评价机制”。
这也会改变模型竞争的衡量方式。过去常用的公开基准主要比较回答质量或任务准确率,而 RSI 类实验关注的是模型能否改善工具链、缩短试错周期,并在多轮迭代中保持结果质量。对开发者而言,自动化实验代理的价值不只在于生成代码,还在于能否留下完整日志、复现实验并主动暴露失败原因。
我的观察:效率提升越快,验证成本越重要
基于现有线索,至少可以提出两个相对明确的判断。第一,AI 研究自动化的竞争焦点正在从单轮能力转向闭环能力:模型不仅要给出答案,还要提出假设、执行验证、比较结果,再决定是否继续迭代。第二,模型“能改进什么”与“是否应该改进”必须分开评估。前者是工程效率问题,后者涉及目标设定、风险边界和人类监督。
如果模型可以在很短时间内生成成千上万种实验方案,未经筛选的搜索空间也会同步膨胀。错误指标、数据污染、代码漏洞或对代理目标的过度优化,都可能让系统在数字上取得进步,却偏离真实研究目的。因此,未来评价 RSI 系统不能只看最高分,还应考察结果稳定性、跨任务迁移、人工复核成本、失败率和是否能被独立团队复现。
后续需要核对哪些信息
- Anthropic 是否发布正式论文、技术报告或实验代码,以及实验使用的具体 Claude 版本。
- “击败人类研究员”对应的任务、基线人员数量、专业背景、时间限制和统计显著性。
- “超过 1.5 万倍”究竟衡量尝试速度、训练时间、成本,还是达到目标所需的总工作量。
- 实验中人类是否参与任务拆解、提示设计、结果筛选和最终决策;这些人工环节是否被计入效率。
- 模型生成的改进是否经过独立复核,能否在不同数据、代码库和研究团队中重复出现。
信息来源与核验说明
本文依据新浪财经及其手机端在 2026 年 8 月 29 日发布的相关新闻线索整理,线索标题提及“Anthropic 最新 RSI 实验”“Claude 击败人类研究员”及“训练效率超 1.5 万倍”。截至本文撰写时,所提供材料未包含 Anthropic 原始论文、完整实验数据或官方公告。文中对实验结论均采用“媒体报道称”或条件性表述,具体数字、评价口径和最终结论应以 Anthropic 发布的原始资料及独立复现实验为准。