
英国 AI 实验室 Inherent 发布了名为 Faraday 的 AI 代理,并将其定位为协助复现科学研究的“AI 队友”。这家公司由 DeepMind 校友创办,称 Faraday 在科研论文复现能力测试中超过 Anthropic 和 OpenAI 的相关系统。消息的关键不在于又出现一个聊天机器人,而在于 AI 产品开始把目标延伸到代码运行、实验环境搭建、结果核验和研究流程复现。不过,截至目前,公开信息尚未披露这项比较的完整方法、评测样本、具体分数或独立验证结果,因此“超过”仍应被视为公司的测试结论,而不是已经被行业普遍确认的事实。
Inherent 把 Faraday 定位为科研执行型代理
传统大模型主要通过生成文字、代码或分析意见帮助研究人员,而科研复现要求系统完成更长的任务链:理解论文中的方法,识别数据和依赖项,配置运行环境,执行代码,定位报错,比较输出结果,并判断实验是否与原论文一致。任何一个环节出错,都可能导致最终结论无法复现。
Faraday 的产品定位正是切入这一流程。Inherent 没有把它描述成单纯的论文问答工具,而是强调“队友”角色,意味着系统需要承担一定的执行和排错工作。对科研用户而言,这种能力的价值在于减少重复性工程操作,把更多时间留给假设设计、实验选择和结果解释。
“超过 Anthropic 和 OpenAI”需要更多证据支撑
Inherent 称 Faraday 在复现科学论文的测试中超过 Anthropic 和 OpenAI 相关系统,但目前线索没有给出测试使用的论文类型、任务难度、成功标准以及对比系统的具体版本。科研复现并不存在一个简单统一的“成功”定义:完整跑通代码、获得近似结果、复现核心结论,或解释无法复现的原因,都可能对应不同评价等级。
因此,这一性能说法有两个需要区分的层次。第一,它说明 Inherent 已经把 Faraday 置于与头部通用模型竞争的产品叙事中;第二,它还不足以证明 Faraday 在所有科研领域、所有论文或真实研究场景中都更可靠。只有公开测试协议、原始结果和可重复实验,外部开发者才能判断比较是否公平。官方尚未公布价格、开放范围以及完整基准数据,这些信息也将直接影响产品的实际采用。
科研自动化的竞争重点正在从生成转向验证
如果 Faraday 能够稳定完成论文复现,它面对的竞争就不只是模型参数规模,而是代理系统的整体工程能力。科研任务通常依赖特定软件版本、数据集、硬件资源和领域知识,代理需要具备长期记忆、工具调用、错误恢复和过程记录能力。相比一次性生成答案,这类系统更容易通过实际任务结果接受检验。
这也会改变科研 AI 的产品评价方式。用户可能更关心代理能否给出可复现的运行环境、保留每一步操作日志、标注使用的数据和依赖、解释结果偏差,并让研究人员接管关键决策。若系统只报告“实验成功”,却无法提供完整过程,科研机构仍难以将其纳入正式研究流程。
Inherent 面临的关键挑战不是单次跑通实验
我的判断是,Faraday 最有价值的差异化方向在于把 AI 能力嵌入科研工作流,而不是再提供一个更会写论文摘要的模型。但科研复现的难点往往集中在隐性条件:论文描述不完整、数据无法获取、代码存在历史依赖、实验结果具有随机性,甚至原始研究本身就难以稳定重现。代理能否识别这些限制,并诚实区分“成功复现”“部分复现”和“无法判断”,比单纯提高一次测试的成功率更重要。
此外,科研自动化涉及数据许可、代码安全和实验责任。允许代理自动执行外部代码,可能带来依赖包风险和数据泄露问题;在生物、化学等领域,自动化实验还需要更严格的权限控制。Inherent 若要从演示走向科研机构采购,必须说明隔离环境、审计记录、人工审批和敏感数据处理机制。
后续应观察哪些公开信息
- Inherent 是否公布 Faraday 测试的论文清单、任务定义、评分规则和基线系统版本。
- 测试结果能否由独立研究者复跑,是否覆盖机器学习之外的不同学科。
- Faraday 是否开放申请、提供 API 或发布价格,以及运行所需的计算资源和数据条件。
- 产品能否输出完整实验轨迹、失败原因和可审计记录,而不只是最终结论。
在这些信息出现之前,Faraday 更适合被理解为科研代理赛道中的一次重要产品发布和性能主张,而不是已经确立的行业标准。它所提出的方向值得关注,但结论仍需通过透明评测和真实用户案例检验。
信息来源
本文主要依据 TechCrunch 于 2026 年 8 月 22 日发布的报道《Inherent, founded by DeepMind alumni, says its AI‘teammate’just outperformed Anthropic and OpenAI at replicating research》整理。原文链接:https://techcrunch.com/2026/08/22/inherent-founded-by-deepmind-alumni-says-its-ai-teammate-just-outperformed-anthropic-and-openai-at-replicating-research/。关于测试细节、价格、开放范围及独立验证,以上公开线索未提供,具体信息以 Inherent 后续官方资料为准。