
OpenAI 与 Anthropic 之间的模型安全合作,可能正在从意向讨论进入协议落地阶段。9 月 21 日至 22 日,多家媒体集中报道双方拟相互开展 AI 模型压力测试,利用对方的测试能力寻找潜在漏洞和安全风险;其中一则报道进一步称,双方已经达成相关协议。不过,现有消息对协议状态的描述并不一致,协议文本、测试范围、执行时间和官方确认均尚未公开。
这件事的核心并不是两家竞争公司短暂“握手”,而是模型安全评估是否会出现一种新的组织方式:让最熟悉前沿模型能力、同时也最有动力寻找其缺陷的同行,参与到彼此的测试流程中。
从“讨论互测”到“协议达成”,报道出现关键信息差
目前公开线索大致形成三种表述。华尔街见闻、新浪财经及相关转述称,OpenAI 与 Anthropic 正在讨论或曾接近达成相互压力测试的安排;cnBeta 等报道则使用“接近达成协议”的说法;Investing.com 的标题进一步称,双方已经就相互测试 AI 模型达成协议。
这些说法不能被直接视为同一强度的事实。它们可能对应谈判阶段、原则性共识和正式签署三个不同节点,也可能只是不同媒体对同一消息源的概括差异。 截至目前,公开信息没有提供双方正式公告、协议全文或可核验的执行细节,因此“已经达成”仍应视为媒体报道,而非官方确认。
已知的合作方向较为明确:双方希望借助对方的安全测试能力,发现模型在特定使用场景下可能暴露的漏洞或风险。至于测试对象是研究版本、内部版本还是面向用户的产品,报道没有给出足够信息。
为什么竞争对手互测模型值得重视
第一,交叉测试有机会减少“自己给自己出题”的局限。模型开发者通常掌握内部评测方法、训练目标和已知缺陷,但内部团队也可能受限于既有假设。竞争对手拥有不同的模型架构、产品经验和攻击思路,可能更容易发现原团队未覆盖的失效路径。
第二,这种合作可能改变安全评估的可信度。企业自行发布安全报告时,外部读者往往难以判断测试集合、提示词设计和失败样本是否完整。若双方能够在不泄露模型权重、用户数据和商业机密的前提下,建立可重复的交叉测试流程,外界至少能够获得比单方声明更强的验证依据。
但“同行测试”并不自动等于独立审计。两家公司仍然是商业竞争者,双方如何定义测试边界、如何处理敏感漏洞、谁来保管测试记录,以及发现问题后是否公开,都可能影响结果的可信度。合作如果缺乏第三方监督或统一记录标准,最终可能只是一次封闭式技术交流。
行业影响首先体现在安全评测规则
如果协议最终落地,最直接的影响将是模型安全工作从企业内部流程,进一步扩展为跨公司协作。未来模型发布前的检查,可能不再只看性能指标和内部红队结果,也会增加来自外部模型团队的攻击测试、复核意见和风险分级。
这对行业有两个独立影响。其一,安全能力可能成为模型竞争的一部分:公司不仅要证明模型“能做什么”,还要说明模型在对手测试下“容易在哪里失效”。其二,安全信息共享的边界会变得更加重要。过于详细的漏洞披露可能增加滥用风险,过于保守则会削弱外部监督,协议需要在保密和可验证性之间建立明确机制。
需要注意的是,现有报道并未给出测试结果,也没有证据表明双方已经发现了某类具体漏洞。因此,不能把这项合作直接解读为某一模型存在已被证实的重大安全问题。
我的观察:合作价值取决于“怎么测”而非“是否互测”
这件事最值得观察的不是协议是否被冠以“历史性”名称,而是双方能否公开足够多的方法论。一个有实际价值的交叉测试机制,至少应说明测试范围、风险分类、复测流程和问题处置原则,同时避免披露可被直接滥用的攻击细节。
我的第一个判断是,竞争对手互测能够补足内部评估,但无法替代真正独立的第三方审计。双方存在商业利益关联,测试结果的选择性发布、问题严重程度的判断以及发布节奏,都可能受到竞争关系影响。
第二个判断是,协议若仅停留在一次性测试,行业价值会比较有限。模型会持续更新,安全风险也会随工具调用、代理能力和部署环境变化。只有形成周期性复测、版本留痕和可追溯报告,交叉测试才可能成为稳定的治理基础设施。
后续应关注哪些公开信息
- OpenAI 或 Anthropic 是否发布正式公告,确认协议是否已经签署。
- 测试覆盖哪些模型、版本和应用场景,是否包含面向用户的产品。
- 双方是否会引入独立第三方,或公布统一的测试标准与复核流程。
- 发现高风险问题后,漏洞披露、修复和责任认定由谁负责。
- 协议是否会扩展至更多模型公司,形成行业范围的安全评估机制。
信息来源与核验说明
本文依据 2026 年 9 月 21 日至 22 日公开出现的媒体报道整理,包括华尔街见闻、cnBeta、新浪财经、微博、TradingView 和 Investing.com 等来源。不同来源对协议状态的表述存在差异,部分报道称双方正在讨论或接近达成,另有报道称双方已经达成协议。OpenAI 与 Anthropic 的正式协议文本、测试范围、执行安排及官方确认信息,截至发稿时尚未见公开披露,相关结论应以两家公司后续公告或原始文件为准。