
OpenAI 与 Anthropic 曾接近签署一项涉及相互披露或攻击对方模型安全问题的协议,相关报道将其称为“互黑协议”。目前公开线索使用的是“差点签下”这一表述,尚不能证明协议已经正式生效。真正值得关注的并非这个带有传播性的名称,而是头部模型公司开始探索如何把竞争性压力测试、漏洞披露和安全协作放进同一套规则。
如果这一安排确曾进入签署阶段,它反映的将不是普通商业合作,而是 AI 公司在模型能力快速扩张后,对外部攻击、越权行为和安全事件责任进行制度化管理的一次尝试。
协议接近签署,但是否落地仍没有定论
现有线索来自 9 月 27 日发布的媒体信息,标题明确使用“差点签下”的说法,内容则将协议概括为双方相互披露或攻击对方。这个措辞包含两个重要限定:其一,协议可能讨论过相互测试和暴露问题的机制;其二,双方未必完成了正式签署或公开执行。
因此,“互黑协议”更像是媒体对合作内容的简化称呼,并不等同于双方约定进行无边界攻击。按照 AI 安全领域的通常做法,所谓攻击可能包括受控红队测试、提示词注入测试、越权行为验证、工具调用风险检查,以及对模型在高风险场景下表现的复核。具体条款、授权范围、事件定义和处理时限,官方尚未公布。
从交叉压力测试到安全事件协作
此前相关线索主要指向 OpenAI 与 Anthropic 推进或接近达成模型交叉压力测试安排。此次新增信息的区别在于,它把合作重点进一步指向“安全事件”本身:不只是测试模型能否被攻破,还可能涉及一家公司发现问题后如何通知另一家公司、谁负责复现、哪些漏洞需要公开,以及是否允许对对方系统进行主动验证。
这类机制的价值在于弥补企业自测的盲区。模型开发方通常最熟悉自己的训练流程和防护策略,但也可能因为内部假设固定而忽略外部攻击者能够采用的路径。竞争对手拥有不同的模型架构、产品形态和安全经验,交叉测试有机会发现更难被内部团队识别的缺陷。
不过,交叉测试并不天然等于安全。没有明确授权时,主动攻击可能触及服务条款、隐私保护和计算资源边界;测试过程中如果接触用户数据,还会引入新的泄露风险。协议若未能清晰界定测试环境、数据隔离、证据留存和漏洞披露流程,合作本身可能成为新的风险源。
“互黑”机制的行业影响:竞争被纳入安全框架
第一,AI 安全竞争可能从发布前评测扩展到发布后的持续对抗。模型上线后会接触更多真实用户、第三方工具和复杂任务,单次安全审查很难覆盖全部风险。若企业之间建立受控的交叉测试,模型缺陷就有机会在大规模滥用前被发现。
第二,安全信息共享的边界将成为关键。公司既希望及时获知对手发现的漏洞,又不愿暴露内部架构、产品弱点或商业机密。一个可执行的安排,必须区分可共享的风险证据、需要保密的技术细节,以及涉及公共安全时必须披露的事件。若没有独立审查或共同认可的标准,任何一方都可能把“安全测试”理解为竞争性情报收集。
第三,这种合作可能影响未来的行业规范。当前线索并未说明协议是否签署、是否执行,也没有公布参与机构、测试范围或发现事件数量。因此,不能据此判断行业已经形成通行标准。但如果类似安排被正式确认,监管机构和企业客户可能会进一步要求模型供应商说明红队测试记录、重大事件通报机制和第三方验证结果。
我的观察:关键不在“互黑”,而在可验证的规则
把这类安排称为“互黑协议”有助于突出其对抗性,但也容易掩盖安全合作最需要的程序细节。真正决定效果的,不是双方是否允许彼此“攻击”,而是攻击是否在明确授权、隔离环境和可审计流程内完成。
至少有四类问题需要得到回答:测试者能访问哪些接口,是否可以接触真实用户数据;发现漏洞后多长时间内必须通知对方;争议事件由谁判断严重程度;测试结果是否需要向监管机构、客户或公众披露。若这些问题没有公开答案,外界只能把该报道视为未被官方文件确认的行业线索。
此外,安全协议不能替代企业自身的责任。即使存在交叉测试,模型供应商仍需对训练、部署、权限管理和事故响应承担主要义务。把安全风险转交给竞争对手发现,既不能免除产品方责任,也不能成为延迟修复或弱化透明度的理由。
后续应关注哪些信息
- OpenAI 或 Anthropic 是否发布正式公告、协议文本或安全报告,确认协议是否签署及其实际状态。
- 双方是否公布交叉压力测试的范围,包括模型、产品接口、工具调用和数据隔离要求。
- “安全事件”的定义是否覆盖越权操作、隐私泄露、提示词注入和模型滥用,还是仅限于特定测试场景。
- 是否存在第三方监督、统一严重性评级和公开披露机制,以避免“互黑”沦为缺乏边界的竞争行为。
信息来源
本文依据 cnBeta.COM 于 2026 年 9 月 27 日发布的《OpenAI 和 Anthropic 差点签下“互黑协议”》相关线索整理,并结合同日关于两家公司调查 AI 相关安全事件、推进模型交叉压力测试的公开报道进行分析。现有材料未提供协议原文,OpenAI 与 Anthropic 是否正式签署、协议具体条款及执行结果,均以双方后续官方公告或原始文件为准。