OpenAI与Anthropic拟相互压力测试,模型安全合作再进一步

浏览:1次阅读
没有评论

OpenAI与Anthropic拟相互压力测试,模型安全合作再进一步插图

OpenAI 与 Anthropic 被多家媒体曝出拟相互开展 AI 模型压力测试,借助对方的测试能力寻找潜在安全漏洞与失效风险。报道对协议状态的描述并不一致,有的称双方接近达成,有的称协议已经达成,也有报道称相关安排此前曾接近落地;截至目前,两家公司尚未公开确认协议文本、测试范围或执行时间表。真正值得关注的,不是一次尚未完全落地的企业合作,而是前沿模型安全评估可能从内部自测转向竞争对手之间的交叉检验。

协议状态仍有差异,核心安排指向交叉测试

现有线索均指向同一件事:OpenAI 和 Anthropic 讨论让一家公司测试另一家公司的 AI 模型,重点在于发现模型在特定攻击、复杂任务或异常使用条件下可能暴露的安全问题。多家媒体的报道均援引 The Information,但对合作是否已经正式达成、是否仍停留在谈判阶段,表述并不统一。

因此,现阶段更稳妥的判断是:双方存在相互压力测试的明确讨论或合作线索,但公开信息不足以证明一份完整、可执行的协议已经生效。测试对象是哪些模型、是否包括面向公众的产品、双方能接触到哪些接口和系统权限,以及漏洞发现后如何披露,官方尚未公布。

为什么竞争对手测试可能比内部评估更有价值

模型开发商通常会进行红队测试、基准评估和上线前安全审查,但内部团队不可避免地受限于既有测试框架、产品假设和风险认知。竞争对手则可能采用不同的攻击路径,专门寻找原团队没有覆盖的薄弱环节。交叉测试的价值,首先在于增加测试视角,而不是简单增加测试次数。

第二个价值在于形成更接近真实竞争环境的检验。两家公司都在开发能力更强、工具调用范围更广的模型,模型风险往往不只来自单轮回答,也可能出现在多步骤任务、工具调用、权限边界和复杂提示组合中。若测试能够覆盖这些环节,发现的问题将更接近实际部署中的失效风险。

但交叉测试并不天然等于独立审计。测试方与被测试方仍可能存在商业利益关系,双方如何定义漏洞严重程度、是否共享完整测试记录、如何处理尚未修复的问题,都会影响结果的可信度。若缺少透明的规则和留痕机制,合作可能只是一次封闭式的同行评估,外界仍难以判断模型安全水平是否真正改善。

行业影响不在于“互测”本身,而在于能否形成标准

如果合作最终落地,最直接的影响是两家公司可能获得一组不同于内部评估的漏洞样本和失效案例。这些案例有助于改进拒答策略、系统防护、工具权限控制和上线前测试流程,但具体收益取决于测试是否覆盖模型本体、产品系统以及外部工具链,而不是只检查聊天回答。

更深层的影响是安全评估可能出现从“企业自证”向“同行交叉验证”转变的趋势。前沿模型公司之间的竞争通常围绕能力、速度和商业客户展开,若安全测试也能建立相对固定的交换规则,行业或许可以积累更可比的风险分类、测试场景和修复验证方法。不过,这并不意味着企业间互测能够替代第三方评估、监管审查或公开的安全披露。

另一个现实问题是保密与透明之间的平衡。漏洞报告可能涉及模型能力、系统提示词、滥用路径或尚未公开的产品信息。过度公开会增加被滥用风险,过度保密则会让用户和研究机构无法判断风险是否被认真处理。协议若要具有行业示范性,至少需要说明测试边界、漏洞分级、复测流程和披露原则。

我的观察:安全合作正在从宣示性承诺走向可验证机制

这条消息最值得重视的部分,是两家直接竞争的模型公司被曝考虑把对方纳入安全检验链条。过去,模型安全合作容易停留在原则声明或框架承诺层面;相互压力测试则更接近可执行的工程机制,前提是测试结果能够被记录、复现并推动修复。

但目前不宜把这一线索表述为已经建立了行业通行机制。报道之间的状态差异说明,合作本身可能仍在讨论、调整或等待正式确认。没有公开协议和结果之前,外界无法判断它是一次有限范围的技术交流,还是包括持续测试、漏洞共享和修复复验的长期安排。

后续需要确认的三个问题

  • 协议是否正式生效: 两家公司是否会发布公告,或者由产品安全、研究安全团队说明合作性质。
  • 测试范围有多大: 需要确认测试覆盖哪些模型、API 或产品,是否涉及智能体、工具调用、长上下文和权限控制等系统性风险。
  • 结果如何被使用: 应关注漏洞是否经过复测、双方是否公布经过脱敏的结论,以及是否建立持续而非一次性的交叉测试机制。

信息来源

本文依据 2026 年 9 月 21 日至 22 日多家媒体公开报道整理,包括世界新闻网、新浪财经、Investing.com、富途牛牛、TradingView 及 cnBeta 等。相关报道均将线索指向 The Information,但截至发稿,OpenAI 与 Anthropic 尚未公开确认协议文本、测试范围和执行时间表。有关合作状态的判断以两家公司后续官方公告或原始资料为准。

正文完
 0
评论(没有评论)