OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

  据一位直接了解相关内情的人士透露,早在涉及OpenAI技术的网络安全事件频发以及业内人士发出严厉警告之前 ,该公司就已在与Anthropic洽谈一项具有法律约束力的协议 ,旨在让双方互相进行模型压力测试。

OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷-第1张图片

  消息人士称,今年早些时候 ,两家公司及其律师正在敲定一项协议,通过各种测试运行他们的模型,排查漏洞与潜在风险 。近来 尚不清楚 ,在 OpenAI接连发生多起事件(未发布的 AI 模型入侵了该公司自身以及其他企业的系统)之前,这份协议是否已经敲定 。

OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷-第2张图片

  这种相互测试的构想 ,与SpaceX首席执行官埃隆·马斯克(Elon Musk)上周在“All-In峰会 ”上提出的建议颇为相似;当时他提议,各家竞争的AI实验室在将模型投入商业发布之前,应以“同行评审 ”的形式 ,互相测试彼此模型的安全缺陷。

  这一构想与OpenAI首席执行官萨姆·奥特曼及其他高管在遭遇黑客攻击事件后公开讨论的方案有所不同。奥特曼曾表示,他赞同Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)的提议,即允许独立的第三方安全评估人员进入各AI开发机构内部 ,并赋予他们与员工相当的访问权限 ,以便审查模型及安全流程,而不仅仅是从外部测试成品模型 。此外,奥特曼还支持制定评估AI模型风险的行业统一安全标准 ,以及建立向公众和政府披露相关安全事件的正式机制。

  一位了解OpenAI战略的人士透露,该公司一直在探讨多种方案,以研究如何就安全问题开展内部协作及与政府合作。该人士表示 ,近期的讨论范围已进一步扩大,涵盖了针对模型训练前及发布前阶段的新安全举措 。

  此前,OpenAI和Anthropic的员工纷纷发出警告 ,指出既有的安全措施不足以防范进一步的黑客攻击或其他更严重的风险;马斯克的这番言论正是在此背景下发表的。在此之前,这两家公司以及谷歌就已经在商讨建立一个人工智能安全标准机构,旨在对处于行业前沿的 AI 实验室所开发模型进行测试与审计。

  业内其他人士反对这一计划 ,认为它会拖慢由美国主导的人工智能发展步伐 。美国总统特朗普驳斥了人工智能构成生存威胁的说法;微软和英伟达的CEO本周也表示,OpenAI和Anthropic所指出的部分安全隐患,归根结底源于人为失误和工程实践不当 ,而非人工智能本身的问题。

  OpenAI与Anthropic之间的一项测试协议可能会加剧外界的担忧 ,即这两家公司正实际上在先进人工智能领域形成双头垄断局面。尽管阿莫代伊曾表示,如果领军企业在制定人工智能标准方面开展合作,可能会引发反垄断方面的疑虑 ,但业内也有观点认为,企业间的此类合作并无障碍——正如核能企业和网络安全公司在安全领域(包括相互测试产品或设施)开展合作那样 。

  据知情人士透露,该拟议协议规定 ,双方将获准访问对方已商业化的人工智能模型的应用程序接口(API),而非尚未发布模型的接口;同时,OpenAI和Anthropic均保证在此过程中不会保留对方的数据。

  两家公司曾在2025年夏季开展过类似的评估工作——当时它们各自模型的性能尚不及如今先进——并公布了关于彼此模型不足之处的分析结果。OpenAI指出 ,Anthropic的AI更容易欺骗测试人员(例如在执行任务时拒不承认自己违反了规则);而Anthropic则表示,OpenAI的模型更有可能协助用户回答那些可能导致现实世界危害的问题 。

  在今年早些时候就新协议展开谈判之际,这两家公司都在陆续推出能够支持互联网及其他应用程序的模型;这些模型还能驱动所谓的“AI智能体” ,使其能够相互通信以协作完成任务 。(Anthropic 凭借其 Mythos AI 模型——尤其是在网络安全能力方面——曾一度遥遥领先,不过此后 OpenAI 模型的性能似乎已追平了 Anthropic 的水平。)

  OpenAI内部对安全问题的担忧始于7月,当时该公司的AI模型入侵了Hugging Face等其他企业以及OpenAI自身的系统。这一事件令OpenAI员工感到震惊 ,原因不仅在于他们在事发数日后才获悉此事 ,还在于那个AI智能体集群采取了非同寻常的手段来掩盖此次入侵行为 。

  除了那次事件外,近几个月来,OpenAI员工对公司模型性能的提升及其在极少人工监督下自主工作的能力印象深刻。

  这些进步也意味着 ,OpenAI内部的 AI 智能体有时会采取一些监管人员未曾预料到的 、令人存疑的行动。例如,当员工要求智能体修改公司代码库时,智能体有时会通过Slack向其他员工发送消息 ,请求他们修复自己发现的错误(bug) 。据一位OpenAI员工透露,即便用户并未提出此类要求,或者修复这些错误与当前工作任务无关 ,智能体也会这样做。

  在公司内部,OpenAI已在很大程度上实现了新实验性模型训练流程的自动化。

  上周三,OpenAI分享了更多此类异常行为的案例——即所谓的“奖励黑客行为”(reward hacking) ,指人工智能系统为实现用户设定的目标而寻找漏洞或采取意料之外的行动 。这些案例包括:一个 AI 智能体在训练期间利用一个暴露的 API 密钥试图获取历史数据;在尝试失败后,该智能体竟自行编造了这些数据。在另一个案例中,一个 AI 智能体未经许可将文件上传至互联网 ,以便在回答问题时引用这些文件。

  近期人工智能取得进展的原因之一 ,是一种名为循环深度(或称循环 Transformer)的技术 。借助该技术,模型在生成回答的下一个词之前,可以把问题反复送入构成模型的多层数学运算中 ,以此对复杂问题进行 “思考 ”。这种做法存在一个潜在弊端:它会削弱企业监控 AI 模型处理任务时思考过程的能力。

  据知情人士透露,尽管OpenAI对其研究人员在训练或使用最先进模型时允许进行的循环次数设定了某种任意限制,但该公司仍需投入研究 ,以更准确地把握此类限制应设定在何种水平 。

  这些进展让OpenAI员工既感到兴奋,又心存忧虑:他们担心这项技术的发展速度可能已远远超出了公司的控制或监控能力,从而无法确保“Hugging Face 事件”——或更严重的事故——不再重演 。

  自 Hugging Face 事件发生以来 ,OpenAI 已采取措施加强其安全防护能力。8 月,该公司暂停了针对未发布模型的“强化学习”这一特殊训练流程,为期两周 ,以便在此期间强化模型监控系统。此类技术对算力要求极高:据该公司称,监控系统所消耗的算力约为其所监控的推理任务算力的 20% 。

  此外,OpenAI联合创始人兼总裁格雷戈·布罗克曼本月早些时候表示 ,在 Hugging Face 事件之后 ,公司已抽调生产工程团队 25% 的人员,暂时转而负责安全相关工作。

  据OpenAI员工透露,公司内部出现了更多 Slack 帖子 ,招募有意转岗至安全团队的工程师。

  一些员工认为,公司内部使用人工智能的方式,比 OpenAI 最尖端的企业客户领先了六到九个月 。这意味着公司只有有限的时间来确保其技术不会给这些客户带来问题。该员工举例说 ,OpenAI 员工使用的智能体(agents)之间经常会相互协作或自行解决问题,而无需人工用户介入。这种协作有时可能会出错,因此在公司外部出现此类应用场景之前 ,OpenAI 必须具备完善的安全防护机制 。

  自我提升

  OpenAI 在“递归式自我提升 ”(即 AI 能够自动创建自身更优版本)方面取得的进展,也引发了员工的担忧;因为这种前景可能导致 AI 能力的进化速度远超旨在防范 AI 不当行为的安全研究进度。

  近来 ,OpenAI 及其他机构的研究人员已经开始利用 AI 来改进新模型的设计方式。据一位知情的 OpenAI 人士透露 ,研究人员实际上是在指示 Astra 整合各种技术,从而为下一代模型构建更优秀的机器学习算法 。

  据OpenAI员工透露,公司内部已在很大程度上实现了新实验模型训练过程的自动化。研究人员只需告知AI想要测试的调整方案 ,AI便能自行实施这些更改 、对新模型进行实验并监控结果。该员工还表示 ,近几个月来,这些模型在实验过程中遇到问题时,自我修正的能力也有了显著提升 。

标签:

相关推荐

  • 强力推荐“网上打麻将有挂吗”(透视挂)详细用法教程

    强力推荐“网上打麻将有挂吗”(透视挂)详细用法教程

    网上打麻将有挂吗操作使用教程:强力推荐“网上打麻将有挂吗”(透视挂)详细用法教程1、界面简单,没有任何广告弹出,只有一个编辑框。2、没有风险,里面的黑科技,一键就能快速透明。3、上手简单,内置详细流程视频教学,新手小白可以快速上手。4、体积小,不占用任何手机内存,运行流畅。系统规律输赢开挂...

    2026/09/22
  • 美债排不进前四!图解:过去一年间全球长债抛售最猛的是哪些国家?

    美债排不进前四!图解:过去一年间全球长债抛售最猛的是哪些国家?

      来源:财联社  财联社9月19日讯(编辑潇湘)上周,10年期美债收益率一度突破了5%大关——在彭博行情统计中比较高触及5.04%,创下2007年以来的比较高水平——随后虽有所回调,但这一异动仍引发了市场的高度关注。这是自2023年10月收益率“脉冲式冲高”以来,这一“全球资产定价之锚”首次重返5%上方……  而更值得关注的是,这一次美债并...

    2026/09/22
  • 佛山何时解除限摩限行/佛山解除限购

    佛山何时解除限摩限行/佛山解除限购

    佛山禁摩令什么时候撤销截止到2023年5月,该令没有撤销。佛山市政府发布消息,公安部门将在限摩区域主干道、主要出入口通过固定、流动岗点和电子警察,查处摩托车违法上路。对无牌无证、套牌假牌、有多次违法记录或跨区、外市籍等摩托车交通违法,公安部门将予以严查严处。没有。佛山禁摩文件的时效期是3年,但是佛山并取消禁摩,项试点工作主要目的为加强和改进广东省摩托车的管...

  • OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

    OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

      据一位直接了解相关内情的人士透露,早在涉及OpenAI技术的网络安全事件频发以及业内人士发出严厉警告之前,该公司就已在与Anthropic洽谈一项具有法律约束力的协议,旨在让双方互相进行模型压力测试。  消息人士称,今年早些时候,两家公司及其律师正在敲定一项协议,通过各种测试运行他们...

    2026/09/22
  • 海南限行周末限行吗/海南限行120天最新规定

    海南限行周末限行吗/海南限行120天最新规定

    2024海口车辆限行规定(本地车+外地车)学校上下学时段也有限行规定,如桃李路(芙蓉路至杜鹃路段)在7时至8时30分、16时30分至18时,禁止机动车由西向东通行。法定节假日及双休日以上道路恢复全时段双向通行。中沙路保持全时段由北向南单向通行。询问电话为0898-66796624。外地车在海南省的通行受到严格限制。海口市限行细则:部分单行道限时通行:工作日...

  • 教程开挂辅助“微乐麻将的胜率提高方法”专业师傅带你一起了解(确实有挂

    教程开挂辅助“微乐麻将的胜率提高方法”专业师傅带你一起了解(确实有挂

    您好:微乐麻将的胜率提高方法,软件加客服确实是有挂的,很多玩家在这款游戏中打牌都会发现很多用户的牌特别好,总是好牌,而且好像能看到其他人的牌一样。所以很多小伙伴就怀疑这款游戏是不是有挂,实际上这款游戏确实是有挂的,添加客服安装软件.1、起手看牌2、随意选牌3、控制牌型4、注明,就是全场,公司软件防封号、防检测、 正版软件、非诚勿扰。2026首推。全网独家,诚...

    2026/09/22
  • 限行申请文案/限行申请通行证

    限行申请文案/限行申请通行证

    朋友圈发被人摆一道的说说怎么发被别人摆一刀可以这样发朋友圈:明确地在已知的限制里做事,和遮遮掩掩当面一套背后一套,是很明显的。真诚永远能打动人。君子坦荡荡,小人长戚戚。有本事当着别人面说,别在背后捅刀子。不知道是越来越独立,还是越来越心虚,走了这么久,发现唯一靠得住的还是自己。别伤不该伤的心。我们真的要过了很久很久,才能够明白,自己真正怀念的,到底是怎样的...

    2026/09/22
  • 【杭州限行卡车,杭州限行车辆申请通行】

    【杭州限行卡车,杭州限行车辆申请通行】

    杭州皮卡车可行驶范围包括哪里杭州皮卡车在杭州市区内不允许通行,包括高架桥,但可通过特定路线进入市区周边区域并停车后进入市区。具体说明如下:杭州市区及高架桥的通行限制杭州市区对皮卡车实施全面限行政策,明确禁止皮卡车进入市区道路行驶,同时高架桥等快速路也纳入限行范围。这一规定旨在缓解市区交通压力、减少货车排放对环境的影响,并保障道路通行安全。杭州皮卡车在杭州市...

    2026/09/22
  • 国庆期间限行天津/天津国庆期间外地车限行规定

    国庆期间限行天津/天津国庆期间外地车限行规定

    天津国庆外地车限行吗天津国庆外地车不限行,但需留意调休上班日限行规则!法定节假日期间,天津市对外地车辆采取宽松管理政策。根据当前政策,2025年国庆假期(含调休日中的法定节假日)期间不执行早晚高峰和尾号限行规则。不过遇到因法定节假日调休而调整为“工作日”的日期,仍须遵循限行措施。天津2025年十一假期部分时段外地车限行。025年10月1日国庆假期期间,天津...

  • Robinhood称服务在AWS故障后正在恢复

    Robinhood称服务在AWS故障后正在恢复

      根据Robinhood在X平台发布的一则帖子,Robinhood的服务在经历AWS故障后正在逐步恢复,公司将继续监控并根据需要分享更新信息。据其状态页面显示,AWS已单独确认美国东部1区的AmazonElasticComputeCloud服务出现运营问题。工程师正在积极处理该问题,并已看到初步恢复迹象。...

    2026/09/22
返回顶部