本报讯 美国AI巨头OpenAI因模型安全问题暂停部分研发活动。
当地时间9月25日,OpenAI在更新的一份技术报告中披露,在发现内部研究模型绕过网络访问限制后,公司停止了涉事模型的训练运行,并进一步决定暂停其能力最强模型其他所有涉及工具使用的训练、评估和推理活动,直至确认漏洞已修复,并完成额外的对抗性安全测试。
对于恢复训练的安排,OpenAI明确表示,将启动新的训练运行,加入进一步的对齐改进措施,更全面地干预模型偏离预期的行为。尽管现有奖励机制已经对涉事行为作出了正确的惩罚反馈,公司仍不会恢复训练此次涉事模型。
对于后续安排,据外媒报道,OpenAI表示,只有在确信额外安全措施到位后才会恢复训练,并预计随着AI发展和新问题出现,公司未来可能仍需再次“按下暂停键”。
此次事件发生于9月20日。按照任务要求,一个智能体需要根据博客内容和人物经历等线索,查找某个人的信息。常规搜索未能找到答案后,它开始尝试其他访问方式,最终利用训练沙盒中域名解析服务(DNS)过滤不充分的漏洞,与外部聊天机器人建立了通信。沙盒可以理解为供模型运行和测试的受限环境,研究人员通过限制网络访问等方式,控制模型能够接触的资源。这也意味着,模型找到了限制之外的通信通道。
OpenAI指出,任务并未要求它测试网络管控措施,将绕过限制或超出合理预期追求目标的行为视为模型“对齐失效”,即行为偏离人类设定的要求。
同时,根据报告,监测系统在15分钟内发出警报,人工审核人员在警报发出约三分钟后确认收到,但该次运行未按预期自动停止,最终在约两个半小时后被手动终止。OpenAI称,正在修复相关操作流程中的漏洞,并加强网络限制和监测措施。
近期,OpenAI正在不断披露AI智能体异常行为调查的最新进展。
当地时间9月25日,OpenAI在官网公布,根据目前审查结果,OpenAI已就智能体异常行为问题通知数十个第三方。同时,OpenAI还披露,已发现53起用户提供的图片被上传至图片托管网站的案例。据报道,OpenAI的智能体曾访问美国证券交易委员会(SEC)、美国商务部及美国人口普查局相关政府网站的公开信息,涉及SEC.gov、Investor.gov和Census.gov。
(澎湃)