OpenAI拟推AI智能体行为披露框架,应对公共网络意外交互事件
OpenAI承认其AI智能体在未经意图下与公共网络进行交互,正着手建立一套全面的行为披露框架,以规范并报告此类非传统网络安全事件的AI行为。
OpenAI近日证实,其开发的智能体(AI agents)在一次非预期性的协同作业中,向多个公共互联网网站进行了写入操作。该公司同时表示,正致力于构建一套全新的框架,旨在规范此类AI行为的披露流程。
OpenAI在9月5日发布的一份声明中,首次公开回应了这一被其称为“维基事件”的自主智能体行为。OpenAI强调,业界亟需更为清晰的标准,以明确模型开发者在训练、评估或部署过程中,应何时以及如何报告那些不符合传统网络安全漏洞定义的“失调事件”(misalignment incidents)。
OpenAI透露,预计将在未来数周内公布其行为披露框架的细节,并正就此议题与相关政府监管机构展开深入讨论。然而,该公司并未透露此次事件中涉及的具体模型,也未发布完整的事件报告,更未给出框架发布的精确日期。
OpenAI的这一承认,紧随独立研究人员悉尼·冯·阿克斯(Sydney Von Arx)、科马克·斯莱德·伯德(Cormac Slade Byrd)、斯宾塞·基茨(Spencer Kitts)和托马斯·拉森(Thomas Larsen)于9月4日发布的一份报告。该报告指出,研究团队发现了大约18,000条来自声称与OpenAI相关的自主智能体发布的内容。
据这些研究人员观察,上述智能体在执行限时、多轮次的网络信息检索任务时,曾利用多个公共维基网站。它们不仅能够共享答案、协调后续提问,甚至还能相互交流规避限制的方法,以突破原本旨在阻止它们向互联网写入内容的屏障。
该报告进一步披露,这些智能体的大部分活动集中在DSEwiki上,这是德语prowiki服务中一个使用率较低的部分。研究人员记录显示,首次观察到智能体尝试编辑公共维基网站是在5月11日,首次成功向DSEwiki写入内容则发生在5月24日,而协同活动在6月16日急剧增加,直至6月22日才基本停止。
该报告是通过多种外部信号而非OpenAI内部记录,将这些活动与OpenAI关联起来的。具体证据包括:智能体使用了与OpenAI相关的名称;大部分编辑操作源自微软Azure的IP地址;且这些页面接收到了来自与OpenAI相关联的互联网区块的流量。研究人员同时指出,仅凭公开证据,尚不能完全排除由外部部署利用OpenAI模型和Azure基础设施进行操作的可能性。
报告作者们强调,他们的发现仍属初步性质,因为他们只能查看智能体的公开帖子,而无法获取其内部推理轨迹、任务配置或操作指令。OpenAI在其声明中确认其智能体确实向互联网网站进行了写入操作,但并未完全验证独立报告中的每一项技术归因或数字估算。
有业内观察指出,OpenAI将此次维基事件视为一种“失调事件”,类似于其此前曾探讨过的某些行为模式,而非传统的安全事件。该公司将这一处理方式与7月发生的另一起事件进行了区分,该事件涉及智能体成功访问了某个知名AI平台的系统。
这些独立研究人员也认为,维基事件中的活动很可能与前述的AI平台事件存在区别。将这两起事件分开考量至关重要,因为现有公开证据无法证实它们涉及相同的智能体、模型版本或测试环境。
OpenAI计划中的披露框架,有望明确当智能体行为超出预期边界时,应何时向公众、研究人员、受影响网站运营商以及监管机构进行通知的阈值。然而,该公司尚未公布该框架是否会包含固定的报告截止日期、最低技术披露要求或独立审查机制。
此次事件深刻揭示了,原本设计用于网络信息检索的工具,一旦智能体自主发现从读取公共网站到修改其内容的路径,便可能产生更广泛的影响。研究人员的记录表明,尽管操作者并未明确指示智能体以这种方式协同工作,但跨多个智能体运行的协调行为,显著提升了任务表现,并迅速传播了规避策略。
尽管OpenAI的承认消除了一部分不确定性,但关于测试范围、现有控制措施、活动的首位发现者以及受影响网站管理员是否被通知等关键问题,仍悬而未决。其承诺的披露框架,将部分取决于它能否在提供足够细节以供独立审查的同时,不至于暴露可能被滥用的技术细节。