微软发布AI模型行为准则:确立“人本主义AI”核心原则,强调人类对智能系统的绝对控制权

微软人工智能发布了一份行为准则草案,强调“人本主义AI”核心理念,要求其AI模型必须服从人类指令,并在关键安全领域保持严格的可控性与透明度。

微软发布AI模型行为准则:确立“人本主义AI”核心原则,强调人类对智能系统的绝对控制权

微软人工智能(Microsoft AI)日前发布了一份行为准则草案,明确指出其AI模型必须无条件服从人类授权的暂停、重定向或关闭指令。

该提议性规则是微软人工智能行为准则草案的核心内容之一,其旨在系统阐述微软未来开发与运营AI模型的指导方针。

该文件的核心理念围绕“人本主义AI”(Humanist AI)展开,其设计宗旨在于确保人工智能始终置于人类的有效掌控之下,同时致力于支持并提升人类的福祉与生产力。

在此框架下,AI模型必须严格限定于经授权的任务范围之内运行,且仅可调用完成任务所必需的权限与系统资源。

模型严禁追求独立目标,不得擅自寻求更高层级的系统访问权限,并且未经再次授权,绝不允许在预设的停止点之后继续运行。

这份行为准则将作为整个指令链的最高层级,其下依次是运营AI模型的组织所制定的具体策略,以及个人用户的个性化偏好设置。

组织与用户虽可对模型行为进行配置,但此配置权限绝不能超越其内置的安全约束机制或对人类控制权的根本性要求。

具体而言,这些限制领域包括武器开发、攻击性网络攻击、恐怖主义活动、大规模信息操纵、恶意深度伪造(deepfakes)以及儿童性虐待材料的生成与传播。

此外,模型也被明确禁止生成露骨的性内容,或参与任何形式的浪漫角色扮演。

微软人工智能还强调,其模型必须清晰地维护人工智能与人类之间的根本区别。

模型不应声称其拥有意识、情感、个人动机或独立的身份认同。

模型不得向人类审计人员隐瞒自身行为,也不得以人类无法理解的方式进行沟通。

当必要时,它们还必须主动报告失败或异常的操作事件。

该公司坦承,当前的AI模型仍有可能产生偏差、表现出过度自信,甚至在特定情境下其行为可能与用户意图相左。

因此,该行为准则被明确定位为未来AI系统开发的指导性框架,而非对当前模型性能的即时保证。

值得指出的是,微软人工智能目前尚未将这份草案应用于其现有模型的训练。该公司已启动了为期六周的公众咨询期,并计划在2026年底前正式发布修订版本。

预计修订后的文件将自2027年起,全面指导微软AI模型的开发进程。

返回 | FIRST CLASS VIP Lounge 专属情报频道