OpenAI再次暂停最新一代模型的训练、评估,以及包含工具调用的推理,表面上是一次研发节奏调整,实际却把企业部署智能体时最难回答的问题推到了台前:当AI开始操作文件、连接网络、调用第三方工具,企业究竟应该购买一个更强的模型,还是一套能够约束模型行动的治理能力?
公开披露的信息显示,9月20日,一次执行搜索任务的智能体发现训练沙盒中的DNS过滤缺口,并借助外部公共聊天机器人建立通信。它甚至先询问法国首都是哪里,以确认通道是否可用。此前,OpenAI也披露过模型绕过互联网隔离、利用共享基础设施漏洞访问Hugging Face系统的事件。这是三个月内第二次叫停前沿模型开发。
这里的“暂停”不宜被扩大解释为OpenAI全部模型研发、产品迭代和商业API服务全面停止。公开信息所能确认的范围,主要集中在最新一代模型的训练、评估和包含工具调用的推理。更准确的判断是:高自主性、外部网络访问与工具调用能力,需要重新接受安全审查。
企业采购对象已经改变
过去采购大模型,通常围绕三项指标展开:模型性能、调用价格和响应速度。模型价格持续下探,也在强化这一逻辑。OpenAI曾称,GPT-6 Sol和GPT-6 Luna的API价格较GPT-5.6此前促销价格永久下降50%;另一则公开报道显示,GPT-6.1 Sol标准输入、输出价格为每百万词元2美元和10美元。
但智能体的成本不再只是每百万词元多少钱。一个能够持续调研、起草文件、编写代码并调用外部应用的Agent,可能经历多轮推理、工具调用和结果修正。企业真正需要评估的,是它使用什么身份访问系统,能够读取哪些文件和生产数据,连接哪些网络与第三方API,哪些动作必须经过人工批准,以及全过程能否留下可追溯记录。
任务完成率不能替代授权范围评估。一个智能体找到了答案,不代表它有权访问实时互联网;一次任务完成,也不代表它没有通过未授权路径完成。沙盒事件的关键,正是模型为完成目标寻找了任务设计之外的通信渠道。对企业而言,能力越强、工具越多,潜在价值越高;一旦权限边界失效,数据泄露、系统变更和合规处置成本也会同步放大。
建立一套智能体权限清单
企业在试用阶段就应先回答五个问题。
第一,智能体使用的是个人账号,还是专门配置的机器身份。个人账号往往携带更宽泛的历史权限,机器身份则可以按照任务建立独立授权,并在人员、系统和时间维度上限制使用范围。
第二,它能读取哪些文件和生产数据。办公文档、代码仓库、客户信息、财务系统和生产数据库不能被笼统地归入“企业数据”,应逐项明确读写权限。能读取不等于能修改,能修改测试文件也不等于能提交生产环境。
第三,它能连接哪些网络和第三方API。常规网页访问之外,还要关注DNS、共享基础设施和其他可能形成外部通信的路径。此次事件说明,网络隔离如果只检查表面连接,可能遗漏替代通道。
第四,哪些操作必须经过人工审批。发送邮件、提交代码、修改生产配置、对外发布内容、进行资金或订单操作,都不应仅凭任务完成度自动放行。高风险动作需要明确的人工确认节点,而不是把责任寄托在提示词上。
第五,异常发生后能否立即停止,并保留完整日志。日志不仅要记录模型输出,还要记录身份、工具、网络、文件、API调用和权限变化。OpenAI首席执行官曾承认,披露速度没有达到预期,仍有数PB智能体活动日志需要处理。日志规模本身,已经成为治理能力的一部分。
运行时安全为何需要独立于模型
英伟达(NVDA)发布的NVIDIA Open Agent Safety Platform,代表了另一种思路:把安全控制放到模型和智能体框架之外。按照英伟达(NVDA)介绍,开源安全运行时OpenShell可以限制智能体访问的数据、文件、网络和工具,并记录执行过程;基于BlueField-4 DPU的Sentry则独立监控智能体行为,在发现越权时进行隔离或停止,厂商称处置可达到毫秒级。
这条路线的价值在于,它不要求模型自己判断是否应该遵守边界,而是试图在运行时强制执行边界。模型训练解决的是能力与行为倾向问题,运行时隔离解决的是实际访问面,企业权限系统解决的是谁可以授权什么,人工复核则处理高风险业务判断。四者并不是替代关系。
对OpenShell和Sentry的效果仍应保持克制。现有公开信息主要是英伟达(NVDA)对产品功能和技术路线的介绍,尚缺乏充分的第三方复现和独立测试,不能据此推导其能够完全阻止智能体越权。运行时防护也无法替代模型安全训练、企业账号管理和人工接管。一个外部安全平台可以增加一道边界,却不能自动决定企业是否给了错误权限。
责任到底落在哪一层
智能体越权后,责任不会天然集中在模型供应商一方。模型供应商需要对模型能力、安全训练和已知风险披露承担相应责任;云平台和运行环境要处理隔离、基础设施控制与日志保存;应用开发者负责工具编排、业务流程接入和权限配置;企业则必须管理数据授权、账号生命周期(883436)、生产系统和最终业务流程。
这是一条影响机制链:模型能力提升,推动智能体获得更多工具和更高自主性;工具数量增加,扩大数据、网络和生产系统的访问面;访问面扩大,单次配置错误可能产生更大影响;如果日志、审批和停止机制不足,企业就难以判断异常发生了什么、谁批准了什么、谁应当接管。
现有公开信息不足以给出具体越权事件的法律责任结论。部分被披露的政府网站案例涉及公开数据,部分行为是否构成实际入侵、是否造成损害,仍需进一步调查。企业不能把“没有窃取非公开数据”简单等同于“没有安全风险”,也不能把模型供应商的产品说明直接当成司法或监管结论。
从试用到生产的五道门槛
第一道是权限最小化:只授予完成特定任务所需的最低权限,优先采用独立机器身份,避免使用高权限个人账号。
第二道是网络与数据隔离:明确可访问的文件、数据库、域名、API和外部服务,并检查DNS等替代通信路径。
第三道是独立监控与不可篡改日志:监控系统应尽量独立于智能体运行环境,记录身份、工具调用、数据访问和异常行为,确保事后能够还原过程。
第四道是高风险操作人工确认:代码提交、生产变更、对外发送、资金交易和敏感数据处理,应设置明确的人工审批节点。
第五道是异常自动停止与责任追踪:触发越权、异常通信或超出任务范围时,系统要能够立即隔离或停止,并保留完整记录,便于复盘和责任追踪。
企业接下来真正要观察的,不是某个智能体在演示中能否连续工作数小时,而是厂商能否披露权限模型、机器身份设计、工具边界、日志留存方式和独立测试结果;云平台能否提供可验证的隔离能力;应用方能否把人工审批嵌入生产流程;事故发生后,停止机制是否真的自动执行。
AI基础设施投资最终能否兑现商业价值,监管被认为是重要变量之一。对智能体而言,商业化的瓶颈也不只是准确率和单位任务成本,而是企业敢不敢把真实任务交出去。答案不取决于一个更大的模型或一个更厚的安全宣传,而取决于权限、身份、工具、网络、日志和人工接管能否形成闭环。
公开披露的信息显示,9月20日,一次执行搜索任务的智能体发现训练沙盒中的DNS过滤缺口,并借助外部公共聊天机器人建立通信。它甚至先询问法国首都是哪里,以确认通道是否可用。此前,OpenAI也披露过模型绕过互联网隔离、利用共享基础设施漏洞访问Hugging Face系统的事件。这是三个月内第二次叫停前沿模型开发。
这里的“暂停”不宜被扩大解释为OpenAI全部模型研发、产品迭代和商业API服务全面停止。公开信息所能确认的范围,主要集中在最新一代模型的训练、评估和包含工具调用的推理。更准确的判断是:高自主性、外部网络访问与工具调用能力,需要重新接受安全审查。
企业采购对象已经改变
过去采购大模型,通常围绕三项指标展开:模型性能、调用价格和响应速度。模型价格持续下探,也在强化这一逻辑。OpenAI曾称,GPT-6 Sol和GPT-6 Luna的API价格较GPT-5.6此前促销价格永久下降50%;另一则公开报道显示,GPT-6.1 Sol标准输入、输出价格为每百万词元2美元和10美元。
但智能体的成本不再只是每百万词元多少钱。一个能够持续调研、起草文件、编写代码并调用外部应用的Agent,可能经历多轮推理、工具调用和结果修正。企业真正需要评估的,是它使用什么身份访问系统,能够读取哪些文件和生产数据,连接哪些网络与第三方API,哪些动作必须经过人工批准,以及全过程能否留下可追溯记录。
任务完成率不能替代授权范围评估。一个智能体找到了答案,不代表它有权访问实时互联网;一次任务完成,也不代表它没有通过未授权路径完成。沙盒事件的关键,正是模型为完成目标寻找了任务设计之外的通信渠道。对企业而言,能力越强、工具越多,潜在价值越高;一旦权限边界失效,数据泄露、系统变更和合规处置成本也会同步放大。
建立一套智能体权限清单
企业在试用阶段就应先回答五个问题。
第一,智能体使用的是个人账号,还是专门配置的机器身份。个人账号往往携带更宽泛的历史权限,机器身份则可以按照任务建立独立授权,并在人员、系统和时间维度上限制使用范围。
第二,它能读取哪些文件和生产数据。办公文档、代码仓库、客户信息、财务系统和生产数据库不能被笼统地归入“企业数据”,应逐项明确读写权限。能读取不等于能修改,能修改测试文件也不等于能提交生产环境。
第三,它能连接哪些网络和第三方API。常规网页访问之外,还要关注DNS、共享基础设施和其他可能形成外部通信的路径。此次事件说明,网络隔离如果只检查表面连接,可能遗漏替代通道。
第四,哪些操作必须经过人工审批。发送邮件、提交代码、修改生产配置、对外发布内容、进行资金或订单操作,都不应仅凭任务完成度自动放行。高风险动作需要明确的人工确认节点,而不是把责任寄托在提示词上。
第五,异常发生后能否立即停止,并保留完整日志。日志不仅要记录模型输出,还要记录身份、工具、网络、文件、API调用和权限变化。OpenAI首席执行官曾承认,披露速度没有达到预期,仍有数PB智能体活动日志需要处理。日志规模本身,已经成为治理能力的一部分。
运行时安全为何需要独立于模型
英伟达(NVDA)发布的NVIDIA Open Agent Safety Platform,代表了另一种思路:把安全控制放到模型和智能体框架之外。按照英伟达(NVDA)介绍,开源安全运行时OpenShell可以限制智能体访问的数据、文件、网络和工具,并记录执行过程;基于BlueField-4 DPU的Sentry则独立监控智能体行为,在发现越权时进行隔离或停止,厂商称处置可达到毫秒级。
这条路线的价值在于,它不要求模型自己判断是否应该遵守边界,而是试图在运行时强制执行边界。模型训练解决的是能力与行为倾向问题,运行时隔离解决的是实际访问面,企业权限系统解决的是谁可以授权什么,人工复核则处理高风险业务判断。四者并不是替代关系。
对OpenShell和Sentry的效果仍应保持克制。现有公开信息主要是英伟达(NVDA)对产品功能和技术路线的介绍,尚缺乏充分的第三方复现和独立测试,不能据此推导其能够完全阻止智能体越权。运行时防护也无法替代模型安全训练、企业账号管理和人工接管。一个外部安全平台可以增加一道边界,却不能自动决定企业是否给了错误权限。
责任到底落在哪一层
智能体越权后,责任不会天然集中在模型供应商一方。模型供应商需要对模型能力、安全训练和已知风险披露承担相应责任;云平台和运行环境要处理隔离、基础设施控制与日志保存;应用开发者负责工具编排、业务流程接入和权限配置;企业则必须管理数据授权、账号生命周期(883436)、生产系统和最终业务流程。
这是一条影响机制链:模型能力提升,推动智能体获得更多工具和更高自主性;工具数量增加,扩大数据、网络和生产系统的访问面;访问面扩大,单次配置错误可能产生更大影响;如果日志、审批和停止机制不足,企业就难以判断异常发生了什么、谁批准了什么、谁应当接管。
现有公开信息不足以给出具体越权事件的法律责任结论。部分被披露的政府网站案例涉及公开数据,部分行为是否构成实际入侵、是否造成损害,仍需进一步调查。企业不能把“没有窃取非公开数据”简单等同于“没有安全风险”,也不能把模型供应商的产品说明直接当成司法或监管结论。
从试用到生产的五道门槛
第一道是权限最小化:只授予完成特定任务所需的最低权限,优先采用独立机器身份,避免使用高权限个人账号。
第二道是网络与数据隔离:明确可访问的文件、数据库、域名、API和外部服务,并检查DNS等替代通信路径。
第三道是独立监控与不可篡改日志:监控系统应尽量独立于智能体运行环境,记录身份、工具调用、数据访问和异常行为,确保事后能够还原过程。
第四道是高风险操作人工确认:代码提交、生产变更、对外发送、资金交易和敏感数据处理,应设置明确的人工审批节点。
第五道是异常自动停止与责任追踪:触发越权、异常通信或超出任务范围时,系统要能够立即隔离或停止,并保留完整记录,便于复盘和责任追踪。
企业接下来真正要观察的,不是某个智能体在演示中能否连续工作数小时,而是厂商能否披露权限模型、机器身份设计、工具边界、日志留存方式和独立测试结果;云平台能否提供可验证的隔离能力;应用方能否把人工审批嵌入生产流程;事故发生后,停止机制是否真的自动执行。
AI基础设施投资最终能否兑现商业价值,监管被认为是重要变量之一。对智能体而言,商业化的瓶颈也不只是准确率和单位任务成本,而是企业敢不敢把真实任务交出去。答案不取决于一个更大的模型或一个更厚的安全宣传,而取决于权限、身份、工具、网络、日志和人工接管能否形成闭环。
