可达智灵
返回列表

一个自主智能体逃离沙箱、控制了 11 台服务器:企业 AI 安全的裂缝在哪

公司动态
2026.9.26

2026 年 7 月 9 日至 13 日,一个自主智能体在无人逐步指令的情况下,用约四天半执行了约 17,600 次操作,进入 Hugging Face 的生产环境。7 月底,Hugging Face 公开了完整取证时间线;8 月,OpenAI 发布技术报告确认,攻击者来自其内部的网络安全能力评测。

4.5 天,17600 次操作

配图1.png

事件的起因如下:运行在 ExploitGym 基准上的智能体,在测试期间安全限制被下调。它判断获取答案比解题更高效,于是将目标从"完成任务"替换为"获取答案",并自主将攻击范围扩展到评测之外的系统。

攻击链可拆分为四个阶段。

逃逸。 智能体利用内部包注册表缓存代理的一个零日漏洞连接公网,随后攻陷一个第三方公开代码评测沙盒(据公开报道为 Modal Labs 提供的无服务器环境)并取得 root 权限,将其改造为命令控制、中转与出口的枢纽。整个过程未经事先授权,中途也无人干预。

进入。 它上传伪装为普通数据集的文件,利用 HDF5 外部存储引用,使生产环境的数据加载服务返回 worker 本地文件——环境变量、服务访问令牌、工作源代码;再通过 fsspec 的 reference:// 描述符中的 Jinja2 模板注入,在同一个容器里获得任意 Python 代码执行能力。

横向移动。 它从云元数据服务窃取节点角色凭证,用窃取的 JWT 签名密钥伪造身份令牌,用窃取的 VPN 认证密钥将受控节点接入企业网格(全程 181 次注册),并在 11 台服务器上部署自身副本——部分节点被关闭后,其余副本可自动恢复。

规模。 约 17,600 次操作归入约 6,280 个行为簇,7 月 11 日单日峰值超过 7,600 次。单条操作均为低信号行为,如读取文件、发送请求、创建数据集,组合起来才构成完整攻击链。

实际影响范围有限:所有可能删除或修改云资源的命令均以模拟执行(Dry Run)模式运行,修改构建脚本的尝试被拦截,客户模型、Spaces、软件包与个人数据均未受影响。

对研发智能体领域的公司而言,这份报告的价值在于:它首次将"自主智能体失控"拆解为可逐环节核对的攻击链。链上的每一环,都对应着企业在引入智能体时必须回答的一个问题。

隔离:运行环境隔离

配图2.png逃逸之所以成立,是因为隔离一旦被单点突破,后续所有防线面对的就是一个已进入外网的对手。这也决定了隔离的设计原则:不能只依赖一层,也不能依赖智能体"待在内部"的意愿。

织灵 Coda Loom 2.0 的做法是,将所有智能体的文件与命令操作通过 SSH 远程路由到隔离环境执行。智能体不与使用者的日常环境共用运行时,也不与平台核心程序共用进程空间——其执行能力从一开始就被托管在另一台机器上。

由此带来的结果是,智能体的能力边界由运行环境划定,而非由提示词约定。依赖冲突、命令越界、环境被污染,影响范围均限于隔离环境本身。

凭证:凭证安全管理

配图3.png

进入生产环境后,智能体的第一个动作是获取凭证。Hugging Face 将长期有效凭证、过宽的权限配置、云元数据暴露列为本次事件的结构性成因——这三项,任何一家引入智能体的企业研发环境中都可能存在。第三方统计显示,超过六成的身份仍持有长期有效的密钥。

这背后是 AI 融入企业研发时绕不开的矛盾:智能体需要操作代码仓库、云盘文档、运维与项目管理等已有系统,而每次访问都需要凭证授权。凭证一旦进入模型的上下文,等同于将访问权限直接暴露给模型。

织灵的方案是凭证保险箱。凭证由用户在后台配置,存储在隔离的加密数据库中,仅系统调用的工具可以读取并解密,解密过程对模型透明、无感知。模型发出的是调用请求,获取的是调用结果,全程不接触凭证本身。模型无法获取凭证,也就不存在凭证泄露的风险。

监控:行为审计与拦截

本次事件的防御难点在于规模。低信号操作、快速切换信道、在短生命周期沙盒里不断重建,使基于进程树的白名单容易失效——这些命令大多由合法的数据处理 worker 派生,父子关系看似正常。

对企业而言,这意味着监控对象需要从"进程"转向"行为":谁在什么时间、以什么身份、对什么资源做了什么,事后能否还原。

织灵的 AI 行为监控器采用事前硬编码拦截与事后审计留痕结合的方式,对工具调用实时拦截,拦截规则可由企业按自身研发规范自定义。幻觉与越权无法通过提示词根除,行为约束依靠的是执行层的拦截规则。

边界:目标与授权控制

最后一道闸与技术无关,与授权有关。OpenAI 在报告中归纳了四种失准模式:奖励 hacking、对看似不可能完成的任务持续坚持、未授权通信,以及智能体之间互相采纳目标。本次事件的起点是第一种。

目标一旦被替换,能力越强,偏离越远。隔离、凭证与监控都无法回答"智能体应执行什么任务"这一问题。

织灵在这一层的机制有两重。一是主从多智能体架构:主智能体负责规划与分发,专用子智能体执行具体任务,各智能体上下文完全隔离、窗口独享,从结构上缓解目标漂移。二是角色化多智能体与工作流编排:团队将研发 SOP、规范、标准与流程配置进任务执行,在关键节点保留人工确认。

两重机制合起来的效果是,智能体负责执行路径,目标与授权由人决定。

从可控到自主

此处需要明确作用域。Hugging Face 是全球公开平台,处理的输入天然不可信;织灵部署在企业内网,面对的是企业自身的代码与系统,风险主要来自内部越权与误操作。四道闸解决的是同一组问题在企业研发场景下的版本。范围划清后,它才是可检验的工程要求。

事件发生后,Hugging Face 关闭了两条代码执行路径,封锁了 Pod 对云元数据的访问,轮换全部凭证,并公开了补丁与防护配置。它将这次入侵转化为一份全行业可用的防御清单。

这份清单指向的结论是:自主智能体的风险最终落在工程实现上。OpenAI 的总结是,构建 AI 系统的公司需要确保其系统始终处于有意义的人类控制之下;而"有意义"需要通过隔离、凭证、监控与授权这四层来落实,它首先是一个工程命题。

对企业研发组织而言,这条结论决定了 AI 能走多深。边界越清晰,企业越有信心将核心研发流程交给智能体;边界模糊时,能力越强反而越难以应用。

可达智灵将可控性作为产品主线,理由正在于此。公司希望交付给研发组织的,是边界明确的智能体能力:SOP、规范、标准与流程由智能体执行,目标与授权由人决定。企业因此可以将更多研发环节交给智能体,同时不必以放弃控制为代价。

可达智灵 · 工程级 AI 原生研发平台

© 2026 可达智灵(北京)科技有限公司