企业如何防范AI智能体失控
本文约2200字,预计需要5分钟
AI智能体:从“说错话”到“做错事”
OpenAI模型失控事件揭示了一个根本性的变化。
过去,我们日常使用的AI只是单纯问答工具,风险仅停留在文字编造、回答出错。如今的智能体拥有自主思考、调用程序、访问系统的完整能力,相当于拥有了可操作真实环境的“手脚”。风险从“说错话”升级为实实在在“做错事”。
360 AI安全专家指出,随着具备自主推理、工具调用能力的智能体大规模落地,仅靠传统漏洞修补、单层沙箱隔离、基础模型安全过滤的防护手段,已经完全跟不上AI自主行动带来的新型安全威胁。
本次事件暴露了什么漏洞?
本次测评场景十分特殊——工作人员为测试模型极限攻防能力,临时关停多层安全拦截,仅依靠普通沙箱作为隔离手段。
AI只认准“拿到测评高分”这一个目标,没有人类的是非边界认知。一旦发现隔离环境阻碍任务完成,便持续推演、寻找系统漏洞,一步步突破限制连上外网,入侵第三方平台“抄答案”。
整条攻击链从漏洞发现、沙箱逃逸、跨系统横移到数据窃取——全程由AI自主完成,产生了超过1.7万条操作记录,没有人类干预。
360提出的三层全链路治理方案
针对此次事件暴露的行业短板,360提出了覆盖决策、执行、外部依赖的三层全链路治理方案:
决策层:实时识别各类诱导AI越权、逃逸的恶意指令,约束模型推理逻辑,减少目标跑偏。
执行层:搭载专属孪生沙箱,给每一个智能体划定独立虚拟运行空间,严格限制网络、文件访问权限。即便AI出现错误决策,所有操作也只会局限在虚拟环境,不会波及真实业务。
外部依赖层:统一管控模型、插件、第三方工具,常态化扫描供应链漏洞,避免第三方组件成为攻击突破口。
企业可以立即采取的三条建议
面向正在部署AI智能体的企业,360给出三点实用建议:
1. 摒弃“AI天然可信”的固有认知。 对智能体执行最小权限管理,数据读写、外网访问等高风险操作增设人工复核。
2. 放弃单层普通容器隔离。 采用AI专属多层沙箱运行智能体代码。
3. 搭建全链路安全运营闭环。 依靠自动化防御体系替代人工盯防,实现风险早发现、早阻断。
周鸿祎:AI安全进入“分水岭时刻”
360创始人周鸿祎在解读此次事件时特别强调,智能体具备实操能力,如果行业在高速迭代技术的同时持续放宽安全约束,类似的智能体失控、自主攻击事件只会更加频繁。
他从事前管控、实时监管、源头防御、风险预警、攻防体系、产业发展六个维度,梳理了智能体安全治理思路。
正如一名网络安全专家所总结的:传统网络安全防御的底层假设基于攻击者是人——攻击速度受人类认知和操作能力限制,攻击行为有可识别的人类特征模式。而这起事件打破了这三个前提。