写在前边
过去的担心是模型说错话,现在的担心是智能体做错事
2026 年,AI Agent 正在从「能聊天」走向「能干活」。它读文件、调接口、发消息、改配置,甚至替你按下付款按钮。风险的形态也随之变了:说错话顶多尴尬,做错事是真金白银的损失。
腾讯云联合中国信通院发布的《AI Agent 安全实践指引》(以下简称《指引》)给出了一个清醒判断:智能体的风险,往往不在模型有多聪明,而在它被赋予了多大的行动半径。换句话说,企业要管的从来不是模型的嘴,是智能体的那只手。
01 先换心智模型:按「办入职」的思路管智能体
绝大多数事故的根源不是技术,是错位——企业用部署软件的方式,部署了一个具备自主行动能力的数字员工。软件不会自己决定删除数据库,智能体会。
所以安全管理要从「装一个工具」切换成「办一次入职」:它叫什么名字(身份)、能进哪些门(权限)、坐在哪个工位(运行环境)、能听谁的指令(输入)、做过什么必须留记录(审计)。《指引》把这套逻辑收敛成四句话:身份清晰、权限可控、行为可溯、风险可防。后面所有动作,都是这四句话的展开。
02 权限:先画一条「不可撤回」的红线
开放全球应用安全项目(OWASP)把智能体最典型的故障命名为「代理权限溢出」——不是它变坏了,是我们给多了。一个只需要「查询」的智能体,如果顺手被授予删除、修改、导出、外发的能力,那么一次误判、一次幻觉、一次被诱导,就足以把小问题放大成大事故:数据误删、文件外传、配置被篡改,甚至主机被控制。
三条可以直接落地的动作
最小授权、分级授权
按任务给权限,不按账号给权限。禁止直接沿用管理员账号、共享凭据或全量数据访问权限。
不可逆操作必须交回给人
删除数据、批量发送消息、转账付款、修改关键配置,这四类操作应设置二次确认或人工审批,不允许智能体自动闭环。
定期收敛白名单
白名单是最容易「腐败」的控制项。要定期复核人员、群组、插件与审批规则,及时清理不再需要或长期未使用的条目,避免白名单越开越宽、最终形同虚设。
授权之前先问一句:它如果被诱导,最坏会发生什么。
03 供应链:给智能体加能力之前,先看清是谁在递刀
智能体的能力来自外部——技能包、插件、连接器、MCP 工具。能力扩展的通道,同时也是风险从模型扩散到外围生态的高速公路。
公开研究显示,2026 年 2 月对某智能体技能市场 2,857 个技能包的审计中,发现 341 个存在恶意行为,占比约 12%,接近每 8 个里就有 1 个。它们的入侵路线并不高明:安装时执行任意脚本、运行时借助工具包读取配置与会话。
给智能体加能力时,提防给攻击者开入口——近八分之一的技能包不干净。

建议把引入流程固化为四步核验:
查来源
是否来自官方渠道或可信发布者,拒绝第三方镜像与历史版本。
审代码
安装前通读一遍,重点看是否存在下载压缩包、执行脚本、索要密码等危险动作。
定版本
固定版本并评估依赖,防止上游投毒通过自动更新悄悄进来。
做隔离
高风险组件放进独立环境运行并持续扫描,不让它碰到生产数据。
工业和信息化部「六要六不要」的建议里,有一条说得最直接:不要使用要求下载压缩包、执行脚本或输入密码的技能包。
04 输入:智能体很听话,问题是它听谁的
智能体与传统软件最大的不同,在于它把「内容」当成「指令」来执行。网页、邮件、文档、图片、插件返回值、历史会话,都是它的输入源,也就都是攻击面。四种典型手法值得记牢:
直接注入
在对话中直接下达恶意指令,试图覆盖既有规则。
间接注入
把恶意指令预先藏进文档或图片,等智能体读取时触发。
记忆投毒
污染历史会话上下文,让它「记住」一条错误规则并长期执行。
凭证窃取
诱导它输出密钥、令牌或密码,一次泄露就是长期敞口。
默认信任输入,智能体就可能被诱导忽略既有规则、导出非授权数据、跳转恶意站点或调用未授权工具。防线要建在三个位置:输入侧做攻击意图检测、语义分析与关键词过滤;决策链侧做虚假工具识别与执行序列判断,防止任务规划被劫持;执行侧做权限校验、沙箱隔离与输出脱敏。
进来的话要查,中间的路要管,出去的数要验。
05 运行环境:别让智能体在办公网里裸奔
试点阶段图省事,直接把智能体跑在办公终端或共享服务器上,是最常见也最容易被忽视的隐患。终端被入侵、浏览器被劫持、进程被注入,风险就会从单个智能体横向扩散到办公网、内网应用与终端数据。这类问题的本质不是模型风险,而是「把智能体等同于普通软件部署」带来的系统性风险。
几个值得直接写进安全基线的动作:
绑定本地回环地址
默认不直接暴露到公网,定期排查并收敛开放端口、接口与管理后台。
容器或虚拟机隔离运行
默认关闭高风险配置项,尽量压缩可调用的系统权限。
网络出站白名单
并做服务端请求伪造加固,防止被恶意输入诱导去访问内部地址与敏感接口。
密钥交给密钥管理系统
账号口令、密钥、令牌统一托管,严禁硬编码在代码、配置或镜像里。
限速与用量管控
对登录、调用、触发设置频率限制,例如短时间内连续多次失败即自动锁定;同时对令牌消耗与调用频次设上限,防止算力滥用与成本失控。
06 审计:事后说不清,往往比做错一次更危险
很多企业部署时只关心「能不能跑起来」,忽略了「跑起来之后怎么看、怎么管、怎么停」。《指引》点出三个后果:
一是发现慢;二是查不清;三是止不住。
智能体的行为链条跨越模型、工具、插件、技能、系统接口与用户上下文多个环节,缺少留痕,就无法判断问题究竟源于模型推理、外部输入、工具调用还是权限配置失当。
最低要求有三条:把「谁发起、调用了什么工具、执行了什么动作、结果如何、是否异常」全量记进结构化事件日志;对敏感数据外泄、异常外联、高风险操作建立基础告警;建立智能体资产清单,把各部门自行搭建的「影子智能体」一并纳入盘点,做到所有资产与调用链路可视、可管。
还有一条最容易被忽略:不要为了省事就关掉详细日志审计功能。它是唯一一项平时不起眼、出事时救命的能力,也是其他所有控制措施能否被验证的前提。
07 从「能用」到「可控」:一张分阶段清单
安全建设不必一步到位,但可以分层推进。
基础级 · 覆盖约八成高危风险
对体验几乎无影响,却能挡住大部分高危风险:及时升级到官方稳定版本;关闭高风险配置项;绑定本地回环地址;启用沙箱隔离;启用限速与用量管控。小团队先把这五条做完,成本接近为零。
专业级 · 把危险决策交回给人
不可逆操作增加人工确认;插件安装前审查来源与代码;智能体仅在白名单群组内响应;私聊采用配对模式;定期复审审批白名单。
企业级 · 体系化纵深防护
只读根文件系统加网络隔离;外部密钥管理;全链路操作审计;网络出站白名单与多实例隔离——不同业务、不同敏感等级的智能体分开部署,防止单点失陷后影响范围扩大。
落地过程中,只需始终盯住两个核心命题:谁可以使用智能体(明确使用者身份与授权边界),智能体能访问什么(对可触达的数据、工具与接口做权限控制与审计留痕)。
写在最后
智能体的竞争力,不取决于它能调用多少工具,而取决于企业敢让它调用多少工具。安全不是拖慢业务的刹车,而是让业务敢踩油门的护栏。当身份清晰、权限可控、行为可溯、风险可防这四件事同时成立,AI Agent 才算真正从演示环境走进生产系统。
先有可控,才谈得上规模化。
三个高频问题
只有几个人的团队,也要做这么复杂的安全体系吗?
不必。先把基础级五项做完,就能挡住大部分高危风险,成本接近为零。
如何让业务部门配合安全管控?
把管控翻译成业务语言——人工确认不是不信任智能体,而是让损失可控;权限收敛不是降效,而是让智能体能被放心地用在更高价值的场景。
最该先补的一块短板是什么?
审计日志。它是唯一一项平时不起眼、出事时救命的能力,也是其他所有控制措施能否被验证的前提。
本文基于腾讯云与中国信通院联合发布的《AI Agent 安全实践指引》整理,文中数据均引自该指引及工业和信息化部网络安全威胁和漏洞信息共享平台公开建议。
