校验通过了,不等于可以执行:AI 智能体框架真正缺的是授权的封面图
In-depth Article

校验通过了,不等于可以执行:AI 智能体框架真正缺的是授权

2026 年 7 月一项覆盖 25 个 AI 智能体框架的扫描,发现 30 处模型可触达、却没有授权判断的后果性操作。行业在快速提高智能体能力,却还没把权限系统设计清楚。

加载中...
1 min read
Also available:English version

校验通过了,不等于可以执行:AI 智能体框架真正缺的是授权

2026-07-27 · AI Strategy


过去两周,AI 行业最热闹的词几乎都和“更强”有关。

Claude Opus 5 来了。GPT-5.6 系列上了 Amazon Bedrock。Google Cloud 继续推智能体平台和数据层。编程智能体开始补“人格”。开放权重模型又被拿来和 Kubernetes 类比。

这些故事都很重要,但都绕开了一个更急的问题:

当智能体决定动手时,是谁批准了这个副作用?

Actenon 在 2026 年 7 月发布的研究报告,把这个问题钉得很死。团队扫描了 25 个 AI 智能体框架和应用,覆盖 23,476 个文件,专门找一种模式:模型能否触达一个会改变现实状态的动作,路径上又是否存在授权判断。

结果找到了 30 处。

这个数字真正有价值的地方,不是制造恐慌,而是提醒产品团队:

今天很多智能体系统,仍然把“请求看起来合法”误当成了“系统允许执行”。

校验不等于授权

缺的不是智商,而是边界

智能体演示通常很顺:模型理解任务,选择工具,然后把事情做完。

在沙箱里,这很漂亮。一旦工具能改真实系统,问题就变了。

Actenon 的表述很克制。扫描结果不等于外部可利用漏洞,也不等于每个框架在生产里都已经被攻破。它证明的是更精确、也更有用的一件事:

在被分析的路径上,模型控制的参数可以到达后果性操作点,而中间没有一个占主导地位的授权决策。

换句话说,系统检查了请求格式是否正确,却没有检查:

这个执行者,现在,是否被允许对这个目标做这个动作。

两者差别很大:

  • “这笔退款请求格式对不对?”
  • “这个智能体有没有权限发起这笔退款?”

前者是校验。 后者是授权。

当前智能体框架,在前者上成熟得多,在后者上明显落后。

扫描真正暴露的是动作形状

比总数更值得看的,是问题集中在哪里。

研究给出的分布是:

  • crewAI:12 处
  • SuperAGI:6 处
  • MetaGPT:5 处
  • Semantic Kernel:3 处
  • Agno:2 处
  • MCP server / SDK 相关:2 处

动作类型更说明问题:

  • 15 处网络出口,目标可由模型控制
  • 7 处文件写入,路径可由模型控制
  • 3 处 Shell 执行
  • 2 处消息发送,接收方可由模型控制
  • 2 处文件删除
  • 1 处 SQL 执行,语句可由模型控制

这些都不是冷门密码学漏洞,而是产品里最普通、也最危险的能力:删数据、出网、发消息、跑命令、改状态。

一旦智能体能做这些事,它就不再只是“带插件的聊天机器人”,而是一个会操作环境的执行体。执行体必须有权限系统。

为什么“格式正确”会制造安全感

很多工具实现其实很正常:

  1. 解析参数
  2. 检查类型
  3. 也许拒绝空路径或非法 URL
  4. 然后执行

这会给人一种“已经做了防护”的感觉,因为它能挡住脏数据。但不够。

模型完全可以生成一条类型正确、格式完美的请求,去:

  • 写到不该写的目录
  • 把 webhook 发到错误地址
  • 运行一条语法干净、后果很重的 shell 命令
  • 删除错误的前缀
  • 给错误的客户群发消息

校验回答的是:这条请求能不能被执行? 授权回答的是:在当前策略下,这个智能体应不应该执行它?

把这两个问题混为一谈,团队就会做出演示很稳、上线很贵的产品。

能力在狂奔,权限还很薄

把同一周新闻放在这个视角下看,会更清楚。

Claude Opus 5 被定位成适合长时智能体任务。GPT-5.6 系列进入云平台。Google 在谈 Agentic Data Cloud。Cognition 收购 Poke,给 Devin 补交互人格。开放权重模型也更容易在集群里搬运和自托管。

这些都会提高一件事发生的概率:智能体开始尝试做有后果的动作。

但它们本身,都不会自动补上授权边界。

所以现在的智能体热潮会同时让人兴奋和不安。行业在快速提升:

  • 模型能力
  • 工具密度
  • 记忆
  • 多智能体编排
  • 部署速度

却还没有同步补齐:

  • 执行者身份
  • 动作范围
  • 目标约束
  • 授权有效期
  • 不可逆操作的人工确认
  • 事后能还原“为什么允许”的审计日志

产品能力层在向上长,权限层还很薄。

一个更有用的产品心智:工具是能力,不是函数

如果你在做智能体产品,别再把工具只当成 helper function。

把它看成带爆炸半径的能力。

search_docs 爆炸半径低。 write_file 中等。 run_shelldelete_prefixpost_webhookexecute_sql 则很高。

高爆炸半径工具,在真正执行前至少要过四关:

  1. Actor(执行者):是哪个智能体、用户或服务在发起?
  2. Target(目标):影响的是哪个资源?
  3. Scope(范围):是否仍在被授权的工作区、环境、角色内?
  4. Expiry / Context(时效与上下文):这次授权是否仍对当前会话、工单或任务有效?

缺任何一环,你都还没有真正的智能体权限系统,只是有一个会引发副作用的模型。

生产团队这周就能做的事

不需要先上完整的形式化权限模型。先把控制面做无聊、做清楚。

1. 盘点后果性操作点

列出所有能:

  • 离开本机
  • 改变持久状态
  • 花钱
  • 联系真人
  • 删除或覆盖数据
  • 执行代码或 shell

的工具。

不在这个清单上的,通常不是你的主风险。

2. 把校验和授权拆开

Schema 检查继续保留。再加第二道门,专门回答:

这个执行者,现在,是否被允许对这个目标做这个动作?

这道门要尽量靠近副作用发生的位置,而不是只写在 prompt,或者远远挂在某个中间件里。

3. 对高风险动作默认拒绝

不要给通用编程智能体“以防万一”的无限制 shell、网络和文件权限。 先给完成任务所需的最小工具集。

4. 不可逆路径必须确认

退款、删除、生产部署、客户消息、大范围出网,都不该是静默成功。 产品要让人看见即将发生什么,以及谁批准了它。

5. 记录的是授权决策,不只是工具调用

只记“工具执行了”太弱。 真正有用的是:“执行者 X 在策略 Z 下,因为授权 G,被允许删除前缀 Y。”

出事后,你需要的是这条链路。

6. 扫描自己的代码

Actenon 公布了针对这一模式的扫描器。你不一定非用它,但方法是对的:找模型控制参数流向后果性操作点、中间却没有授权判断的路径。

更深一层的产品结论

前些时候,WindFlash 写过:AI 正在从“产出内容的工具”变成“参与判断的系统”。这周的智能体框架故事,其实是同一判断的工程版。

没有责任边界的判断,是表演。 没有授权边界的行动,是负债。

下一代智能体产品,不会只靠更聪明的回答、更快的完成工单、更讨喜的人格取胜。真正能赢的,是让强大系统显得有边界。

用户不需要一个什么都能做的智能体。 用户需要一个能在正确策略下做正确事情、并且事后可审计的智能体。

这比工具调用难得多。 但也只有这个问题,才经得起规模化。

给创始人和平台团队的提醒

  • 模型升级抬高了“可能做什么”的上限;权限设计压低了“做错什么”的代价。
  • 框架流行度,不等于安全审查。
  • “模型决定的”不是授权故事。
  • 开放权重服务、多智能体编排、云端智能体平台,都会放大同一要求:在执行点建立明确的权限边界。

如果你的路线图还把智能体安全理解成“提示词加固 + 输入校验”,Actenon 这份研究是一次及时打断。行业已经在交付会行动的系统了。下一层真正重要的产品能力,是决定谁被允许行动。

事实来源:本文关键发现与数量来自 Actenon 2026 年 7 月研究笔记 The execution gap,同周行业背景参考 WindFlash 日报 2026-07-26

广告

Share this article

广告