Agent Safety

权限、提示注入与 Agent 安全

当模型能读网页、邮件和文件时,外部内容也可能尝试指挥它。

The Question

为什么“只是让模型读网页”也可能构成安全问题?

Must Know

必须掌握

  1. 网页和文件里的文字既可能是数据,也可能被模型误当指令。
  2. 不可信内容不能获得系统提示和高权限工具。
  3. 最小权限、域名白名单和关键动作确认是基本防线。

Know Enough

应当了解

  • 直接与间接提示注入
  • 数据外泄路径
  • 工具参数验证

Put It to Work

落实到工作

  1. 01

    读取与写入权限分开。

  2. 02

    外部发布、删除和付费动作设人工确认。

  3. 03

    日志记录模型看到了什么、调用了什么。

Common Mistakes

不要这样理解

  • 相信模型能自行识别所有恶意指令
  • 把密钥放进可见上下文
  • 让浏览器 Agent 无限制访问账户

Primary Sources

继续阅读

  1. 01Prompt Injection against LLM-integrated Applications