Agent Safety
权限、提示注入与 Agent 安全
当模型能读网页、邮件和文件时,外部内容也可能尝试指挥它。
The Question
为什么“只是让模型读网页”也可能构成安全问题?
Must Know
必须掌握
- 网页和文件里的文字既可能是数据,也可能被模型误当指令。
- 不可信内容不能获得系统提示和高权限工具。
- 最小权限、域名白名单和关键动作确认是基本防线。
Know Enough
应当了解
- 直接与间接提示注入
- 数据外泄路径
- 工具参数验证
Put It to Work
落实到工作
- 01
读取与写入权限分开。
- 02
外部发布、删除和付费动作设人工确认。
- 03
日志记录模型看到了什么、调用了什么。
Common Mistakes
不要这样理解
- 相信模型能自行识别所有恶意指令
- 把密钥放进可见上下文
- 让浏览器 Agent 无限制访问账户
Primary Sources