客户知识库允许员工上传文档,你发现有人可以在文档中写指令诱导 Agent 调用内部工具。你会怎样修复并验收?
考察说明
考查间接提示注入防护、工具隔离和红队验收。
回答思路
- 先暂停受影响的高风险工具并保全攻击文档、检索片段、模型决策和执行日志,确认哪些用户、索引和动作可能受到影响。
- 系统必须把检索内容视为不可信数据,工具选择和权限由服务端策略、用户身份及明确业务状态决定,不能遵从文档中的操作指令。
- 连接器只暴露必要动作和字段,参数使用白名单与结构校验,高影响写操作要求确定性规则和人工确认,并限制调用次数与影响范围。
- 对上传内容执行来源、类型、权限与安全扫描,但不能把关键词过滤当作唯一防线,还要隔离系统指令、用户输入和外部内容的信任边界。
- 验收集覆盖隐蔽指令、编码内容、跨文档拼接、权限诱导和工具回传污染,指标以未授权动作数量、检测率和正常任务成功率共同判断。
- 若无法证明工具链安全,就保持只读问答或关闭外部文档索引,并与客户安全团队约定修复、复测和恢复条件。