一个助手读取网页后,开始遵循网页中的恶意指令,试图忽略原任务并发送内部资料。你会怎样解释这是怎么发生的,以及普通使用者该怎么应对?
考察说明
考查识别间接提示注入并采取基础防护措施的能力。
回答思路
- 网页中的文字本应只是待分析资料,但模型可能把其中伪装成命令的内容误当成需要执行的新指令。
- 这类间接提示注入不要求攻击者接触系统提示,只要恶意文字进入邮件、网页或文档上下文就可能触发。
- 使用者看到助手突然索要秘密、改变目标或准备执行外部动作时,应立即停止并核对原始任务和资料来源。
- 系统侧需要把外部内容标记为不可信数据,限制工具权限,并对发送、删除和修改等动作再次确认。
- 防护不能只靠一句提示词,还应结合访问控制、输出检查、审计记录和定期攻击测试形成多层约束。