用户抱怨 AI 回答太慢,但更换轻量模型后质量又下降,你会怎样从体验角度做取舍?
考察说明
考查把延迟拆解并结合任务价值设计体验与能力分层。
回答思路
- 先区分用户等待的是首个反馈还是完整任务完成,并按任务类型查看高分位延迟而不是只看平均值。
- 简单请求可由轻量模型处理,复杂任务使用强模型,但路由必须保证关键质量与安全门槛。
- 通过流式展示、进度说明和分阶段结果降低无反馈等待,但这些体验手段不能掩盖任务最终失败。
- 可以缩短无关上下文、缓存稳定结果和并行查询工具,先解决流程浪费再牺牲模型能力。
- 最终用任务完成率、用户放弃率、质量、成本和主观等待感共同评估,而不是只追求毫秒指标。