技术转 AI / Agent 工程面试题(2026 最新)
面向研发岗位转向 AI 应用与 Agent 工程,覆盖系统设计、RAG、工具调用、评测、可观测性与推理工程。
共 40 道真题 · 更新 2026-08-03
筛选题目
考察点
技术栈
第 1 题要把一个只能单轮回答问题的模型升级成能查询订单、判断下一步并执行操作的 Agent,你会怎样设计它的核心运行流程? 考查 Agent 循环、状态控制和确定性边界的系统设计能力。第 2 题Agent 调用退款工具时,怎样避免参数错误、重复执行和越权操作?请说说你会在模型之外增加哪些工程保护。 考查高风险工具调用的可靠性、权限和副作用控制。第 3 题一个长期使用的个人助理需要记住偏好和历史任务,你会如何区分会话状态、短期记忆和长期记忆,并控制它们的写入与读取? 考查 Agent 状态与记忆分层、检索和隐私治理能力。第 4 题知识库里明明有正确答案,但 RAG 系统总是引用不相关的段落。你会按什么顺序定位问题? 考查 RAG 检索链路诊断和基于证据的优化能力。第 5 题你会怎样评估一个会规划步骤并调用多个工具的 Agent,而不是只看它最后一句回答是否正确? 考查 Agent 结果评测、轨迹评测和回归测试设计。第 6 题线上用户报告 Agent 偶发“卡住”,但普通应用日志看不出原因。你会为 Agent 系统补哪些可观测能力? 考查跨模型、检索和工具链路的追踪与故障定位能力。第 7 题线上流量里既有简单分类,也有长文档分析和复杂推理。面对三种能力、速度和价格不同的模型,你会怎样让系统自动选择,并在结果不可靠时升级? 考查模型路由、升级策略和质量成本控制能力。第 8 题长对话服务并发升高后显存占用和高分位延迟快速上升。你会如何从 KV cache 的作用出发分析和优化? 考查大模型推理缓存机制及其对并发、内存和延迟的影响。第 9 题团队考虑在私有环境部署一个 MoE 模型。相比稠密模型,你会重点评估哪些推理和运维问题? 考查对混合专家模型稀疏激活机制及部署取舍的理解。第 10 题要做一个能理解合同扫描件、表格和截图并回答问题的 VLM 应用,你会怎样设计从输入处理到结果校验的完整链路? 考查视觉语言模型在文档理解场景中的工程设计与风险控制。第 11 题一个 Agent 同时需要系统规则、用户资料、历史状态、检索证据和工具说明,你会怎样组装上下文,避免重要指令被噪声淹没? 考查上下文分层、优先级、预算与冲突处理的工程设计能力。第 12 题长对话中模型经常忘记早期约束,直接扩大上下文窗口仍没解决。你会怎样诊断并改造对话状态? 考查长上下文信息衰减、状态抽取和可追溯压缩的处理能力。第 13 题公司的知识库每天都有文档新增、修订和删除,你会怎样设计 RAG 入库流水线,保证线上检索的是正确版本? 考查增量摄取、版本治理、删除传播和索引一致性的工程能力。第 14 题企业搜索既有产品编号和人名,也有自然语言问题,你会怎样组合关键词检索与向量检索,而不是只选一种? 考查针对不同查询特征设计混合检索和融合排序的能力。第 15 题RAG 已经能召回正确文档,但它总排在十几名之外。你会怎样引入重排,并判断增加的延迟是否值得? 考查重排器选型、候选规模及质量延迟权衡能力。第 16 题知识库包含表格、代码和跨页合同,普通按固定字数切块效果很差。你会怎样改造切分策略? 考查按文档结构和任务需求设计可追溯切分的能力。第 17 题公司 RAG 助手面对不同部门和项目权限,你会把权限过滤放在哪里,怎样证明检索不会泄露无权文档? 考查检索权限继承、缓存隔离和越权验证能力。第 18 题知识问答要求每句话都有引用,但模型经常引用了相关文档却支撑不了结论。你会如何治理这种“伪引用”? 考查证据绑定、引用一致性检测和无依据拒答的设计能力。第 19 题一个审批 Agent 执行到第三步时服务重启了,你会怎样设计状态机和持久化,让它恢复后既不丢进度也不重复操作? 考查持久化工作流、状态迁移和安全恢复的设计能力。第 20 题消息队列可能重复投递,Agent 也可能因超时重试。你会怎样保证同一个业务意图不会被执行两次? 考查跨模型、队列与工具调用的幂等和重复处理能力。