技术转 AI / Agent 工程面试题更新 2026-08-05

要做一个能理解合同扫描件、表格和截图并回答问题的 VLM 应用,你会怎样设计从输入处理到结果校验的完整链路?

性能优化风险判断系统设计

考察说明

考查视觉语言模型在文档理解场景中的工程设计与风险控制。

回答思路

  1. 先按文件类型和质量进行预处理,包括页面拆分、方向校正、清晰度检测和必要的 OCR,同时保留页码、区域坐标和原始文件映射。
  2. 对文字密集材料可以组合 OCR 与文本检索,对图表、布局关系和纯视觉内容再调用视觉语言模型,避免所有页面都使用高成本视觉推理。
  3. 长文档应按页面、章节和布局区域建立索引,回答时只送入相关图像和文字片段,防止高分辨率输入造成过高延迟与上下文噪声。
  4. 抽取结果使用明确字段结构,并通过日期、金额、合计关系和业务规则做程序校验;关键字段还应返回对应页码和区域作为证据。
  5. 图片和文档中的文字可能包含提示注入,模型必须把它们当作待分析内容,不能执行其中要求泄露信息或调用工具的指令。
  6. 评测集需要覆盖表格、印章、手写、低清晰度、跨页引用和矛盾信息,并分别统计字段准确性、证据定位、拒答表现、延迟和人工复核率。