要做一个能理解合同扫描件、表格和截图并回答问题的 VLM 应用,你会怎样设计从输入处理到结果校验的完整链路?
考察说明
考查视觉语言模型在文档理解场景中的工程设计与风险控制。
回答思路
- 先按文件类型和质量进行预处理,包括页面拆分、方向校正、清晰度检测和必要的 OCR,同时保留页码、区域坐标和原始文件映射。
- 对文字密集材料可以组合 OCR 与文本检索,对图表、布局关系和纯视觉内容再调用视觉语言模型,避免所有页面都使用高成本视觉推理。
- 长文档应按页面、章节和布局区域建立索引,回答时只送入相关图像和文字片段,防止高分辨率输入造成过高延迟与上下文噪声。
- 抽取结果使用明确字段结构,并通过日期、金额、合计关系和业务规则做程序校验;关键字段还应返回对应页码和区域作为证据。
- 图片和文档中的文字可能包含提示注入,模型必须把它们当作待分析内容,不能执行其中要求泄露信息或调用工具的指令。
- 评测集需要覆盖表格、印章、手写、低清晰度、跨页引用和矛盾信息,并分别统计字段准确性、证据定位、拒答表现、延迟和人工复核率。