团队想把昂贵大模型的能力蒸馏到小模型上用于高频任务,你会如何设计数据和验收,避免只学到表面语气?
考察说明
考查蒸馏任务边界、教师数据验证和学生模型验收能力。
回答思路
- 选择边界清楚、输入分布稳定且小模型容量可承载的任务,不把复杂开放推理全部作为蒸馏目标。
- 教师输出需要经过规则或人工核验并覆盖失败、拒答和边界情况,不能把大模型错误批量固化。
- 训练数据保留任务标签、证据和生成版本,控制模板重复,防止学生只模仿冗长措辞而未学会正确判断。
- 在独立真实集上比较任务结果、严重失败、分层鲁棒性、延迟和单位成功成本,并与直接调用教师模型对照。
- 上线采用灰度和升级路径,对超出分布或低可靠请求回退强模型,同时持续监控学生模型的数据漂移。