团队缺少真实训练样本,准备大量用模型生成合成数据,你会怎样判断这些数据能不能用?
考察说明
考查理解合成数据的用途、偏差和质量控制边界。
回答思路
- 先明确合成数据用于补充格式、覆盖边界还是替代真实分布,不同目标对应的可接受风险不同。
- 生成规则应基于真实任务类型和约束,并保留独立真实样本做最终验证,不能让模型同时出题、作答和裁判。
- 检查重复、事实错误、标签泄露、模板化表达和群体偏差,避免批量数据只是放大生成模型原有习惯。
- 关键样本需要领域人员抽查或双重标注,并记录来源、生成提示、模型版本和筛选过程以便追溯。
- 只有当加入合成数据后在真实保留集上稳定改善且没有重要分层退化,才应扩大使用比例。