为了让评测题看起来够真实,有人把生产环境的问答记录直接拷进了评测集。排障过程中,又顺手把完整日志打进了共享群里。相关材料里往往还会写一句"这些数据都可以先倒进数据湖,以后再分类整理,用来优化模型"。可一旦倒进同一个数据湖,微调训练的时候就有可能不小心看到了评测题目本身,评测阶段又刚好是从同一个数据桶里抽样出来的。这种。