返回 AI 问题库

PaperBridge 长尾问题

怎么判断一篇 AI 论文可能存在数据泄漏?

先画出样本从采集到评测的完整路径,检查目标信息是否在预测之前进入特征、训练数据、提示或人工流程。最常见的信号包括同源样本跨切分、测试题进入预训练、按行随机切分时间数据,以及调参时反复查看测试集。

PaperBridge Editorial·

检查切分单位是否独立

逐行随机切分无法隔离同一用户、病人、设备、文档或视频的相邻样本。模型可能识别来源特征,而不是学会目标能力。

寻找按用户、实体、时间或数据源切分的测试。论文若只写随机切分,应查看附录、代码或数据说明确认细节。

追踪预训练和外部工具接触过什么

大型模型的预训练语料很难完整列出。检查测试集发布时间、网页可见性、题目是否有公开答案,以及作者是否使用过去污染检测或去重。

检索系统、搜索引擎和评测代理也可能直接返回测试答案。需要区分模型能力、工具访问和记忆带来的分数。

查看调参和人工流程是否看见测试答案

用测试集选择提示、阈值、模型版本或后处理规则,会把测试集变成验证集。可靠做法是保留一次性最终测试,或使用隐藏评测。

人工评分者若看到方法名称、参考答案或先前分数,也可能引入偏差。检查盲评、顺序随机化和评分规范。

数据泄漏的 6 个信号

  1. 同一实体或来源是否跨越训练与测试?
  2. 时间数据是否按未来留出?
  3. 测试题及答案是否可能进入预训练?
  4. 外部检索工具是否能直接找到答案?
  5. 测试集是否参与提示或阈值选择?
  6. 人工评测是否盲评并随机排序?

原论文、研究与官方文档

以下来源用于核对事实;流程与比较建议是 PaperBridge 对研究、官方文档和工程实践的综合。

Leakage in Data Mining: Formulation, Detection, and Avoidance系统定义了数据泄漏,并讨论泄漏如何让离线结果高估真实部署表现。NeurIPS Paper Checklist要求作者说明局限、假设、实验设置、计算资源、数据与代码信息。