返回 AI 问题库

PaperBridge 长尾问题

世界模型的数据清洗到底怎么做?

没有一条适用于所有世界模型的“清洗脚本”。真正可靠的做法是先定义模型要预测的状态和动作,再依次处理可解码性、时间同步、重复与泄漏、语义质量、安全与授权、场景分布,最后用一个小模型验证每条筛选规则是否真的改善预测或控制。对于视频世界模型,最容易被忽略的不是画面清晰度,而是相邻帧是否连续、镜头切换是否被误当成物理运动,以及训练集和测试集是否来自同一段长视频。

PaperBridge Editorial·

1. 先定义“一条样本”是什么

清洗之前先写清楚输入、目标和时间范围。纯视频预测的一条样本可能是连续 16 或 32 帧;机器人世界模型则可能是 observation、action、next observation、task instruction 和 episode id。字段定义不稳定,后面的清洗只是在整理噪声。

跨机器人数据尤其需要统一坐标系、动作频率、夹爪状态、相机名称和任务标签。Open X-Embodiment 的关键工作之一,就是把不同机构和机器人采集的数据转成可共同训练的标准格式。

2. 做硬性校验:坏文件、坏时间轴、坏动作先剔除

先检查文件是否能完整解码、帧数与声明时长是否一致、时间戳是否单调、传感器是否缺帧、动作是否超出设备范围。机器人数据还要检查 reset 是否成功、episode 是否完整、相机与动作的延迟是否在允许范围内。

不要直接把缺失动作补成 0。0 可能代表“不动”,也可能代表“数据丢失”。两者混在一起会教给模型错误的因果关系。

  • 视频:解码失败、黑屏、冻结帧、异常帧率、过短片段。
  • 机器人:关节越界、动作饱和、时间戳漂移、失败 reset、传感器掉线。
  • 多模态:文本与视频错配、指令晚于动作、单位或坐标系不一致。

3. 去重时按“场景”分组,不要只比较单帧

完全相同的文件可以用哈希去重,近重复视频需要结合关键帧感知哈希、音频或元数据。更重要的是防止数据泄漏:同一段长视频切出的相邻 clip、同一次机器人采集的多个片段、同一路线连续驾驶的帧,必须作为一个组再划分训练集和测试集。

随机按 clip 切分看起来很干净,却可能让测试集出现训练集中几秒前的画面,最终指标会虚高。

4. 质量筛选要围绕任务,不是追求“画面最好看”

清晰度、压缩伪影、字幕遮挡和镜头切换可以自动打分,但阈值要服务于任务。模糊画面在真实机器人或驾驶场景中可能是必须学习的分布;一刀切删除,会让模型只会处理理想数据。

更好的方法是把样本标成 clean、recoverable、hard-but-valid、invalid 四类。invalid 删除,recoverable 修复,hard-but-valid 保留并单独监控。

5. 世界模型还要检查“动作—结果”是否可信

如果有动作标签,要抽样播放 action 前后的视频,确认方向、尺度和延迟正确。如果没有动作标签,像 Genie 那样学习潜在动作,也要排除大量镜头剪辑、画面跳转和静态循环,否则模型可能把剪辑规律当成环境动力学。

对驾驶和机器人数据,失败、碰撞、遮挡和恢复动作不能全删。它们往往是安全与泛化最需要的长尾数据,只是应该单独标记并控制采样比例。

6. 处理授权、隐私和可追溯性

每条数据至少保留来源、许可证或授权状态、采集时间、清洗版本和被哪些规则处理过。人脸、车牌、屏幕内容、地理位置和语音可能包含个人信息,需要按使用地区和数据协议做删除、模糊或访问隔离。

原始数据应只读保存,训练使用版本化清单。这样发现某个来源有问题时,可以精确撤回,而不是重新猜测哪些样本受影响。

7. 用小规模消融验证清洗规则

每条过滤规则都应该回答:删掉这些数据后,验证集的预测误差、控制成功率、长时一致性或安全指标有没有改善?DataComp 的价值就在于固定训练和评测,再比较数据筛选方案。世界模型也应采用同样思路。

先训练小模型或短周期模型,对 no-filter、基础过滤、去重、任务过滤分别做对照。没有下游收益的“洁癖式清洗”,可能只是在减少多样性。

可以直接照着跑的最小检查表

  1. 定义样本 schema、预测目标、episode 和场景分组键。
  2. 检查解码、长度、时间戳、缺帧、单位和动作范围。
  3. 做文件级与场景级去重,按 source/session 分组切分。
  4. 标记镜头切换、冻结、遮挡、失败和罕见事件。
  5. 核查授权、隐私、来源与撤回机制。
  6. 保存原始数据、版本化 manifest 和每条过滤原因。
  7. 用小模型消融验证过滤规则,再扩大规模。

原论文、研究与官方文档

以下来源用于核对事实;流程与比较建议是 PaperBridge 对研究、官方文档和工程实践的综合。

World Models早期世界模型把视觉压缩、动态预测和控制拆成可检查的模块。Genie: Generative Interactive Environments展示了如何从无动作标签的互联网视频中学习潜在动作与可交互动态。Open X-Embodiment把 22 种机器人、21 个机构的数据统一成标准格式,说明跨设备数据首先是模式对齐问题。DataComp用固定训练与评测流程比较不同筛选方法,说明清洗规则必须通过下游结果验证。