九源覆盖
自动建议 ≠ 人工决定当前训练时间覆盖与窗口分布
分开报告窗口累计时长、各相机去重时长、物理录制去重时长。T=8 不代表八帧长视频。
物理录制去重覆盖(小时)
当前训练窗口数量
当前发布样本的运动分层
只统计本次所选上下文;ARKit 估计单独标识。Unknown 保留缺失,不能算作静止。该分布不是全库分布。
上下文审阅台
ARCTIC / HOT3D · GT benchmark
两种输出均有效的配对子集
共同有效子集上,P3R2 两源误差均高于基模。HOT3D 总表均值下降伴随更多输出缺失,不能据此宣称精度提高。
按手部运动分层
误差为有效 GT 且有输出条件下的均值;缺失率与分母同时展示。无独立可见性标签,因此不伪报误检/漏检 F1。参考为官方拟合标注;非逐关节直接光捕。
数据结论与可复现材料
方法和限制
固定 seed 20260917;现用训练按物理录制去重,先筛查约 220 条录制的真实 T=8,再选择随机 20、motion 20、可疑 10。Motion 分层基于筛查窗口,不夸大为整库统计。DexYCB / EgoDex 的获取子集保留其随机 / 任务分散来源;EPIC 是十名不同参与者的短录制子集,不能代表全库。
RHAM 使用相邻相对旋转的测地距离除以真实时间。相机/world、手/world、手/camera 分别计算;缺失值不是 0。静止阈值为描述性阈值:P90 速度 ≤ 0.02 m/s;相机还要求 P90 角速度 ≤ 3°/s,按有效持续与时间覆盖限制。
困难且标签正确的样本应保留或提高权重。低有效标签比例只触发“待核查”,不能把遮挡、缺手或模型失败自动当成错标。本轮没有启动重训,也没有宣称筛选已经提高模型精度。
最终 demo 左栏为原始视频叠加有表面的 MANO;右栏为同帧 MANO、真实场景点云、手轨迹与相机轨迹,复用指定参考视频的 renderer。原生标注、fitted、predicted 分别标注。旧版骨架视图移入诊断材料;单色源和未通过画面验收的版本不冒充完整彩色 demo。可视化重建不进入 benchmark GT;画面平滑不代表训练标签正确。