
用10%淘洗100%:ICML 2026数据提纯里的“算力反思”与真实物理感
作者丨张 璐
编辑丨齐铖湧
英伟达联手华人团队提出首个视频运动归因框架 Motive,以 10% 黄金数据学物理的反直觉实证,完美验证了吴恩达的“Data-centric”方法论,并正面回应了杨立昆对像素自回归无法建立真实世界模型的痛批。
在刚刚公布的ICML 2026奖项名单中,一项由、普林斯顿大学与MIT联合团队提出的Motive框架,一举斩获了ICML 2026杰出论文提名奖。

论文链接:https://arxiv.org/abs/2601.08828
当下,具身智能与视频大模型开发进入深水区,从盲目堆砌像素转向高质数据提纯已成为行业既定共识。然而,如何从互联网海量视频中,量化并清洗出符合真实物理因果律的动态数据,行业此前一直缺乏一个可计算的工程抓手。
Motive 框架正是为了填补这一工具空白而提出。
作为首个针对视频生成运动归因的框架,Motive 在实证中给出了一个关键的数据支撑:在剔除时序噪音后,仅用 10% 的高影响力运动数据进行微调人类偏好胜率竟高达74.1%,在多项核心动态指标上直接碾压了100%全量数据微调的成绩。
01
打破算力堆砌:Motive 仅凭 10%
提纯数据逆袭全量微调
这篇论文最直观、最让人惊艳的,在于它彻底打破了视频生成模型在面对真实物理交互时频频露怯的问题。
过去,无论是硬币在玻璃桌面上旋转,还是橡胶球被重物压缩,大模型生成的画面往往伴随着诡异的形变和穿模。
在“单枚硬币快速旋转”的极限测试中,这种差距被展现得淋漓尽致。
调整前,预训练基座模型以及普通的随机数据微调,经常让硬币在旋转中直接变形、边缘糊成一片,完全失去了金属的刚性。
但在引入Motive框架后,数据筛选的逻辑发生了根本性的转变。
经过 Motive 提纯数据微调后的模型,真正还原了那种带有摩擦力和重力反馈的真实物理感。
硬币每一次与桌面的碰撞、倾角的变化、以及最后的静止,都严丝合缝地符合经典力学公式。
这证明了,想要让AI真正学懂物理世界的运行规律,靠的绝不是盲目喂大片,而是极其精准的数据提纯。
在主流厂商高度依赖扩大算力规模的背景下,Motive提供了一种计算可行的视频运动归因方案,使业界能够量化评估视频样本对模型物理动力学学习的贡献度。
团队背景:深耕Data-centric的华人学者
这份论文的主导者,是一位极为耀眼的华人青年学者——吴新迪(Xindi Wu)。

吴新迪本科毕业于西安交通大学少年班,随后在卡内基梅隆大学(CMU)机器人研究所获得计算机视觉硕士学位,目前师从著名计算机视觉大牛 Olga Russakovsky 教授。
吴新迪的研究方向主要聚焦于以数据为中心的方法(Data-centric approaches)与高效。
其研究核心在于探讨如何通过追踪数据影响力,来理解训练数据构成对模型最终表现的作用。
这一研究视角也促成了本篇论文的核心立意:在视频大模型的训练中,相比于单纯依靠扩大算力去堆砌海量像素数据,数据本身的运动动力学纯净度是更为关键的变量。
02
时序盲区:为什么传统图像归因算法
无法筛选视频运动?
为什么过去的视频模型总是学不会正确的物理规律?问题就出在数据筛选的源头上。
正如预期的那样,传统基于静态图像的样本归因框架(如 TRAK)在视频时序上会天然失效。其根本原因在于,这类算法过度依赖空间维度的静态语义与纹理特征,缺乏对时序维度运动连贯性的感知能力。

ImageNet 的经典实验中(如上图所示),模型把“小男孩拿着麦克风”误分类为“创可贴”时,算法揪出的支持者全都是带有肉色皮肤和网格纹理的图像 ; 当模型识别“车轮”时,算法找出的反对者居然包含了聚光灯和放大镜,仅仅因为它们在空间几何上都符合“中心圆形、金属反光”的特征 。
如果直接套用,筛选出的数据往往带有相似的背景,但在运动加速度和轨迹上却毫无因果关系。
在传统算法眼里,一段视频不过是几十张图片的线性堆砌。当你在海量数据里试图找一段“球体自由落体”的物理教材时,传统算法大概率会给你找出一堆“同样是木质地板背景,但画面完全静止”的废片。
因为它们只懂匹配静态的外观纹理,完全忽视了时序上的加速度、速度以及轨迹连贯性。
至于工业界常用的粗暴视频过滤法(如V-JEPA语义嵌入或纯运动幅度筛选),同样效果惨烈。
例如“纯运动幅度”筛选法,只要镜头剧烈摇晃或满屏乱闪,就会判定这是“高价值动作”,从而收录了一大堆视觉噪音。
如果不打破这个“只看脸不看动作”的黑盒,整个行业将永远陷在算力黑洞之中。
03
Motive 的核心闭环:
显式运动掩码与低维梯度投影
为了打破这个只看脸不看动作的黑盒,研究团队对症下药,做出了首个针对视频生成运动归因的框架Motive。
这套系统的核心就是把静态外观剥离,只看动态物理规律。
▎像素级位移流场与运动掩码
团队引入了高分辨率点追踪器 AllTracker 来提取像素级别的位移流场。其真正的核心设计在于,利用 min-max 归一化构建运动掩码(Motion Mask),并将其显式引入梯度权重的计算中。
这一步的数学本质是强制剥离静态背景的外观纹理,强迫模型在计算梯度时,将注意力绝对集中在发生物理交互的动态区域。这是 Motive 相比于传统图像归因最大的原创贡献之一。

▎极限压缩:512维的毫秒级查询
但现实是,要在数亿至百亿级参数的视频生成模型和海量数据上计算完整梯度,并存下每一对数据的海森矩阵,算力与存储成本足以压垮任何超级计算机 。
要在数十亿参数的视频生成模型上计算完整的特征协方差矩阵,时空复杂度极其巨大。
为了克服这一算力灾难,Motive 延续了 TRAK 等经典归因算法的降维工具链,采用 Fastfood 投影技术将庞大的全量梯度极限压缩至 512 维。这一操作基于Johnson-Lindenstrauss引理,在大幅降低存储与毫秒级查询成本的同时,能以极高概率保持高维空间中原始梯度向量的内积几何特征。
团队还发现,视频越长,累计梯度越大,越容易被系统误判为“高价值数据”。
为了抹平这种统计学上的不公平,Motive引入了1/F(帧数倒数)的帧长修正机制。
这一机制的本质是在时间维度上对时序梯度进行均值归一化,消除了长视频因为帧数累加导致的统计学偏置,将虚假相关性降低了 54.0%,确保了短时高频的物理碰撞不会在权重上被冗长的静止画面稀释。
04
反直觉实证:高价值运动数据≠视觉大片
这套极其精密的“数据提纯器”造出来后,在真实数据集上展现出了惊人的效果。
许多人认为,被Motive选出的10%黄金数据,肯定全都是“狂轰滥炸、运动最剧烈”的视觉大片。
但实验数据表明,Motive 选出的前 10% 高影响力视频,与判定为毫无用处的垫底 10% 视频,其平均运动幅度居然几乎重合(3.85 vs 3.69)。

这恰恰证明了 Motive 的独到之处:它真正揪出的,是蕴含深层物理演进规律的“高质量低调视频”。
一片树叶在水面上产生微小涟漪的视频,它教会模型的流体力学张力,远比一场全屏爆炸但缺乏物理逻辑的低质量二维动画要深刻得多。
正是靠着这种精准的筛选机制,Motive 才能在 VBench 基准测试衡量视频物理动态的核心指标——“动态程度”上,跑出了47.6%的顶尖成绩,将纯运动幅度筛选(40.1%)和V-JEPA语义筛选(41.6%)远远甩在身后。
在真刀真枪的17人双盲人类评测中,针对850个成对比较案例,Motive仅用10%的小样本微调,就对基础模型打出了74.1%的分数,这成绩几乎是压倒性的。
Motive 框架在 VBench 基准测试和人类双盲评测中的表现,实际印证了近年来 AI 行业内关于“以数据为中心(Data-centric AI)”以及“世界模型”的技术讨论。
05
技术范式反思:
从像素盲目预测走向物理世界模型
Motive 框架在 ICML 2026 的大放异彩,恰好印证了近年来 AI 行业内多位顶级科学家的前瞻性呼吁。
AI 巨擘吴恩达(Andrew Ng)长期倡导“以数据为中心(Data-centric)”的理念。
他曾在一场著名的斯坦福演讲中指出:在模型规模达到一定极限后,盲目堆砌算力喂养海量粗糙数据,边际效益已经极低,行业应该把精力放在如何精准清洗、提纯那“20% 的高质量黄金数据”上。

Motive 用 10% 的数据打出 74.1% 人类胜率的实证,简直就是对这一预言最完美的数学注解。
与此同时,Meta首席科学家杨立昆(Yann LeCun)也曾公开痛批那些盲目堆算力、疯狂抓取互联网视频的自回归模型。
他认为单纯依靠像素预测堆出来的“逼真”,只是空中楼阁,AI 根本没有真正学会世界运行的物理因果。
Motive 恰恰给出了解药。它通过剥离纹理外观、强制模型聚焦于像素级位移与运动掩码的技术路径,硬生生把大模型的注意力从“看长相”扭转到了“学物理”上。
这不仅回应了杨立昆对于“真正世界模型”的呼唤,也为具身智能的落地扫清了最大的数据噪音。
Motive 团队通过引入像素级位移流场和运动掩码,强迫模型在计算梯度时向动态物理交互集中,在一定程度上回应了这一技术痛点。
目前,AI 赛道正处于具身智能大爆发的前夜。在通过视频生成反哺真实物理世界的 Rob2S 研发线上,高质量、符合物理运行规律的纯净运动数据是核心稀缺资源。
互联网上的视频数据中,存在大量违背物理规律的特效、缺乏因果关系的静止画面或视觉噪音。
Motive 实际上提供了一种高精度的运动归因过滤器。当这种数据提纯工具成为工程标配时,开发者能够从海量数据中更高效地筛选出包含物理定律演进的关键片段,进而喂养出可交互的物理世界模型和动作模型。
从早期的像素盲目堆砌,到走向物理规律的精准还原,视频大模型的工程焦点正在发生实质性的转移。
Motive在数据领域里,像是一个筛子。比如,在科研领域,它能大大降低科研人员的数据筛选门槛,用更低的成本完成更高效的实验。同时,对于公司和产业界来说,也将训练效率大幅提升。
只有当这种高精度的运动归因过滤器成为行业标配,我们才能用纯净的动态物理数据,喂养出真正可交互的物理世界模型和动作模型。
从盲目堆砌像素,到精准的物理规律还原,Motive带来的,是一种范式创新,也是具身行业在世界模型领域的一次可复用的技术迭代。
一个人读论文太孤单,一群人刷顶会才好玩。
ICML 2026召开在即,我们正在召集一波含金量极高的 AI 研究者。群内主打实时论文跟踪与硬核技术探讨,拒绝灌水。
进群传送门:扫码进群或添加微信Vin_Vivid,备注:论文群 + 关注的 AI 方向。

搞科研/搞技术,信息差很重要。
来,一起快人一步!


上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
天宇优配提示:文章来自网络,不代表本站观点。