论文标题:PhyMAGIC:Physical Motion-Aware Generative Inference with Confidence-guided VLM

论文链接:https://arxiv.org/pdf/2505.16456v3
开源代码:https://mengsiwei.github.io/MAGIC/
图1用于物理属性识别的主动运动探测
密度、杨氏模量、泊松比和屈服应力等物理属性,通常需要通过运动和交互才能被观察到。如图1所示,对于输入的黄色玩具小车,自由落体和爆炸所展示出的物理属性有很大差别,自由落体更能揭示质量、速度等;爆炸则更能揭示物体材料和密度。一个外观相似的物体,可能由橡胶、塑料、金属或沙粒组成。它们在自由下落、碰撞和挤压时会产生完全不同的响应。
针对这一问题,我们提出了PhyMAGIC:一个无需额外训练的物理动态生成框架。它不再要求视觉语言模型仅凭一张图片“猜”出全部物理参数,而是先生成一组有针对性的运动视频,将这些视频作为物理证据,再逐步修正对物体属性的判断。
2 . 方法介绍
PhyMAGIC的核心想法很直观:如果静态图片中的信息不够,就让物体先动起来。
5. 总结
PhyMAGIC并不把生成视频当作真实世界的标准答案。生成视频仍然可能包含偏差,但它可以提供静态图片中不存在的时间信息。
这项工作重新定义了视频生成模型在物理推断中的角色:它不仅可以负责产生最终内容,也可以作为一种主动探测工具,为后续推理提供新的观察角度。
整个框架不需要针对特定材料重新训练,可以替换其中的图生视频模型、视觉语言模型、3D重建模块和物理模拟器。这种模块化设计也使它能够随着基础模型的发展继续升级。
目前,PhyMAGIC仍然受到单图3D重建质量的影响。较薄的结构和复杂拓扑可能导致物理粒子分布不准确。视觉语言模型对物理参数的估计也主要是定性和近似的,尚不足以处理高频振动和精确摩擦系数等问题。此外,当前系统主要关注前景物体,还没有完整覆盖复杂关节结构和密集多物体交互。
未来,我们希望进一步利用探针视频与模拟结果之间的视觉误差,直接优化物理参数,让“主动观察—物理推断—动态仿真”形成更紧密的闭环。
作者介绍
作者团队来自美国内华达大学里诺分校计算机科学与工程系和浙江大学软件学院,研究方向包括物理约束生成式人工智能、动态3D/4D生成、视频生成与可微物理仿真。