浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26
详细介绍
图像生成模型正从「会创作」转向「可操作」。
论文:https://arxiv.org/abs/2604.07230
项目:https://nenhang.github.io/PhyEdit
代码:https://github.com/nenhang/PhyEdit
模型权重:https://huggingface.co/ruihangxu/PhyEdit
RealManip-40K:https://huggingface.co/datasets/ruihangxu/RealManip-40K
下面的机械臂没有出现在训练数据中。用户给出一条弯曲轨迹后,PhyEdit在不同目标点生成关键状态,再由视频模型补齐中间画面。
能力一:在复杂遮挡下精确落位
PhyEdit使用Qwen-Image-Edit作为生成backbone。用户选择目标物体并给出三维位移后,冻结的3D model估计深度和相机参数,把masked pixels反投影成点云,在三维空间中移动,再投影为preview。
团队构建了RealManip-40K,包含41,154对真实源图和目标图,提供深度、mask和代表性三维坐标,覆盖远近变化、遮挡切换和多物体操作。
PhyEdit对「physically-grounded」的定义并非完全的物理仿真:显式模块处理刚体位移、投影、尺度和深度顺序,不计算力、碰撞或动力学。透明反光物体、极端近景移动以及严重的深度和分割错误仍是失败来源。
论文由浙江大学ReLER团队完成。第一作者为浙江大学计算机科学与技术学院本科生许瑞航。ReLER团队长期致力于人工智能领域的前沿研究,包括但不限于生成模型、多模态学习、AI+X等方向。
https://arxiv.org/abs/2604.07230
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0
