忘记密码?
其他方式登录

浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26

2026年8月19日

详细介绍

图像生成模型正从「会创作」转向「可操作」。

论文:https://arxiv.org/abs/2604.07230

项目:https://nenhang.github.io/PhyEdit

代码:https://github.com/nenhang/PhyEdit

模型权重:https://huggingface.co/ruihangxu/PhyEdit

RealManip-40K:https://huggingface.co/datasets/ruihangxu/RealManip-40K

下面的机械臂没有出现在训练数据中。用户给出一条弯曲轨迹后,PhyEdit在不同目标点生成关键状态,再由视频模型补齐中间画面。

能力一:在复杂遮挡下精确落位

PhyEdit使用Qwen-Image-Edit作为生成backbone。用户选择目标物体并给出三维位移后,冻结的3D model估计深度和相机参数,把masked pixels反投影成点云,在三维空间中移动,再投影为preview。

团队构建了RealManip-40K,包含41,154对真实源图和目标图,提供深度、mask和代表性三维坐标,覆盖远近变化、遮挡切换和多物体操作。

PhyEdit对「physically-grounded」的定义并非完全的物理仿真:显式模块处理刚体位移、投影、尺度和深度顺序,不计算力、碰撞或动力学。透明反光物体、极端近景移动以及严重的深度和分割错误仍是失败来源。

论文由浙江大学ReLER团队完成。第一作者为浙江大学计算机科学与技术学院本科生许瑞航。ReLER团队长期致力于人工智能领域的前沿研究,包括但不限于生成模型、多模态学习、AI+X等方向。

https://arxiv.org/abs/2604.07230

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论