忘记密码?
其他方式登录

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

2026年8月26日

详细介绍

近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文《V-RAE: Rethinking Video Latent Spaces for Generation》中提出视频表征自编码器 V-RAE。该方法以冻结的视觉基础模型为编码器,通过轻量级时间池化压缩视频特征,并将具有丰富语义和时间连续性的表征直接用于视频重建、生成与未来预测。

最佳模型分别达到 117.86 gFVD(UCF101) 和 19.16 gFVD(K600)。更值得关注的是训练效率:在 UCF101 上,V-RAE 大约只需要 3 万次更新,就能够达到传统 VAE 约 15 万次更新的生成水平;在 K600 上,最高观察到约 6× faster convergence

作者介绍

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论