忘记密码?
其他方式登录

ECCV 2026|OmniColor:统一多模态线稿上色框架

2026年8月28日

详细介绍

该论文的第一作者为张栩禄,香港理工大学博士生,指导老师为李青教授,研究方向为图像与视频生成。迄今已在 ECCV、AAAI、ACM MM 等顶级会议发表多篇论文。本文通讯作者为魏骁勇教授,作者团队来自香港理工大学 PolySmart Group。

图 1:OmniColor 统一着色能力展示。 给定线稿 L ,模型可以通过文本 T、颜色提示 C、身份参考 I 和 历史帧 H 的不同组合,生成准确的上色结果。

OmniColor 将常见的上色输入信号划分为两类。第一类是空间对齐条件,包括输入线稿、用户提供的颜色提示,以及近期历史帧。这类信息和目标图像在空间位置上存在强对应关系,上色后的图像需要在边界、局部色彩、整体风格和几何结构上与输入条件保持精准一致。

图 2:OmniColor 的架构,辅助信号分为空间对齐条件(蓝)和语义参考条件(绿)。空间对齐条件通过双编码器策略进行处理,语义参考条件仅使用VLM编码器处理,TRE 模块用于过滤冗余 token。MMDiT 主干网络通过 AS-Gate 模块融合这些特征,以解决输入冲突。模型通过 Flow Matching Loss 和 Dense Feature Alignment Loss 进行优化。

确定整体编码路径后,OmniColor 进一步优化了空间条件控制精度、推理效率和条件冲突处理能力。

论文基于 25 部高质量动画序列构建了训练数据,得到 12 万对高质量样本;测试集来自 6 部未见过的动画,包含 305 个视频片段和 900 个图像级测试样本。

表 1:与当前先进方法的定量比较。注:L = 线稿;T = 文本描述;C = 颜色提示;I = 身份参考;H = 序列生成;G = 使用每个片段的第一张真实图像作为参考。

图 3:基于提示词的线稿着色定性对比。OmniColor在结构保真度和提示词对齐方面表现更优。

图 4:基于参考图像的线稿着色定性结果。即使在旋转、缩放等多种运动以及显著的视角变化下,OmniColor仍能保持稳定的身份一致性和风格一致性。

图 5:多模态协同控制。结合线稿 L 和文本 T 与身份参考 I 及颜色提示 C 时的效果。

图 6:序列生成可视化展示。该序列使用生成历史帧 H 以及目标片段的第 1 帧真实图像 G 生成。

图 7:真实线稿上的视觉结果。

消融实验结果显示,VLM-only 编码显著降低了推理延迟;DFA 损失增强了结构保真度;TRE 机制进一步减少了长期历史帧带来的 token 开销;最后加入的 AS-Gate 则取得了综合最优表现,说明自适应门控能够更好地平衡空间约束和语义参考。

表 3:消融实验。#Tokens 表示平均 token 开销。

OmniColor 的贡献在于将这些输入信号纳入同一套框架,而不是为每种输入单独训练一个模型或设计一条独立流水线。这种统一性让模型能够适配更复杂的生产级场景,也为后续构建交互式 AI 上色工具提供了基础。随着未来推理速度进一步提升,并拓展到更抽象的草图或早期概念设计阶段,这类方法有机会成为动画、漫画和游戏资产生产中的高频辅助工具。

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论