网易首页 > 网易号 > 正文 申请入驻

ECCV 2026|OmniColor:统一多模态线稿上色框架

0
分享至



该论文的第一作者为张栩禄,香港理工大学博士生,指导老师为李青教授,研究方向为图像与视频生成。迄今已在 ECCV、AAAI、ACM MM 等顶级会议发表多篇论文。本文通讯作者为魏骁勇教授,作者团队来自香港理工大学 PolySmart Group。

在动画和美术生产中,线稿上色是一个看似基础、却极其依赖细节控制的环节。创作者往往不是简单地把线稿涂上颜色,还需要理解角色身份、遵守局部色块约束、参考前后帧风格,并在连续片段中保持服装、发色、妆容和背景的一致性。尤其在现实工作中,控制信号通常是混合出现的,如文字描述、稀疏颜色提示、角色参考图、近期或远期的历史帧。

然而,现有的线稿上色方法大多围绕单一或少量控制信号设计,缺少一套统一的机制来理解多条件输入下的控制对齐。更复杂的是,不同控制信号之间可能发生冲突。例如,参考图希望角色保持人物风格,局部颜色涂鸦却要求某个区域改变颜色。因此,一个面向真实创作流程的上色系统,不能简单地把所有输入拼在一起,而需要判断每类信号在当前场景下应该发挥多大作用。

针对这一问题,ECCV 2026 接收的论文 OmniColor 提出了一个统一的多模态线稿上色框架。其核心思路是把复杂控制信号拆分为两类:需要严格空间对齐的条件,以及不追求像素对齐的语义参考条件。基于这两种分类,模型设计了针对性的编码策略、训练策略、冗余消除机制与自适应门控模块,从而支持任意组合的多模态控制。



图 1:OmniColor 统一着色能力展示。 给定线稿 L ,模型可以通过文本 T、颜色提示 C、身份参考 I 和 历史帧 H 的不同组合,生成准确的上色结果。



  • 论文标题:OmniColor: A Unified Framework for Multi-modal Lineart Colorization
  • 作者:张栩禄、杜昊谦、魏骁勇、李青
  • 机构:香港理工大学、四川大学
  • 会议:ECCV 2026
  • 论文链接:https://arxiv.org/abs/2603.27531
  • 代码:https://github.com/zhangxulu1996/OmniColor

OmniColor 的核心思路

OmniColor 将常见的上色输入信号划分为两类。第一类是空间对齐条件,包括输入线稿、用户提供的颜色提示,以及近期历史帧。这类信息和目标图像在空间位置上存在强对应关系,上色后的图像需要在边界、局部色彩、整体风格和几何结构上与输入条件保持精准一致。

第二类是语义参考条件,包括文本描述、角色身份参考图,以及长期历史帧。这些信号提供的是更抽象的语义约束,例如角色外观、整体配色、镜头氛围或长期一致性,但它们并不要求和当前输出逐像素对齐。

针对两类条件,OmniColor 设计了不同的编码路径。对于空间对齐条件,OmniColor 使用双编码器策略:一条路径利用 VAE 编码器保留颜色边界和高频细节,另一条路径通过 VLM 编码器提取局部语义。此时,模型既能关注线条、边缘和色块位置,也能理解这些局部区域在语义上属于头发、衣服、背景还是其他对象。

对于语义参考条件,OmniColor 只采用 VLM 编码,压缩后的语义 token 已经能够表达关键属性,而且这一设计还可以减少 token 数量,在一定程度上提升推理效率。



图 2:OmniColor 的架构,辅助信号分为空间对齐条件(蓝)和语义参考条件(绿)。空间对齐条件通过双编码器策略进行处理,语义参考条件仅使用VLM编码器处理,TRE 模块用于过滤冗余 token。MMDiT 主干网络通过 AS-Gate 模块融合这些特征,以解决输入冲突。模型通过 Flow Matching Loss 和 Dense Feature Alignment Loss 进行优化。

三个关键模块

确定整体编码路径后,OmniColor 进一步优化了空间条件控制精度、推理效率和条件冲突处理能力。

Dense Feature Alignment(DFA):强化空间约束。仅在 VAE 潜空间里使用标准生成损失,往往不足以保证局部结构的严格对齐。OmniColor 引入了 DFA 损失,利用 DINOv3 提取预测图像和真实图像的稠密特征,并利用 MSE 损失约束二者对齐。由于早期生成状态噪声较多,该方法将这一监督限制在较晚的去噪阶段。

Temporal Redundancy Elimination(TRE):历史帧冗余去除。动画序列里相邻帧往往包含大量重复的静止内容,把所有历史帧全部编码后,模型会接收大量冗余 token,既影响效率,也可能稀释真正有益的变化信息。TRE 机制将参考帧划分为多个 patch,计算相邻帧对应 patch 的颜色直方图相似度,过滤掉高度相似的冗余区域,再通过连通域分析提取最小包围框,获得多个发生变化的局部区域图像。此时,模型将接收「历史帧中发生变动的部分」。

Adaptive Spatial-Semantic Gating(AS-Gate):动态处理多条件冲突。多模态控制的难点不只是信息多,还在于信息可能互相矛盾。OmniColor 提出 AS-Gate 模块,根据空间分支的信息密度动态调节语义分支的影响。当线稿、色块或近期历史帧已经给出强空间约束时,模型可以降低部分语义参考的干扰;反之,模型则更多依赖语义参考。该门控被集成到 MMDiT 的注意力结构中,并通过零初始化的 LoRA 保证训练初期接近恒等映射。

实验结果:质量、控制和一致性同时提升

论文基于 25 部高质量动画序列构建了训练数据,得到 12 万对高质量样本;测试集来自 6 部未见过的动画,包含 305 个视频片段和 900 个图像级测试样本。

论文与三类方法进行了比较。在相同的输入条件下,OmniColor 表现出了更高的性能。此外,该方法支持控制信号的自由组合,同一张线稿可以任意结合文本、颜色提示、身份参考和历史帧,生成高质量结果。



表 1:与当前先进方法的定量比较。注:L = 线稿;T = 文本描述;C = 颜色提示;I = 身份参考;H = 序列生成;G = 使用每个片段的第一张真实图像作为参考。

在文本引导的上色测试中,该方法实现了文本遵循与线稿结构的对齐。相比之下,通用多模态生成模型可以理解提示词,却难以严格贴合线稿结构;传统线稿上色方法又通常缺少足够灵活的多模态组合能力。



图 3:基于提示词的线稿着色定性对比。OmniColor在结构保真度和提示词对齐方面表现更优。

参考图像着色结果展示了模型对角色身份和风格信息的保持能力。即使目标画面与参考画面之间存在角色旋转、镜头推近或拉远,以及明显的视角变化,模型仍能稳定恢复角色的面部特征、发色和服饰风格。



图 4:基于参考图像的线稿着色定性结果。即使在旋转、缩放等多种运动以及显著的视角变化下,OmniColor仍能保持稳定的身份一致性和风格一致性。

多模态控制实验体现了 OmniColor 的细粒度控制能力。加入身份参考后,角色妆容、发色等个体属性能够得到更准确的上色;加入颜色提示后,模型可以将局部色块信息传播到对应的语义区域。



图 5:多模态协同控制。结合线稿 L 和文本 T 与身份参考 I 及颜色提示 C 时的效果。

序列化生成体现出该方法在连续生成时的优势。当使用目标片段的第一帧作为空间参考时,生成效果与 GT 片段的相似性进一步提升。



图 6:序列生成可视化展示。该序列使用生成历史帧 H 以及目标片段的第 1 帧真实图像 G 生成。

最后,作者在真实线稿上进行了测试,并获得了出色的着色结果,展现出面向实际创作场景的应用潜力。



图 7:真实线稿上的视觉结果。

消融实验

消融实验结果显示,VLM-only 编码显著降低了推理延迟;DFA 损失增强了结构保真度;TRE 机制进一步减少了长期历史帧带来的 token 开销;最后加入的 AS-Gate 则取得了综合最优表现,说明自适应门控能够更好地平衡空间约束和语义参考。



表 3:消融实验。#Tokens 表示平均 token 开销。

结语


OmniColor 的贡献在于将这些输入信号纳入同一套框架,而不是为每种输入单独训练一个模型或设计一条独立流水线。这种统一性让模型能够适配更复杂的生产级场景,也为后续构建交互式 AI 上色工具提供了基础。随着未来推理速度进一步提升,并拓展到更抽象的草图或早期概念设计阶段,这类方法有机会成为动画、漫画和游戏资产生产中的高频辅助工具。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
多赚900万!这才是教科书经纪人!

多赚900万!这才是教科书经纪人!

柚子说球
2026-09-03 19:39:09
比亚迪韩国高速被现代追尾,结果韩国网友破防了

比亚迪韩国高速被现代追尾,结果韩国网友破防了

热点科技
2026-09-01 14:52:28
事关工资!吉林省最新通知!

事关工资!吉林省最新通知!

吉林日报
2026-09-03 20:08:05
特朗普政府被曝在尼泊尔山洪前一年削减当地灾害监测援助资金,美国务院回应

特朗普政府被曝在尼泊尔山洪前一年削减当地灾害监测援助资金,美国务院回应

红星新闻
2026-09-03 17:17:09
全面按下暂停键!日媒爆料:中国多所顶尖大学,叫停赴日交换生!

全面按下暂停键!日媒爆料:中国多所顶尖大学,叫停赴日交换生!

小涛叨叨
2026-09-04 03:42:33
51岁黄渤锁骨骨折消息曝光不到6小时,恶心的事情就发生了!

51岁黄渤锁骨骨折消息曝光不到6小时,恶心的事情就发生了!

叨唠
2026-09-04 00:01:53
“短剧一姐”又翻车,看了她翻拍的季洁,才明白郝蕾当年没有说错

“短剧一姐”又翻车,看了她翻拍的季洁,才明白郝蕾当年没有说错

清川逐影
2026-09-03 14:46:47
王菲最后那一拽,不是因为清醒,而是因为宋妍霏是“自己人”。

王菲最后那一拽,不是因为清醒,而是因为宋妍霏是“自己人”。

再来一杯冰美式
2026-09-02 23:14:38
首尔地铁现辛弃疾诗词,韩网民不满,官方回应

首尔地铁现辛弃疾诗词,韩网民不满,官方回应

自愈小日子
2026-09-03 13:20:40
首尔地铁出现中文诗词遭抨击,韩官员解释:供游客和市民欣赏

首尔地铁出现中文诗词遭抨击,韩官员解释:供游客和市民欣赏

观察者网
2026-09-03 11:48:08
基恩解释预期进球:好比你去夜店和一个姑娘搭讪一整晚,最后自己回家了;B费谈JJ加布里埃尔

基恩解释预期进球:好比你去夜店和一个姑娘搭讪一整晚,最后自己回家了;B费谈JJ加布里埃尔

MUREDS
2026-09-04 00:35:23
脸部是糖尿病的放大镜?医生说:脸部若有这 5 个异常,一定要注意

脸部是糖尿病的放大镜?医生说:脸部若有这 5 个异常,一定要注意

健康科普365
2026-08-29 16:35:05
5年2.3亿美金,成NBA尴尬的状元,你可能要被交易

5年2.3亿美金,成NBA尴尬的状元,你可能要被交易

篮球扫地僧
2026-09-04 00:06:28
中方一锤定音绕开哈国,两面派不准上车,中国划红线:专治不服

中方一锤定音绕开哈国,两面派不准上车,中国划红线:专治不服

时光在作祟
2026-05-17 05:04:58
余承东:阔折叠比例被模仿后,含金量会提升!雷军:新形态中折叠!徐洁云:“我有一个同行朋友,学习能力挺强的,大家不要嘲笑他”

余承东:阔折叠比例被模仿后,含金量会提升!雷军:新形态中折叠!徐洁云:“我有一个同行朋友,学习能力挺强的,大家不要嘲笑他”

大白聊IT
2026-09-03 23:28:14
赶走美军5年后,塔利班喊话美国:欢迎重开驻喀布尔使馆

赶走美军5年后,塔利班喊话美国:欢迎重开驻喀布尔使馆

凤凰卫视
2026-09-01 15:37:08
直达五四广场!青岛地铁8号线南段即将通车

直达五四广场!青岛地铁8号线南段即将通车

刘哥谈体育
2026-09-04 00:19:48
1961年,陆小曼生活拮据连鸡蛋都吃不起,却变卖大衣宴请3位男子吃螃蟹,酒过三巡她开口吐露:我想求你们一事

1961年,陆小曼生活拮据连鸡蛋都吃不起,却变卖大衣宴请3位男子吃螃蟹,酒过三巡她开口吐露:我想求你们一事

唠叨说历史
2026-09-01 14:39:31
墨菲称没有人愿意在中国连打三站比赛,赵心童回应:我喜欢在中国比赛

墨菲称没有人愿意在中国连打三站比赛,赵心童回应:我喜欢在中国比赛

尘语者
2026-09-03 16:13:04
藏得太深!上海向南,正在悄悄造一个新中心

藏得太深!上海向南,正在悄悄造一个新中心

娱乐圈见解说
2026-09-04 05:08:33
2026-09-04 05:43:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13913文章数 142729关注度
往期回顾 全部

科技要闻

英伟达129亿美元拿下Hugging Face

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

教育
游戏
本地
健康
家居

教育要闻

文科院士,受聘985

《食人鲨2》正式公布!新预告亮相 2027年发售

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

脑梗能否取栓,关键看这几点!

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版