忘记密码?
其他方式登录

单样本校准、零推理开销,免训练LoRA合并框架上线 | ICML'26

2026年9月10日

详细介绍

AIGC相关创作中,多个LoRA合并到一起,画风串味、角色崩坏几乎是必然。

LoRA(Low-Rank Adaptation)是目前最主流的轻量化微调方式:不动底座模型,只训练一对低秩矩阵,就能让扩散模型学会一个角色、一种画风或一类编辑操作。训练成本低,分享方便,社区里已经积累了数以万计的LoRA。能力越多,“把多个LoRA合并成一个”的需求就越自然。

研究团队用一个实验把这种干扰可视化了:给合并模型输入不同任务的指令,看每个LoRA模块被激活的强度。理想情况应该是一条干净的对角线——哪个任务的指令,就只激活哪个LoRA。但用DARE合并的模型,激活图一片通红:一个指令进来,所有模块都被唤起,信号在共享参数空间里四处“串音”。

SSR的全称是Subspace Signal Routing(子空间信号路由)。整个方法不需要训练,分三步。

模型合并这个领域,过去几年的方法大多带一个或多个需要手调的系数——合并权重、稀疏比例、缩放因子,效果好不好,很大程度上看调参的手感。SSR最不一样的地方在于:路由器R不是设计出来的,是推导出来的。

单任务保真只是底线,真实需求往往是组合:一句提示词里要同时出现2~4个特定主体。研究团队构造了100条组合指令(K均匀分布在2/3/4),用Grounding DINO检测每个主体是否真的画出来了,并对检出区域计算与真值的相似度——没被画出来的主体直接计零分。

研究团队构造了一个精细人脸编辑基准:口红、腮红、眼影三个独立的编辑LoRA,合并后一次性上妆。测试集100张FFHQ人像,以商业修图软件串行执行三个操作的结果作为参考答案。

此外,附录里还有三组值得一提的验证:合并规模扩展到K=21时SSR仍保持77%以上的恢复率;从哩布哩布(Liblib)平台直接下载三个真实社区LoRA(打光、人像美化、人像风格化)做合并,SSR的CLIP分数0.821为全部方法最高;甚至在扩散模型之外的GLUE语言理解基准上,SSR也以80.9的平均分超过所有合并基线——说明“路由”这个视角不只适用于图像生成。

SSR也有它的边界。一是它优化的是局部线性重建目标,理论上不保证完整非线性扩散过程的全局最优——实验里这个局部最优已经非常接近上限,但极端条件下差距仍可能拉大。二是当被合并的任务之间存在严重的域冲突或高度语义重叠时,信号本身就难以区分,路由的难度随之上升,性能可能下降。

第一,LoRA合并是“能力资产化”的关键一环。社区里数以万计的LoRA是真正的资产——每一个背后都是数据、算力和审美调校。但资产只有能组合才有复利。过去几年,“合并不掉干扰”这件事把大量组合需求挡在了门外,或者逼着大家在串行执行和效果折损之间做选择。SSR证明了一种新的可能性:合并可以是无训练、有理论保证、零额外推理开销的标准操作,合并产物就是一个普通LoRA,工程接入成本几乎为零。对需要落地人像编辑、风格化等能力的业务来说,这意味着“下载即可合并、合并即可上线”。

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论