2026-07-20 16:17:00

2024级硕士研究生赖勇文在王超群副教授指导下,研究成果《AnyStyle: A Single LoRA is Sufficient for Image-Guided Style Transfer》被ECCV 2026录用。该成果简介如下:

(1)研究背景

图像引导的风格迁移旨在将风格参考图的艺术特征精准应用到内容参考图上,同时保留内容图的语义结构与布局。近年来,基于Stable Diffusion、FLUX等扩散模型的LoRA微调技术已成为个性化风格生成的主流选择。为了实现内容与风格的解耦,现有方法大多采用双LoRA策略(即分别独立微调 Content LoRA 与 Style LoRA,推理时再将两者权重融合)。然而,这种设计存在明显问题:

• 融合冲突与解耦难题:独立优化的两个LoRA存在复杂的权重纠缠,推理时极其依赖繁琐的融合系数调优,极难达到理想的内容-风格平衡。

• Content LoRA 的高成本与低效:专门训练Content LoRA不仅增加额外的微调开销,且在内容结构保持和视觉感知质量上的表现,往往不如直接利用预训练模型内部Attention提取的免训练结构指导(Training-free Structural Guidance)。


AnyStyle可视化效果图

(2)技术方案与结果

针对上述问题,本研究提出了极简且高效的图像风格迁移框架 AnyStyle。该框架彻底放弃了复杂的Multi-Adapter融合范式,转而采用“单风格 LoRA Adapter + 注意力调制(Attention Modulation)”的联合设计,主要包含以下创新:

 针对性的Single-Style LoRA范式:研究发现在 DiT Backbone(如 FLUX)中,后部的 Single-Stream Transformer Blocks 更适合编码高层语义与风格属性。AnyStyle 仅在后部Blocks(11–38 层)采用DreamBooth-LoRA 进行风格微调,以极低的微调成本精准捕捉目标风格的颜色、纹理与艺术特征。

 Query-Only 注意力调制的结构指导:在推理阶段,通过辅助路径提取 Content 图像的 Query 张量(Qc)并与生成路径的 Qt 进行动态融合。研究证实,仅调制 Query 即可精准锁住画面布局与物体结构,同时避免 Content 图像的风格泄漏。此外,引入了随 TimeStep 递减的动态时间衰减机制,实现在去噪前期噪声大时锁定结构,去噪后期赋予风格渲染充分的自由度。

实验在包含 400 组风格迁移组合的基准数据集上展开。AnyStyle 在 Prompt Alignment、Content Alignment 和 Style Alignment 等多项客定量化指标上均显著超越了包括 Dual-LoRA、B-LoRA、UnZipLoRA 和 StyleID 在内的代表性 Baseline。同时,在 70 人参与的定性主观用户评测(User Study)中,AnyStyle 获得了最高的偏好率。定性结果直观表明,AnyStyle 能够以极高的稳定性和可控性,生成兼具内容结构忠实度与艺术风格一致性的高质感图像。


AnyStyle框架总览


AnyStyle 算法图

(3)总结与展望

AnyStyle 重新审视了扩散模型风格迁移中的内容-风格解耦范式,证明了“单个风格 LoRA 配合免训练的结构指导即可实现风格迁移”。通过打破 Multi-Adapter 融合带来的复杂纠缠与不稳定性,该框架为图像风格化生成提供了更为简单、稳定且高效的新思路。

未来,研究团队将进一步探索 AnyStyle 在更多生成模型架构(如视频扩散模型)上的迁移能力,以及在更具挑战性的跨模态风格控制任务中的扩展应用。


论文地址:https://arxiv.org/pdf/2607.04677,代码已开源:https://github.com/Yvan1001/AnyStyle。