跳至内容
返回

论文阅读:UniRain(CVPR 2026)——RAG 数据蒸馏与多目标重加权的统一图像去雨

发布于:

论文:UniRain: Unified Image Deraining with RAG-based Dataset Distillation and Multi-objective Reweighted Optimization(arXiv 2603.03967,2026-03) 作者:Qianfeng Yang、Qiyuan Guan、Xiang Chen、Jiyu Jin、Guiyue Jin、Jiangxin Dong(大连工业大学 / 南京理工) 定位统一图像去雨(unified image deraining)——一个模型同时处理”白天雨线/雨滴 + 夜间雨线/雨滴”四类退化。用 RAG(检索增强生成)+ VLM 做数据集蒸馏(筛数据)解决混合数据质量参差,用多目标重加权优化解决多退化类型训练不平衡。


一句话总结

UniRain 发现”把 >200 万对公开雨图直接混合训练反而更差”(质量参差 + 类型不平衡),于是:① 用 RAG+VLM 从海量混合数据中离线”蒸馏”出 2.6% 高质量样本(RainRAG 数据集)→ ② 用 asymmetric MoE(soft 编码 + hard 解码)建模多样退化 → ③ 训练时按退化类型的收敛斜率动态重加权,让四类退化同步收敛,最终统一去雨 + 扩展到雨雪雾 all-in-one。


背景与动机(两个”统一”难题)

难题一:数据。 去雨数据集(合成 + 真实)超过 200 万对,但质量参差:

直接合并所有 public 数据集训练 → 数据量 ↑ 但质量参差
  → 低质样本给出不准的监督 → 干扰收敛、弱化跨雨况泛化(Fig.1b PSNR 反而下降)

难题二:模型/优化。 四类退化(DRS 白天雨线 / DRD 白天雨滴 / NRS 夜间雨线 / NRD 夜间雨滴)难度与收敛速度不同:

同一优化目标训练 → 模型偏向简单类型(夜间雨线收敛快)
  → 复杂类型(白天雨滴)欠优化 → 各类恢复质量不均(Fig.1c,d)

大白话:堆数据不行(脏数据多),一刀切训练不行(类型不平衡)。所以要”筛出干净数据” + “按类型动态平衡训练”。


image-20260905111134994

组件①:RAG-based Dataset Distillation(数据蒸馏管线,核心创新)

该阶段的目的是真实图没有GT,合成图有GT,但是合成图可能质量太差,所以我们用真实图去选择高质量合成图

术语提醒:这里的 “Dataset Distillation” 不是 dataset-distillation 综述里”用合成小数据集压缩学习信号”那类方法,而是 “从海量公开数据中检索 + VLM 评估 + 筛选高质量训练子集”(更接近 data selection / data refinement)。共两个阶段:

检索阶段(Retrieval)——用真实雨图当”质量标准”

建库:真实世界雨图(无 GT)I_r
  → BLIP 上下文编码器生成文本描述 T_r
  → CLIP 视觉编码器提取特征 f_r
  → 存关系三元组 (T_r, f_r, I_r) → 数据库 D_r

查询:查询图 I_q 同样生成三元组 (T_q, f_q, I_q)
  → 三级分层检索,逐步收紧:
    ① 语义相似  s_txt(q,r) = ‖ψ(T_q) − ψ(T_r)‖₂     (CLIP 文本 L2)   → top-K1 → C1
    ② 视觉相似  s_vis(q,r) = cos(f_q, f_r)            (CLIP 特征余弦)   → top-K2 → C2
    ③ 结构相似  s_perc(q,r) = SSIM(I_q, I_r)          (像素结构 SSIM)   → top-K3 → S(q)

三级从”语义/场景”→“外观/类别”→“像素结构”逐层逼近,保证检索到的真实参考与查询雨况一致。最后只把K3条喂给VLM

生成/评估阶段(Generation)——VLM 投票判质量

输入:查询图 I_q + 检索集 S(q) + prompt 模板 P → VLM
VLM 输出二元判断(该合成样本是否"可靠/接近真实分布")
集成:3 个 VLM 多数投票(InternVL2.5-8B / LLaVA-NeXT-7B / MobileVLM-3B)
      R̂_q = 1 当且仅当 ≥2 个模型判定可靠 (式 5)

数据质量金字塔(分层递进):

顶层:真实雨图(最可信,直接当参考)
中层:被 VLM 判定为"高质量、接近真实分布"的合成样本 → 留下训练
底层:低保真合成样本 → 丢弃

结果:>200 万对 → 保留约 2.6%(52,869 对),按 DRS/DRD/NRS/NRD 四个子集组织成 RainRAG 训练集;测试集 400 对按同流程筛选均分四类。

关键洞察:真实数据没有 GT 不能直接训练,但能当”质量标准”——用真实雨图做检索参考 + VLM 评判合成样本与真实的接近度,把”合成→真实”的鸿沟转成可操作的数据筛选。


组件②:Asymmetric MoE(非对称混合专家架构)

位置路由方式作用
Encodersoft-MoE:连续路由权重(全局池化 + 高斯噪声做负载均衡 + softmax,式 11-12)所有专家加权融合 → 穷尽探索多样的退化线索
Decoderhard-MoE:Top-k 硬路由(式 13-14)只激活最相关专家 → 高效聚焦结构与细纹理重建

消融(Table 6):无 MoE 27.54 PSNR → 全量 28.93;soft+soft 反而不如 hard+soft(soft 编码器全面探索 + hard 解码器选择性重建 = 互补)。


组件③:Multi-objective Reweighted Optimization(多目标动态重加权)

把”四类退化”当四个目标,训练中按收敛速度动态调权,让四类同步收敛:

1) 收敛斜率估计:滑动窗口 N=10 内对归一化 loss 做最小二乘线性回归 → 斜率 λ_i(t)
   λ<0 收敛中;λ>0 发散;|λ| 大 = 变化快

2) 三个指标:
   TBS(类型平衡分)= softmax(λ_i / Σ|λ_i|) 沿类型维
      → 收敛快的类型权重小、收敛慢的类型权重大 → 拉齐收敛
   TSS(类型稳定分)= softmax(−Σ|λ_i|) 沿类型维
      → 发散/震荡的类型降权 → 防止"快但发散的坏类型"拿高分
   AF(自适应因子)≈ 全局发散程度的 softmax
      → 训练早期全局都收敛 → AF 大 → TBS 主导;
        后期部分类型发散 → AF 小 → TSS 介入

3) 最终类型权重:ω_i(t) = AF(t)·TBS_i(t) + (1−AF(t))·TSS_i(t)

与”多任务梯度操作(PCGrad 等)/课程学习”同类家族,但简单在只动标量权重、只依赖 loss 斜率。消融:固定 AF=0.5 或去掉 TBS/TSS 均掉点(Fig.7);该策略可移植到 PromptIR 上 +0.97 dB,优于 continual learning(PIGWM)设定。


实验要点

结果
RainRAG 四类平均PSNR 28.93(URIR 27.91 / NeRD-Rain 27.65 / Restormer 27.89),DRD 上比 Restormer +1.35dB
真实基准RealRain-1k 36.51、RainDS-real-RD 33.74、WeatherBench 上领先
复杂度FLOPs 126.5G、Params 24.4M(低于 Restormer/DRSformer/NeRD-Rain)
RAG 消融only VLM 27.73 / w/o 检索 28.39 / w/o 生成 28.36 / full 28.93
泛化场景驾驶 / UAV / 海上场景视觉质量领先
扩展all-in-one weather(雨+雪+雾)WeatherBench PSNR 26.01(TransWeather 24.70 / Histoformer 24.59)

与我们课题(蒸馏 + 单域泛化目标检测)的关系

这篇任务不同(低层恢复 vs 高层检测),但它恰好回答了我们之前撞的墙——“有明确 GT 时,质量分级该放哪?”

1. 它的答案:把质量控制放到”离线数据构建层”,而不是”训练损失分级层”。 去雨的合成对有 GT(干净图),仍会因”合成真实度参差”拖累训练——和你们”源域有 GT、但风格化合成样本保真度参差”同构。UniRain 没有在 loss 层做三档路由,而是训练前用 RAG+VLM 一次性筛掉不可靠样本(2.6% 留下)。这给了 SDGOD 一个有 GT 时更自然的移植:对风格化/扩散合成样本做离线保真筛选(用固定代理打分,不随训练动态耦合),而不是 UCOD 式在损失上分级。

2. 多目标重加权视角(可能对 SDGOD 是新的):把”多种风格/域的合成子集”当多个训练目标,按各子集损失收敛斜率动态调权——解决”模型偏向简单的模拟域、复杂模拟域欠拟合”。你们现有方法(SE-COT/MR-DCoT/LTFE)都是等权混合模拟域训练,没人按收敛速度平衡各模拟域——这个机制(TBS/TSS/AF,仅标量权重、易实现)是可迁移的空白点。

3. 检索真实参考不可直接迁移 ⚠️:RAG 依赖”与目标分布一致的真实数据”建库;Single-DGOD 假设目标域未知、无真实数据可用——除非把”真实库”换成源域数据/通用语料(性质变弱)。此部分只能借鉴”参考引导评估”思想,不能照搬。

4. 与蒸馏主线的关系:UniRain 的”数据蒸馏”不是网络蒸馏;但它证明了 VLM 可当数据质量裁判(多模型投票)——呼应 UCOD-MKD 的 GME(模型一致性当质量代理),说明”大模型当质量裁判”是跨任务通用的趋势。


局限/批判

  • 测试集自筛风险:RainRAG 测试集 400 对用”同一套过滤流程”选出——与训练筛选同源,存在选择性偏差(自证式评估);好在还报了 3 个公开真实基准兜底。
  • VLM 判断是黑箱:“可靠”标签由 3 个 VLM 多数投票给出,prompt 主观、无标注可校验;若 VLM 系统性地偏爱某种雨况,筛出的数据会偏。
  • 成本:>200 万图 ×(BLIP/CLIP 编码 + 检索 + 3×VLM 推理),一次性成本可观(论文未报)。
  • 符号/venue 混乱:PDF 标 CVPR2026、正文表标 AAAI 2025、arXiv 编号 2603.03967,引用时需核实最终出处。
  • 对 SDGOD 的适用性边界:低层恢复的”质量”可由像素 GT 定义,检测的”域外样本保真”更复杂(要判语义保持);且其 VLM/文本依赖会撞上 LTFE 对”未知域文本先验”的批评。

相关资料


在以下平台分享此文章:

上一篇
信息压缩与信息瓶颈:从“文件变小”到“表示变干净”
下一篇
论文阅读:UCOD-MKD(CVPR 2026)——MLLM 引导的分级知识蒸馏无监督伪装目标检测