跳至内容
返回

论文速览手册

发布于:

存储所读论文的精简内容(一句话核心 + 方法要点 + 关键结果),便于快速回顾。


1. CDSD / S-DGOD(CVPR 2022)

📄 完整笔记

基本信息:Single-Domain Generalized Object Detection in Urban Scene via Cyclic-Disentangled Self-Distillation|Wu & Deng(西安电子科技大学)

一句话核心:首次提出 Single-DGOD 任务;用循环解耦在无域标签下拆出域不变特征(DIR),再用自蒸馏把 DIR 灌回骨干中间层,提升未知域泛化。

任务:只用白天晴天一个源域训练检测器,泛化到夜晚/雨/雾等未见目标域(Diverse-Weather,7 类)。

image-20260825150548722

方法要点

  1. 循环解耦:骨干特征 Fb 经 EDIR/EDSR 拆成域不变 Fdi + 域特有 Fds;再反向解耦一次(Fdi→Fi2i/Fi2s,Fds→Fs2i/Fs2s),用对比损失(全局 Lgc + 实例 Lic)逼两个提取器分干净——不需要域标签;
  2. DIR 自蒸馏:Fdi 当老师,蒸馏到骨干中间层 F1/F2/F3——特征级 Lfc(L2 距离)+ 分类级 Lcc(KL 散度),让中间层也富含域不变信息;
  3. 推理:只用 Fdi 分支做检测(丢弃 Fds)。

关键公式

L=Lrpn+Lcls+Lloc+λ(Lcd+Lsd),λ=0.01L = L_{rpn} + L_{cls} + L_{loc} + \lambda(L_{cd} + L_{sd}), \quad \lambda=0.01

(Lcd = Lgc + Lic 循环解耦;Lsd = Lfc + Lcc 自蒸馏)

结果(mAP%)

测试域Faster R-CNNCDSD提升
Night-sunny33.536.6+3.1
Dusk-rainy26.628.2+1.6
Night-rainy14.516.6+2.1
Daytime-foggy31.933.5+1.6

贡献:① 定义 Single-DGOD 任务与 Diverse-Weather 基准;② 无域标签的循环解耦;③ 基于 DIR 的自蒸馏。

与后续工作的关系:武老师组“模拟派”起点——SE-COT/MR-DCoT/LTFE 都在它定义的基准上对比;消融显示自蒸馏是主要增益来源(Daytime-sunny 48.7→56.1)。

链接


2. SE-COT(CVPR 2025)

📄 完整笔记

基本信息:Style Evolving along Chain-of-Thought for Unknown-Domain Object Detection|Zihao Zhang、Aming Wu、Yahong Han(天津大学/西电)|arXiv:2503.09968

一句话核心:用文本 CoT(词→短语→句子)生成逐步丰富的风格描述,经 CLIP 编码 + AdaIN 注入源域特征模拟未知域风格;配合风格/内容解耦和类原型保持语义。

任务:Single-DGOD(同 CDSD 基准)——只训白天晴天,泛化到夜晚/雨/雾等未知域。

image-20260825233537841

方法要点

  1. CoT 风格演化(3.1):文本三级演化 词→短语→句子,CLIP 逐级累加文本特征 Ft1/Ft2/Ft3;AdaIN 注入(μt,σt 由文本学出),造“雨夜”等风格样本;
  2. 风格/内容解耦(3.2):EStyle/EContent 拆 Fs/Fc;Ld 对比损失(拉近 F1↔Fs、推远 F1↔Fc)+ Lsc 风格一致(对齐源域文本)+ Lgc 内容一致(对齐类原型);
  3. 类特定原型(3.3):软分配+残差聚类出每类原型,增强内容特征并监督解耦。

关键公式

Ft1=Etext(Wir),Ft2=Etext(Pr)+Ft1,Ft3=Etext(Sr)+Ft2F_t^1 = \sum E_{text}(W_i^r), \quad F_t^2 = E_{text}(P_r) + F_t^1, \quad F_t^3 = E_{text}(S_r) + F_t^2

Fi=σtFsμ(Fs)σ(Fs)+μt(AdaIN),Ltc=1sim(Fi,Ft3)F_i = \sigma_t \odot \frac{F_s - \mu(F_s)}{\sigma(F_s)} + \mu_t \quad (AdaIN), \quad L_{tc} = 1 - sim(F_i, F_t^3)

结果(mAP%,Res101)

Day ClearNight SunnyDusk RainyNight RainyDay Foggy
SE-COT55.442.039.224.540.6
(SE-COT Swin-T)64.452.749.533.744.9

贡献:① 首次把 CoT 引入风格演化(文本逐级丰富);② 风格/内容解耦三损失;③ 类特定原型增强+监督。

与后续工作的关系:MR-DCoT(TPAMI 2026)是它的期刊扩展版(Simulation→Regression 闭环、视觉-文本双链);LTFE 批评其“依赖目标域文本先验”。

链接


3. MR-DCoT(TPAMI 2026)

📄 完整笔记

基本信息:Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection|Zihao Zhang、Aming Wu、Yang Li、Yahong Han(天津大学/合工大)|arXiv:2607.07192

一句话核心:把 Single-DGOD 重新定义为流形回归问题——视觉-文本双链 CoT 造“离流形难样本”,再用类特定原型锚定的投影算子 H 把它们拉回源域语义流形(Simulation→Regression 闭环)。

任务:Single-DGOD(Diverse-Weather + Real-to-Art + 零样本域自适应分割)。

image-20260826003356581

方法要点

  1. DFE 解耦(模块①):Es/Ec 拆 Fs/Fc + 正交约束 L_dis + 风格一致性 L_sc;
  2. Dual-CoT 造难样本(模块②):文本链(CoT 三级 + AdaIN 注入)+ 视觉链(高斯模糊扩散前向 + 文本引导 U-Net 去模糊),融合成离流形特征 Fe;
  3. 流形回归 MR(模块③):软分配+残差聚合出类原型 P_k(流形锚点);投影算子 H 把离流形特征拉回原型邻域(L_global 对比 + L_local 残差)。

关键公式

Ltotal=Ldet+Lemb+Lalign+Ldiff+LregL_{total} = L_{det} + L_{emb} + L_{align} + L_{diff} + L_{reg}

Pk=WpVkVk2,Lreg=Lglobal+λlocLlocalP_k = W_p \frac{V_k}{\|V_k\|_2}, \quad L_{reg} = L_{global} + \lambda_{loc}L_{local}

结果(mAP%,Res101)

Day ClearNight SunnyDusk RainyNight RainyDay Foggy
MR-DCoT56.247.442.228.142.8
(MR-DCoT Swin-T)65.154.653.236.448.3

贡献:① 范式升级:Simulation→Regression 闭环;② 视觉-文本双链 CoT(补结构退化模拟);③ 原型锚定流形回归(学纠错而非穷举扰动)。

与后续工作的关系:SE-COT 的 TPAMI 期刊扩展版(更全面);五框架(Faster R-CNN/YOLO/DiffusionDet/GLIP-T/DINO)通用。

链接


4. LTFE(AAAI 2026)

📄 完整笔记

基本信息:Simulating Distribution Dynamics: Liquid Temporal Feature Evolution for Single-Domain Generalized Object Detection|Zihao Zhang、Yang Li、Aming Wu、Yahong Han(天津大学/合工大)|arXiv:2511.09909

一句话核心:把域偏移建模成连续时序特征演化——渐进模糊+噪声造演化轨迹(PTFE)、LSTM 记时序依赖(TDM)、Neural ODE/LNN 动态生成卷积核(LPE)、TFAM 保语义;推理时 2 步演化做测试时特征自适应。

任务:Single-DGOD(Diverse-Weather + Real-to-Art),纯视觉时序(不用文本/VLM)。

image-20260826012201881

方法要点

  1. PTFE 渐进时序演化Ft=G(σt)Ft1+ξtG(σt)F_t = G(\sigma_t) \circledast F_{t-1} + \xi_t G(\sigma_t)——模糊指数增长(λ=1.2)+ 噪声指数衰减(κ=0.2),模拟“从精细到粗糙”的连续退化;
  2. TDM 时序依赖:LSTM 建模特征序列,捕捉演化轨迹长程依赖;
  3. LPE 液态参数演化(核心):Neural ODE/LNN 动态生成卷积核 Wt=ODESolve(f,W0,Ht,τ^)W_t = ODESolve(f, W_0, H_t, \hat\tau)——域偏移越大演化越久;F^t=Conv2D(F0,Wt)+F0\hat F_t = Conv2D(F_0, W_t) + F_0(残差保语义);
  4. TFAM 对齐:类内一致性 + 类间可分性,保证演化不丢语义。

关键公式

Ltotal=Lcls+Lreg+LalignL_{total} = L_{cls} + L_{reg} + L_{align}

结果(mAP%,Res101)

Day ClearNight SunnyDusk RainyNight RainyDay Foggy
LTFE58.443.139.724.341.2
(LTFE Swin-T)64.253.146.533.446.4

贡献:① 连续时序演化(PTFE)模拟真实渐变退化;② 液态参数演化(LPE,Neural ODE/LNN 动态核);③ 推理 2 步演化(测试时特征自适应)。

与后续工作的关系:武老师组“模拟派”最新一支——甩开文本,纯视觉时序;推理有前向成本(6.4 FPS),与 MR-DCoT“零开销”形成取舍。

链接


5. Cauvis(NeurIPS 2025)

📄 完整笔记

基本信息:Towards Single-Source Domain Generalized Object Detection via Causal Visual Prompts|Chen Li、Huiying Xu、Changxin Gao、Zeyu Wang、Yun Liu、Xinzhong Zhu(华科/浙师大/西工大/南开)⚠️非武老师组|arXiv:2510.19487

一句话核心:冻结 DINOv2 + 视觉提示(交叉注意力,理论等价 Pearl 后门调整)+ 傅里叶双分支适配器,抑制伪相关、不造任何合成数据(因果干预派)。

任务:Single-DGOD(Diverse-Weather)+ Cityscapes-C 损坏鲁棒性(mPC)。

方法要点

  1. Cross-Attention Prompts(4.1):提示=独立于图像域的“伪模态”信号,交叉注意力与图像融合;SVD 把注意力分解为因果子空间(top-k 奇异方向)与伪相关(小奇异值),软阈值过滤——等价后门调整 P(y^do(X))=zP(y^X,z)P(z)P(\hat y|do(X))=\sum_z P(\hat y|X,z)P(z)
  2. Dual-Branch Adapter(4.2):因果分支(MLP 映射提示激活→因果特征 yi=σ(MLP(p~i))y_i=\sigma(MLP(\tilde p_i)))+ 傅里叶分支(FFT 高通/相位滤波提取域不变高频);
  3. 训练极省:只用标准交叉熵损失,不加显式解耦/对抗损失;冻结 DINOv2 只调 ~1% 参数。

关键公式

A=UΣV(SVD 因果子空间),yi=σ(MLP(p~i))A = U\Sigma V^\top \quad (SVD\ 因果子空间 ), \quad y_i = \sigma(MLP(\tilde p_i))

结果(mAP%,DINOv2+DINO)

Day ClearNight SunnyDusk RainyNight RainyDay Foggy
Cauvis73.761.264.647.656.5

贡献:① 首次把 DINOv2 当 SDGOD backbone;② 因果视角建立伪相关→泛化下降的理论框架;③ 交叉注意力提示等价后门调整 + 双分支适配器。

与后续工作的关系:因果干预派(不造数据)vs 武老师组模拟派;⚠️ 高分含 DINOv2 红利(消融:去掉后 Avg 60.7→34.2),和 Res101 系比数字需谨慎。

链接


6. DSD / LMPNet(ICML 2026)

📄 完整笔记

基本信息:Beyond Point Predictions: Manifold Expansion and Dual Alignment for Robust Time Series Distillation|Junyao Hong、Zesheng Lai、Xinyi Xiao、Suyang Zhou、Aodong Shen、Youyong Kong(东南大学)|ICML 官方页面

一句话核心:时间序列结构蒸馏——蒸馏该传“结构关系”而非“逐点数值”;LMP-Net(流形扩展)做轻量学生 + 双流形对齐(SPKD 拓扑 + OT 几何)+ RAAD 防负迁移。

任务:长时序预测(LTSF)蒸馏——轻量学生追赶 Transformer 教师(8 数据集:ETT 家族/Electricity/Traffic/Weather/Exchange)。

方法要点

  1. LMP-Net(模块①,学生):Expand-Evolve-Contract(升维→演化→收缩),Cover 定理——高维空间易建模非线性,0.18M 参数保持近线性;
  2. Dual Manifold Alignment(模块②):Macro-SPKD(样本间关系/拓扑对齐,Gram 矩阵)+ Micro-OT(token 细节/几何对齐,Sinkhorn 软匹配)——解决教师 token 与学生 point 粒度不匹配;
  3. RAAD(模块③):regime 先验(验证集选 κ)+ 置信度门控(g=exp(−ηe))——教师预测不可靠时“敢关掉预测蒸馏”,防负迁移。

关键公式

Ltotal=(1κKD)Ltask+κKDLKD+LalignL_{total} = (1-\kappa_{KD})L_{task} + \kappa_{KD}L_{KD} + L_{align}

结果(MSE,越低越好):DSD 稳定提升学生:ETTh1 0.452→0.430(-4.87%)、Weather 0.254→0.246;0.18M 学生超 13.89M 教师(ETTh1 0.472 vs 0.488,快 15 倍)。

贡献:① 结构蒸馏 > 逐点匹配(负迁移分析);② 双流形对齐(拓扑 + 几何);③ RAAD 防负迁移(regime + 置信度双层过滤)。

与课题的关系:蒸馏方法论教材(“怎么蒸得稳”)——检测蒸馏可借鉴:结构对齐代替简单特征对齐、教师不可靠时按域/样本关蒸馏(CD-FKD 的弱点)。

链接


7. TimeDistill(KDD 2026)

📄 完整笔记

基本信息:TimeDistill: Efficient Long-Term Time Series Forecasting with MLP via Cross-Architecture Distillation|Juntong Ni、Zewen Liu、Shiyu Wang、Ming Jin、Wei Jin(Emory/Griffith)|ACM DOI

一句话核心跨架构蒸馏——Transformer/CNN 教师 → 纯 MLP 学生;用多尺度(时域下采样)+ 多周期(频域 FFT)双视角,在预测级+特征级双层面对齐;理论:KD ≈ mixup 增广。

任务:长时序预测(LTSF)——8 数据集(ECL/ETT×4/Solar/Traffic/Weather),轻量 MLP 追赶 Transformer 精度。

image-20260826022255176

方法要点

  1. 多尺度蒸馏(时域):预测/特征逐级下采样(stride=2 Conv)多级 MSE 对齐——学生学“粗看细看都像教师”;
  2. 多周期蒸馏(频域):FFT → 振幅 → 冷温度 softmax → 周期分布,KL 散度对齐——学生学“哪些周期占主导”;
  3. 理论(Theorem 4.1/4.2):监督+蒸馏 ≈ mixup 增广上界——目标软化带来泛化/稳定收益。

关键公式

L=Lsup+α(LscaleY+LperiodY)+β(LscaleH+LperiodH)L = L_{sup} + \alpha(L^Y_{scale} + L^Y_{period}) + \beta(L^H_{scale} + L^H_{period})

结果:7/8 数据集 MSE 最优、全部 MAE 最优;超教师最多 +5.37%、超无蒸馏 MLP 最多 +13.87%;7× 推理加速、130× 少参数(vs Autoformer 196×)。

贡献:① 首个跨架构 KD 的时序蒸馏框架;② 多尺度+多周期(时频双域);③ KD≈mixup 理论分析。

与课题的关系:跨架构蒸馏方法论(“怎么蒸得全”)——检测迁移点:FPN 多尺度对齐(对应多尺度蒸馏)、频域蒸馏(对应多周期)、大检测器→轻量检测器(对应跨架构)。

链接


8. SARD(CVPR 2026)

📄 完整笔记

基本信息:Structure-Aware Representation Distillation for Tiny-Dense Object Segmentation|Liu 等|代码

一句话核心:微型密集目标分割的结构感知蒸馏——不走“模仿 mask”,从教师特征算一张“哪里重要”的结构图(边界显著性 + 几何复杂度 + 空间密度),再按重要性加权做“点对点特征一致 + 去噪分数匹配分布对齐”,让学生把容量花在几何关键位置。

任务:微型密集目标分割(岩石碎片/细胞/烟羽——每图数千个小而互相接触的物体),Cityscapes + ADE20K + RockFrag(极端密集挑战基准)。

SARD 教师-学生蒸馏架构

方法要点

  1. 结构重要性图 S(i)(核心,式 5-9):对教师特征 FT 做 Sobel 梯度 → 结构张量 J=cF(c)F(c)J=\sum_c\nabla F^{(c)}\nabla F^{(c)\top}(特征值 λ1λ2\lambda_1\ge\lambda_2)→ 三分量 E=λ1λ2E=\lambda_1-\lambda_2(边界显著性)、C=λ1λ2C=\lambda_1\lambda_2(交点/角点)、DD(局部特征离散度,密度代理)→ S=αeE+αcC+αdDS=\alpha_eE+\alpha_cC+\alpha_dD → 归一化 W(i)=S(i)/jS(j)W(i)=S(i)/\sum_jS(j)——不需要实例标注,兼容半监督;
  2. L_FC 特征一致性(式 11):师生特征各经 1×1 卷积投影到共享空间,按 W 加权的点对点 L2——W(i) 大的边界/密集区误差被放大(梯度大),背景区域学习信号被稀释;
  3. L_DA 分布对齐(式 12-13):教师特征加噪 F~T=αˉF^T+1αˉε\tilde F^T=\sqrt{\bar\alpha}\hat F^T+\sqrt{1-\bar\alpha}\,\varepsilon,轻量去噪头 g(两层卷积)用学生特征预测噪声——去噪分数匹配 ≈ 逼近教师特征的 log-密度梯度,学点值之外的“局部分布形状”;
  4. 任务监督(式 14):学生解码器 DS(FS)MSD_S(F_S)\to M_SLtask=Dice+BCEL_{task}=Dice+BCE 对真值(无 GT 的图只算 L_repr)。

关键公式

S(i)=αeE(i)+αcC(i)+αdD(i),W(i)=S(i)jS(j)S(i)=\alpha_eE(i)+\alpha_cC(i)+\alpha_dD(i),\qquad W(i)=\frac{S(i)}{\sum_j S(j)} Lrepr=λfiW(i)F^S(i)F^T(i)22+λdiW(i)g(F^S(i))ε(i)22L_{repr}=\lambda_f\sum_i W(i)\|\hat F^S(i)-\hat F^T(i)\|_2^2+\lambda_d\sum_i W(i)\|g(\hat F^S(i))-\varepsilon(i)\|_2^2

结果(mIoU/bIoU%):Cityscapes 80.3/76.1、ADE20K 46.9/40.8、RockFrag 60.2/47.3(vs CWD +4.3/+6.7,越密集增益越大);架构通用(Swin-L→Swin-T、SAM-H→EfficientSAM-Ti、Mask2Former-L→R50 均 +1.51.8 mIoU/+2.32.7 bIoU);消融:均匀加权 → 结构加权 +4.8 mIoU,E/C/D 全组合最优;ViT-T(5.7M)反超 SegFormer-B1;ResNet-50 蒸馏后 7.7× 参数减少、9× 吞吐

贡献:① 结构重要性图空间加权蒸馏(E/C/D 互补,别均匀对齐);② 去噪分数匹配做分布级特征对齐(学“分布”不止“点值”);③ 微型密集分割新基准 RockFrag;④ 教师只出特征、任意分割大模型通用、推理零额外开销(5~25M 学生)。

与课题的关系:检测蒸馏可直接借鉴——“哪里重要就加权哪里”:小目标/密集交通/物体边界应加权(CD-FKD 等均匀对齐的弱点);分布对齐呼应 DSD“结构 > 数值”但实现不同;教师无关(SAM/Mask2Former 也可当异构特征老师)。

链接


9. UCOD-MKD(CVPR 2026)

📄 完整笔记

基本信息:Beyond Weak Supervision: MLLMs-Guided Graded Knowledge Distillation for Unsupervised Camouflaged Object Detection|Huafeng Chen、Chenguang Zhu、Yueming Lyu、Caifeng Shan(南京大学/西工大)|代码

一句话核心无监督伪装目标检测(UCOD)——用冻结的 MLLM(CA-CoT 分步推理出框)+ SAM(出候选掩码)当“免费教师”,GME 按候选掩码一致性把伪标签分成高/正常/低三档(丢弃低质量),GKD 再按质量做图像级与像素级差异化蒸馏轻量学生——全程零人工标注。

任务:无监督伪装目标检测(COD:岩石上的蛇、叶子里的昆虫等融入环境的物体),完全不用像素级/人工标注;CAMO + COD10K + NC4K。

UCOD-MKD 教师-学生框架

方法要点

  1. CA-CoT(模块①):纯文本 5 步思维链引导 MLLM(Qwen2.5-VL 3B)找伪装物——全局场景 → 推断伪装类型 → 粗锚定 → 几何精确定位 → 返回 bbox(缓解 MLLM 幻觉/抖动,几乎零额外成本);
  2. GME(模块②,无参数):SAM 对同一 box 出 3 个候选掩码,用两两 IoU+SSIM 相似度 SIM=12(IoU+SSIM)SIM=\frac12(IoU+SSIM) 评估质量 SjS_j,分三档 Qj=0/1/2Q_j=0/1/2Sj<0.6S_j<0.6 丢弃)——候选掩码越一致 = SAM 分割越稳定 = 质量越高;
  3. GKD 图像级(式 5):低质量 Qj=0Q_j=0 用 Self-KD(L1(P,P)L_1(P,P'),图像内容还有价值);正常 Qj=1Q_j=1 用 CE 监督;高质量 Qj=2Q_j=2 用 CE+L1+MSE 三重强监督;
  4. GKD 像素级(式 6-8):候选掩码平均置信度 Vˉ\bar V → 熵 EiE_i → 权重 Mi=1EiM_i=1-E_i(边界等摇摆像素降权);另把框外像素当可靠背景先验单独监督(MLLM 失败主要是过度定位,框外几乎一定是背景)。

关键公式

Qj={0if Sj<0.6(低质量丢弃)1if 0.6Sj<0.9(正常)2if Sj0.9(高质量)Q_j = \begin{cases} 0 & \text{if } S_j < 0.6 \quad (\text{低质量}\to\text{丢弃})\\ 1 & \text{if } 0.6 \le S_j < 0.9 \quad (\text{正常})\\ 2 & \text{if } S_j \ge 0.9 \quad (\text{高质量}) \end{cases} LGKD=iLIeKD(Pi,Vi)Mi+iS~LIeKD(Pi,Si)L_{GKD} = \sum_i L_{IeKD}(P_i, V_i)\cdot M_i + \sum_{i\in\tilde S} L_{IeKD}(P_i, S_i)

结果(无监督方法,CAMO:MAE↓/Sm↑/Em↑/Fw↑):FOUND 0.127/0.701/0.784/0.606、UCOS-DA 0.129/0.685/0.782/0.584、UCOD-DPL 0.085/0.764/0.833/0.701 → UCOD-MKD 0.071/0.809/0.875/0.753(MAE 比 UCOD-DPL 降 16%+),零样本设置也有效。

贡献:① 首个用“MLLM + SAM 免费大模型知识”做 UCOD 的教师-学生框架;② CA-CoT 任务定制推理链缓解 MLLM 幻觉;③ GME 无参数分级(quality over quantity,候选一致性 ≈ 质量);④ GKD 图像级/像素级按质量差异化蒸馏;⑤ 推理纯轻量学生,教师零额外开销。

与课题的关系:蒸馏方法论新弹药——“教师不一定要同构大网络”(MLLM/SAM 可当异构知识源);按质量分级学呼应 DSD 的 RAAD“教师不可靠就少学”(强信号强学、弱信号弱学/自蒸馏兜底);过滤低质量伪标签对应负迁移防护。

链接


10. UniRain(CVPR 2026)

📄 完整笔记

基本信息:UniRain: Unified Image Deraining with RAG-based Dataset Distillation and Multi-objective Reweighted Optimization|Qianfeng Yang、Qiyuan Guan、Xiang Chen 等(大连工业大学/南京理工)|arXiv:2603.03967代码

一句话核心统一图像去雨(一个模型同时处理白天/夜间 × 雨线/雨滴四类退化)——发现”200 万+ 对公开雨图直接混合训练反而更差”,于是 ① 用 RAG+VLM 离线”蒸馏”出 2.6% 高质量样本(RainRAG);② asymmetric MoE(soft 编码 + hard 解码)建模多样退化;③ 训练按各退化类型损失收敛斜率动态重加权,让四类同步收敛。

任务:统一图像去雨(DRS/DRD/NRS/NRD 四类)+ 扩展到雨雪雾 all-in-one;真实基准 RealRain-1k、RainDS-real-RD、WeatherBench。

UniRain 框架

方法要点

  1. RAG 数据蒸馏(核心,注意非综述里”合成数据集”那类蒸馏):真实雨图(无 GT)当”质量标准”建库 → 查询图经三级分层检索(CLIP 文本 L2 → CLIP 视觉余弦 → SSIM)收紧参考集 → 3 个 VLM(InternVL2.5-8B/LLaVA-NeXT-7B/MobileVLM-3B)多数投票判合成样本是否”接近真实分布”——>200 万对筛到 2.6%(52,869 对)RainRAG;
  2. Asymmetric MoE:Encoder 用 soft-MoE(连续路由,全局池化+高斯噪声负载均衡)穷尽探索多样化退化线索;Decoder 用 hard-MoE(Top-k 硬路由)聚焦结构与细纹理重建——消融 27.54→28.93 PSNR,soft+soft 反而不如;
  3. Multi-objective Reweighted:四类退化当四个目标,滑动窗口 N=10 内对归一化 loss 做最小二乘回归估计收敛斜率 λ_i → TBS(收敛快的降权/慢的升权,拉齐收敛)+ TSS(发散/震荡类型降权)+ AF(早期 TBS 主导、后期 TSS 介入)→ 只动标量权重、可移植(PromptIR +0.97 dB)。

关键公式

ωi(t)=AF(t)TBSi(t)+(1AF(t))TSSi(t)\omega_i(t)=AF(t)\cdot TBS_i(t)+\big(1-AF(t)\big)\cdot TSS_i(t)

结果:RainRAG 四类平均 PSNR 28.93(URIR 27.91 / NeRD-Rain 27.65 / Restormer 27.89,DRD 上 +1.35dB);真实基准 RealRain-1k 36.51;FLOPs 126.5G / Params 24.4M(低于 Restormer/DRSformer);all-in-one WeatherBench 26.01(TransWeather 24.70)。

贡献:① 首个 RAG+VLM 数据级”蒸馏”(真实图当质量标准筛合成数据);② asymmetric MoE(soft 编码穷尽探索 + hard 解码聚焦重建);③ 多目标收敛斜率重加权(TBS/TSS/AF,仅标量权重);④ 统一四类雨况 + 雨雪雾扩展。

与课题的关系:有 GT 场景下”质量分级放哪”的另一种答案——训练前离线筛数据(2.6% 高质量子集)而不是 UCOD 式在损失层分级;对 SDGOD 的启发:风格化/扩散合成样本可做离线保真筛选;多目标按子集损失收敛斜率动态调权可平衡各模拟域训练(现有 SE-COT/MR-DCoT/LTFE 都是等权混合,无人做);⚠️ RAG 依赖真实参考库,Single-DGOD 目标域未知时只能借鉴思想不能照搬。

链接


在以下平台分享此文章:

上一篇
论文阅读:MR-DCoT(TPAMI 2026)——原型锚定的流形回归(Single-DGOD)
下一篇
KL散度:信息论视角下概率分布对齐工具,原理、辨析与论文实战