跳至内容
返回

论文阅读:LTFE(AAAI 2026)——液态时序特征演化(Single-DGOD)

发布于:

论文:Simulating Distribution Dynamics: Liquid Temporal Feature Evolution for Single-Domain Generalized Object Detection(arXiv 2511.09909 / AAAI 2026) 作者:Zihao Zhang(天津大学)、Yang Li(天津大学)、Aming Wu*(合肥工业大学,通讯)、Yahong Han(天津大学) 定位:武老师组“模拟派”的第三条技术路线——甩开文本/VLM,回到纯视觉时序演化:把域偏移建模成“特征随时间连续演化”的过程,用 LSTM + Neural ODE/液态神经网络(LNN)动态生成卷积核


背景:为什么“离散模拟”不够了

批判对象(两个)

① 离散数据增强(DIV/UFR 等):一次性扰动,捕捉不到连续渐变
② 静态文本 prompt(SE-COT 等 VLM 方法):
    - 同样是"静态"的,描述不了连续演化
    - 依赖目标域的文本先验(如 rainy night 的描述)
    - 这与 Single-DGOD 的假设冲突:目标域是【未知】的,哪来的文本先验?

核心观察:真实域偏移是连续、渐进的——晴 → 多云 → 雨,特征分布是“流动”的,不是跳变的。

两条动机

  1. 连续性可建模:渐进高斯扰动(模糊逐渐加强、噪声逐渐衰减)可以模拟特征从源域到目标域的流动轨迹;
  2. 液态神经网络(LNN)天生动态:LNN 的 ODE 式连续演化适合“根据时序信息动态调整演化路径”。

核心思想:连续时序特征演化(LTFE)

流程总览(对应论文 Fig. 2 / Algorithm 1):

F0(backbone 第 1 层特征)
  ↓ PTFE:迭代扰动(模糊↑ + 噪声↓)→ 特征序列 {F1,...,FT}
  ↓ TDM:LSTM 建模时序依赖 → 时序编码 {Ht}
  ↓ LPE:Neural ODE/LNN 动态生成卷积核 Wt → 调整特征 → {F̂t}
  ↓ TFAM:类内一致 + 类间可分,保证演化不毁语义
  ↓ F̂T → backbone 2~4 层 → RPN → 检测

实验证明:在第一层特征上演化、再用它生成 2~4 层效果最好(和 SE-COT/MR-DCoT 的选择一致——浅层=风格/退化信息)。


image-20260826012201881

模块①:PTFE——渐进时序特征演化

大白话:把“晴天→雨夜”的渐变,模拟成对特征图做 T 步的“逐渐变糊 + 逐渐加噪(但噪声快速衰减)”的迭代。

Ft=G(σt)Ft1+ξtG(σt)(1)F_t = G(\sigma_t) \circledast F_{t-1} + \xi_t \cdot G(\sigma_t) \tag{1} G(σt)=12πσt2exp(i2+j22σt2)(2)G(\sigma_t) = \frac{1}{2\pi\sigma_t^2} \exp\left(-\frac{i^2+j^2}{2\sigma_t^2}\right) \tag{2}

两个对抗的调度(模拟“从精细到粗糙”的真实退化):

公式行为直觉
噪声强度 ξt\xi_tξt=ξ0exp(κt)\xi_t = \xi_0 \exp(-\kappa t)ξ0=0.2\xi_0=0.2κ=0.2\kappa=0.2 (3)指数衰减噪声是“启动扰动”,很快退场
模糊强度 σt\sigma_tσt=σ0λt\sigma_t = \sigma_0 \lambda^tσ0=1\sigma_0=1λ=1.2\lambda=1.2 (4)指数增长模糊是“主导退化”,逐渐加强

第一项 G(σt)Ft1G(\sigma_t) \circledast F_{t-1} 逐步模糊模拟视觉退化;第二项 ξtG(σt)\xi_t \cdot G(\sigma_t) 注入快速衰减的高斯噪声。


模块②:TDM——时序依赖建模

大白话:特征序列不是一堆独立的图,而是“一条演化轨迹”——用 LSTM 记住“之前演化到哪了”,让每一步演化都参考历史。

ht,ct=LSTM(Ft,ht1,ct1)(5)h_t, c_t = LSTM(F_t, h_{t-1}, c_{t-1}) \tag{5} Ht=ReLU(Wp[htFt])(6)H_t = ReLU(W_p [h_t \oplus F_t]) \tag{6}
  • (5) LSTM:隐藏态 hth_t 抓当前步抽象,细胞态 ctc_t 存长期记忆
  • (6) 特征-状态融合:把 LSTM 记忆和原始特征拼接投影 → 时序编码 HtH_t,捕捉从 F1F_1FTF_T 的演化模式

模块③:LPE——液态参数演化(核心中的核心,“Liquid”的真正含义)

大白话:域偏移越大,特征就演化得越“久”、卷积核就变得越“远”——用一个连续动态系统(Neural ODE)按需生成卷积核,而不是固定核。

ODE 动态生成卷积核

dW(τ)dτ=f(W(τ),Ht)(7)\frac{dW(\tau)}{d\tau} = f(W(\tau), H_t) \tag{7} Wt=ODESolve(f,W0,Ht,τ)(8)W_t = ODESolve(f, W_0, H_t, \tau) \tag{8}
  • ff:向量场,用**液态神经网络(LNN)**实现——卷积核沿虚拟时间 τ\tau 连续演化
  • W0W_0:初始核(继承 Faster R-CNN 预训练权重)
  • 求解器:四阶 Runge-Kutta(RK4)

演化时间自适应(最妙的设计)

τ^=Ht2maxHt2(9)\hat{\tau} = \frac{\|H_t\|_2}{\max \|H_t\|_2} \tag{9}

τ^\hat\tau 由当前时序编码的 L2 范数归一化决定——时序偏差越大(Ht2\|H_t\|_2 大)→ 核演化越久 → 对显著域偏移的适应性越强

残差调整(保语义):

F^t=Conv2D(F0,Wt)+F0(10)\hat{F}_t = Conv2D(F_0, W_t) + F_0 \tag{10}
  • 用动态生成的 3×33\times3 核卷积原始特征 F0F_0残差连接保留原始语义
  • 训练时生成全序列 {F^t}t=1T\{\hat F_t\}_{t=1}^T推理只用 F^T\hat F_T(中间步是给 LSTM 学演化动力学的)

模块④:TFAM——时序特征对齐

大白话:演化不能把语义演丢了——同一个物体,演化前和演化后必须是“同一个东西”(类内一致),不同类之间还得分得开(类间可分)。

做法:F0 喂 RPN 出候选框 O,F0 和最终特征 F^T\hat F_T 分别 ROI 出实例特征 PinP^{in}P^in\hat P^{in}

Lintra=1Ni=1NP(i)inP^(i)in22(11)L_{intra} = \frac{1}{N}\sum_{i=1}^{N} \|P^{in}_{(i)} - \hat{P}^{in}_{(i)}\|_2^2 \tag{11} Linter=logexp(s(P(i)in,P^(i)in))jiexp(s(P(i)in,P^(j)in))(12)L_{inter} = -\log \frac{\exp(s(P^{in}_{(i)}, \hat{P}^{in}_{(i)}))}{\sum_{j \neq i} \exp(s(P^{in}_{(i)}, \hat{P}^{in}_{(j)}))} \tag{12} Lalign=λ1Lintra+λ2Linter,λ1=1.0, λ2=0.1(13)L_{align} = \lambda_1 L_{intra} + \lambda_2 L_{inter}, \quad \lambda_1=1.0, \ \lambda_2=0.1 \tag{13}
损失大白话
LintraL_{intra} (11)演化前后同一个实例特征要近(别演着演着变样了)
LinterL_{inter} (12)不同实例特征要远(类别可分性保持)

网络架构(冻结/未冻结标注)

⚠️ 与 SE-COT/MR-DCoT 不同:LTFE 没有冻结 backbone——论文未提任何冻结/CLIP 初始化,整个网络端到端训练(SGD,20 epochs)。

输入图像(源域)

Backbone 第 1 层(🔥 训练)→ F0
   ↓(拦截:F0 转去旁路加工)
┌──────────────────────────────────────────────┐
│ 旁路加工(LTFE 核心)                          │
│ ① PTFE:迭代扰动(高斯模糊 🔇 + 噪声)          │
│    → 特征序列 {F1...FT}                        │
│ ② TDM:LSTM(🔥)→ 时序编码 {Ht}              │
│ ③ LPE:Neural ODE/LNN 向量场 f(🔥)           │
│    → 动态生成核 Wt = ODESolve(f, W0, Ht, τ̂)   │
│    → F̂t = Conv2D(F0, Wt) + F0(🔥)           │
│ ④ TFAM:类内一致 + 类间可分(对齐损失)          │
└──────────────────────────────────────────────┘
   ↓(续走:推理时只演化 T=2 步)
Backbone 第 2~4 层(🔥 训练)→ RPN → 检测头(🔥)

预测框 + 类别

冻结状态一览表

组件状态说明
Backbone(全部)🔥 未冻结论文未提冻结,端到端训练
高斯模糊核 G(σ)🔇 固定高斯核函数,无参数
LSTM(TDM)🔥 训练时序依赖建模
LNN/ODE 向量场 f(LPE)🔥 训练动态生成卷积核
初始核 W0🔥 训练继承预训练 Faster R-CNN,继续优化
RPN + 检测头🔥 训练标准检测组件

关键设计解读

  1. 全网络可训练:没有冻结层(与 SE-COT 冻结 1-3 层、MR-DCoT 冻结 CLIP 权重不同)——LTFE 的卖点是“演化动力学”整体学习,不需要冻结主干保语义;
  2. 预训练知识只在 W0:初始卷积核继承 Faster R-CNN 预训练权重,作为 ODE 演化的起点;
  3. 推理也走旁路:推理时 T=2 步演化(LSTM/LNN 前向参与)——和其他论文“推理零开销”不同,这是“测试时特征自适应”。

总损失与训练/推理

Ltotal=Lcls+Lreg+Lalign(14)L_{total} = L_{cls} + L_{reg} + L_{align} \tag{14}
阶段行为
训练T=8 步演化(充分模拟演化轨迹);端到端优化,动态核由 ODE 生成
推理只演 2 步(T=2)——真实测试样本已处于某种偏移状态,2 步是轻量补偿;LNN/ODE 前向生成核,不更新任何参数(测试时特征自适应,非测试时训练)

推理成本:Table 4 显示 Ours(Res101) 6.4 FPS / 325G FLOPs——比 UFR(6.9 FPS)略慢但远快于 C-Gap(2.5)/ PDOC(2.2),且 mAP 更高。

训练 vs 推理路径对比(Algorithm 1)

训练(T=8):
F0 → PTFE 8 步 → {F1...F8} → LSTM 完整序列建模(学动力学)
     → 每步 ODE 生成核 {W1...W8} → 调整出 {F̂1...F̂8}(全序列)
     → L_cls + L_reg + L_align 反向传播,更新所有参数

推理(T=2):
F0 → PTFE 2 步 → {F1, F2} → LSTM 前向 2 步(只用,不学)
     → 生成 1 个核 W_test → 调整出 F̂2
     → 直接分类+定位(无损失、无梯度、无参数更新)
维度训练推理
演化步数T=8(充分模拟完整轨迹)T=2(轻量补偿)
LSTM处理完整 8 步序列,权重参与训练(学演化动力学)前向跑 2 步得到 H_t,只调用不学习
卷积核每步 ODESolve 生成 8 个核 {W₁…W₈},调整出全序列 F̂₁…F̂₈只生成 1 个核 W_test,调整出最终特征 F̂₂
损失/梯度L_cls + L_reg + L_align 全部反向传播无梯度、无参数更新
目的让模型见过“从源域到深层退化”的完整轨迹,学会演化+适应动力学把测试特征推回模型熟悉的分布区域,轻量对齐

为什么推理只要 2 步就够了?

训练 8 步:源域 F0 是"干净的",要一路演到深层退化 → 让模型见过完整轨迹
推理 2 步:真实测试样本【本身已经处于某种偏移状态】(它已经是雨夜了!)
           → 不需要从头演到底,只需要"沿着学过的演化方向轻推 2 步"
           → 把特征推回"训练时见过的分布区域"里,检测就稳了

论文原话:推理时做 “limited perturbations to fine-tune adaptation to the real target domain and bridge the gap between simulated training and true distributions”——注意是 fine-tune(微调补偿),不是重新演化。步数再多会破坏目标域语义

“测试时自适应”自适什么?(容易误解)

Wtest=ODESolve(f,W0,Ht,τ^)W_{test} = ODESolve(f, W_0, H_t, \hat{\tau})
  • 推理核是输入自适应的:每个测试样本根据它自己的演化状态(H_t 的 L2 范数)决定演化时间 τ^\hat\tau,生成自己的核
  • 偏移大的样本 → τ^\hat\tau 大 → 核演化久 → 调整幅度大;偏移小的样本 → 调整小
  • 所以“自适应” = 参数不动(不是 TTT),但每个样本的处理强度不同(输入条件化)

与 MR-DCoT 推理的设计取舍

LTFEMR-DCoT
推理2 步特征演化(有前向成本,换来输入自适应)零开销标准前向(训练练好的静态鲁棒)
自适应方式测试时按样本动态调整(输入条件化核)无(靠训练内化的纠错能力)
代价6.4 FPS(Table 4)推理零额外开销(Table XIII)

创新点总结(与 SE-COT / MR-DCoT 对照)

维度SE-COT (CVPR25)MR-DCoT (TPAMI26)LTFE (AAAI26)
范式文本模拟模拟+流形回归连续时序模拟(纯视觉)
文本/VLM✅ CLIP+ChatGPT✅ 双链用文本完全不用
扰动方式AdaIN 风格注入扩散模糊+U-Net渐进模糊+噪声迭代(PTFE)
自适应机制静态学 (μ,σ)文本预测 (μ,σ)Neural ODE/LNN 动态生成卷积核
时序建模无(只有链式)LSTM(TDM)
纠错/对齐原型增强内容原型锚定投影 HTFAM 类内/类间对齐
推理标准前向标准前向(零开销)2 步演化(测试时特征自适应)

实验

设置

  • 基准:Diverse Weather(只训 Day Clear)+ Real-to-Art(VOC → Clipart/Watercolor/Comic)
  • 检测器:Faster R-CNN;骨干 Res50 / Res101 / Swin-T
  • 训练:SGD(momentum 0.9)20 epochs,lr 0.02,2×RTX 3090,输入 800×800;训练 T=8,推理 T=2

主结果(Table 1,mAP%)

方法Day ClearNight SunnyDusk RainyNight RainyDay Foggy
Faster R-CNN48.134.426.012.432.0
S-DGOD56.136.628.216.633.5
UFR58.640.833.219.239.6
SE-COT55.442.039.224.540.6
LTFE (Res101)58.443.139.724.341.2
LTFE (Swin-T)64.253.146.533.446.4

Real-to-Art(Table 2,mAP%):Res101 下 Comic 35.4 / Watercolor 58.2 / Clipart 42.1(比 SE-COT Clipart +4.7);Swin-T 37.3 / 61.3 / 44.5。

持续测试时自适应对比(Table 3)——独特实验

方法Night SunnyDusk RainyNight RainyDay Foggy
ECPG(TTA)35.335.718.233.7
LTFE43.139.724.341.2

论文用“测试时特征演化”对标持续测试时自适应(TTA)方法——说明 LTFE 的推理演化确实有自适应味道,且比显式 TTA 方法更强(Night Sunny 35.3→43.1)。

效率(Table 4)

模型mAP 均值参数FPSFLOPs
Faster R-CNN26.290.8M4.7267G
PDOC32.6198.6M2.2478G
UFR33.2184.2M6.9323G
LTFE (Res101)37.1140.6M6.4325G

消融(Table 5)

配置Day ClearNight SunnyDusk RainyNight RainyDay Foggy
Baseline49.235.427.513.732.6
+ PTFE54.636.829.314.133.6
+ PTFE + TDM+LPE57.342.639.422.740.8
+ PTFE + TFAM56.840.234.119.736.5
完整模型58.443.139.724.341.2

分析:PTFE 单独用提升有限;TDM+LPE 是最大增益来源(动态核演化大幅提升);TFAM 单独加在 PTFE 上也有用;完整模型最优——动态控制演化轨迹最接近真实分布偏移。

超参 T:训练时增大 T 模拟更完整的演化轨迹,T=8 最优;推理 T=2 即可(再多会破坏目标域语义)。


一句话总结

LTFE 把 Single-DGOD 的域偏移建模成连续时序特征演化:用渐进模糊+噪声(PTFE)造演化轨迹,LSTM(TDM)记时序依赖,Neural ODE/LNN(LPE)按需动态生成卷积核自适应调整特征,TFAM 保证演化不丢语义;推理时只演 2 步做测试时特征自适应——不靠文本、不靠扩散、不靠原型,纯视觉时序一条路走到底。


相关资料

延伸阅读

  • 对比学习(TFAM 的 L_inter 类间可分性为对比形式)

在以下平台分享此文章:

上一篇
论文阅读:DSD(ICML 2026)——流形扩展与双重对齐的时序蒸馏
下一篇
论文阅读:MR-DCoT(TPAMI 2026)——原型锚定的流形回归(Single-DGOD)