论文思路#
- RS2Change:以单幅遥感影像为基础,通过SAM等模型构建多模态控制条件,基于多模态条件生成第二时相图像,从而构造变化检测数据集
- 代表方法:ChangeBridge、Changen2
- Any2Change:以“语义分割、目标检测、实例分割”类型的数据集为基础,利用数据集内在条件,构造统一的生成框架,生成第二时相图像,从而将其转变为变化检测数据集
- Noise2Change:设计生成方式,从噪声中生成语义分割图等中间产物,再逐步生成双时相图像及对应变化掩码,从而构造变化检测数据集
数据集#
对比方法#
文献阅读#
遥感图像变化生成#
TPAMI 26 | Generating Any Changes in the Noise Domain#
论文链接:https://doi.org/10.1109/TPAMI.2025.3643733
代码链接:https://github.com/chiangliu/noise2change
作者单位:湖南大学
- 模型:从噪声域模拟变化,兼顾变化多样性和总体一致性。训练两个生成模型,A模型生成T1影像的语义分割图,根据预设地物比例构建T2影像语义分割图生成目标L,使用A模型生成T2影像的语义分割图,生成过程利用生成目标L逐步扰动采样噪声。B模型通过T1 T2影像的低分辨率语义掩码生成高分辨率语义掩码和对应影像,变化标签通过语义掩码得到
- 数据:Noise2Change-27k
CVPR 26 | ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Sensing#
论文链接:https://doi.org/10.48550/arXiv.2507.04678
代码链接:https://github.com/zhenghuizhao/ChangeBridge
作者单位:武汉大学
- 模型:利用Diffusion Bridge模型从事前影像生成事后影像,接受坐标文本、实例布局、语义分割图条件
TPAMI 25 | Changen2: Multi-Temporal Remote Sensing Generative Change Foundation Model#
论文链接:https://ieeexplore.ieee.org/document/10713915
代码链接:https://github.com/Z-Zheng/pytorch-change-models
作者单位:斯坦福大学
- 模型:从事前影像提取边界轮廓、语义分割图作为条件图,编辑条件图以模拟事件发生,通过事前影像和事后模拟条件图生成事后影像,基于双时相条件图计算变化掩码,并利用变化掩码调整事后分割图,使其仅在变化区域与事前图像不同
- 数据:
- Changen2-S1-15k:建筑变化监测,模型训练源为xView2
- Changen2-S9-27k:语义变化检测,模型训练源为OpenEarthMap
- Changen2-S0-1.2M:无类别变化检测,模型训练源为fMoW
ISPRS 25 | Open-vocabulary generative vision-language models for creating a large-scale remote sensing change detection dataset#
论文链接:https://doi.org/10.1016/j.isprsjprs.2025.04.023
代码链接:http://gpcv.whu.edu.cn/data
作者单位:武汉大学
CVPR 25 | The Change You Want To Detect: Semantic Change Detection In Earth Observation With Hybrid Data Generation#
论文链接:https://doi.org/10.1109/CVPR52734.2025.00211
代码链接:https://yb23.github.io/projects/cywd/
作者单位:古斯塔夫·埃菲尔大学
- 模型:HySCDG:基于FLAIR土地覆盖数据集和 BD TOPO 地理对象实例数据,构建遥感影像、语义分割图、实例对象掩码,随机选择实例对象对其掩码进行稍微扩展,并加入随机掩码区域,与遥感影像组合形成掩码图像;将实例对象在语义分割图中的最大凸包作为变化掩码,修改对应区域语义分割图中的类别作为语义分割图条件,构建文本描述(地物类型、时间地点)条件;SD接受掩码图像输入,以变化后的语义分割图和文本描述作为条件,生成变化后图像。
- 数据:FSC-180k
ICLRW Oral 25 | Tackling Few-Shot Segmentation in Remote Sensing via Inpainting Diffusion Model#
论文链接:https://doi.org/10.48550/arXiv.2503.03785
代码链接:https://github.com/SteveImmanuel/rs-paint
作者单位:TelePIX
- 模型:目标检测数据集的原始图像I、标签掩码M、目标地物包围框patch P作为训练素材,SD模型接受掩码后的原始图像作为输入,目标地物patch作为条件,SD恢复掩码掉的部分,输出目标为原始图像。通过控制不同的条件,生成地物的不同变体,实现少样本分割性能的提升
WACV 24 | SyntheWorld: A Large-Scale Synthetic Dataset for Land Cover Mapping and Building Change Detection#
论文链接:https://ieeexplore.ieee.org/abstract/document/10483785
代码链接:https://github.com/JTRNEO/SyntheWorld
作者单位:东京大学
- 数据生成方法:基于Blender进行建模,通过随机网格划分、规则放置、随机地形生成、可控纹理生成等手段,构建城市和自然两种场景,并施加变化,得到语义变化图
- 数据:SyntheWorld
遥感图像生成#
AAAI 26 | Any2RSI: Controllable Remote Sensing Text-to-Image Generation via Any Control and Enriched Description#
论文链接:https://doi.org/10.1609/aaai.v40i15.38283
代码链接:https://github.com/House-yuyu/Any2RSI
作者单位:武汉大学
- 模型:文本到遥感图像生成,支持软边界轮廓、硬边界轮廓、语义分割图作为条件输入
- 数据:RST2I-110K,115000个图像-文本对
论文链接:https://doi.org/10.48550/arXiv.2603.02172
作者单位:华盛顿大学
- 模型:点+点描述作为条件生成遥感图像,以DiT为主体架构,对注意力模块进行修改
自然图像变化生成#
WACV 25 | Improving Zero-Shot Object-Level Change Detection by Incorporating Visual Correspondence#
论文链接:https://doi.org/10.1109/WACV61041.2025.00855
代码链接:https://github.com/anguyen8/image-diff
作者单位:奥本大学
- 模型:变化检测模型
- 数据生成方法:收集OpenImages中的图像,使用LaMa移除图像中的一个物体,筛选被移除物体边界框占1%-4%的图像,施加[-10, 10]度旋转后随机裁剪,形成视角差异
- 数据:OpenImages-Inpainted
WACV 23 | The Change You Want to See#
论文链接:https://doi.org/10.1109/WACV56688.2023.00398
代码链接:https://www.robots.ox.ac.uk/~vgg/research/cyws
作者单位:牛津大学
- 模型:变化检测模型
- 数据生成方法:使用LaMa对COCO中的多个对象进行剔除,组合不同剔除对象的图片形成变化对,采用包含共同剔除对象的变化对和粘贴有额外对象的变化对来对抗剔除产生的伪影和噪声
- 数据:COCO-Inpainted
自然图像生成#
论文链接:https://doi.org/10.1109/ICCV51070.2023.00387
代码链接:https://www.wpeebles.com/DiT.html
作者单位:加州大学伯克利分校
CVPR 22 | High-Resolution Image Synthesis with Latent Diffusion Models#
论文链接:https://doi.org/10.1109/CVPR52688.2022.01042
代码链接:https://github.com/CompVis/latent-diffusion
作者单位:慕尼黑大学
ICLR 21 | Denoising Diffusion Implicit Models#
论文链接:https://openreview.net/forum?id=St1giarCHLP
代码链接:https://github.com/ermongroup/ddim
作者单位:斯坦福大学
ICML 21 | Improved denoising diffusion probabilistic models#
论文链接:http://proceedings.mlr.press/v139/nichol21a.html
代码链接:https://github.com/openai/improved-diffusion
作者单位:OpenAI
NeurIPS 20 | Denoising Diffusion Probabilistic Models#
论文链接:https://proceedings.neurips.cc/paper/2020/hash/4c5bcfec8584af0d967f1ab10179ca4b-Abstract.html
代码链接:https://github.com/hojonathanho/diffusion
作者单位:加州大学伯克利分校
ICML 15 | Deep Unsupervised Learning using Nonequilibrium Thermodynamics#
论文链接:http://proceedings.mlr.press/v37/sohl-dickstein15.html
代码链接:https://github.com/Sohl-Dickstein/Diffusion-Probabilistic-Models
作者单位:斯坦福大学
ICML 21 | Improved denoising diffusion probabilistic models 论文链接:http://proceedings.mlr.press/v139/nichol21a.html
代码链接:https://github.com/openai/improved-diffusion
作者单位:OpenAI
方法 DDPM 的 Log-likelihood 一直不高,该指标高往往表示生成模型能够覆盖更多中数据分布,本文通过一系列方法提高该指标
学习方差 本文发现 DDPM 的两种方差形式 $\sigma_t^2 = \beta_t$ 或 $\sigma_t^2 = \tilde{\beta}_t = \frac{1-\bar{\alpha}_{t-1}}{1-\bar{\alpha}_t}\beta_t$ 仅在接近 $t=1$ 附近时有显著差别,而损失值也在接近 $t=1$ 时快速下降
则通过学习在这两个方差间插值的形式进行优化,设:
$$ \Sigma_\theta(x_t,t)=\text{exp}(v\log\beta_t+(1-v)\log\tilde{\beta}_t) $$
模型学习并输出插值系数 $v$,损失函数因此变为:
$$ \begin{aligned} L_{hybrid}&=L_{simple}+\lambda L_{vlb}\\ L_{vlb}&=\begin{cases} −\log p_\theta(x_0 \mid x_1),&&t=0\\ D_{KL}(q(x_{t−1} \mid x_t, x_0) || p_\theta(x_{t−1} \mid x_t)),&&t>0 \end{cases} \end{aligned} $$
其中 $\lambda=0.001$,且在计算 $L_{vlb}$ 时,均值会被梯度截断,仅更新方差计算相关参数
优化噪声 Schedule $\beta_t$ 线性增加,在后半段图像基本均为噪声
优化为余弦形式
...
ICCV 23 | Scalable Diffusion Models with Transformers 论文链接:https://doi.org/10.1109/ICCV51070.2023.00387
代码链接:https://www.wpeebles.com/DiT.html
作者单位:加州大学伯克利分校
方法 前置技术:DDPM、IDDPM、CFG、LDM
DiT 设计:
遵循标准 Transformer 结构设计 遵循标准 ViT 最佳实践 输入:对于 $256 \times 256 \times 3$ 的图像,潜空间压缩后的 $z\in\mathbb{R}^{32 \times 32 \times 4}$ 分 Patch:patch size 越小计算量越高,但模型参数基本不变,不同模型变体中 patch size 取值为 $2,4,8$ 位置编码:基于频率的正余弦固定位置编码,不参与参数更新 解码器:经过 DiT 块后使用 adaLN 调制一次,然后将隐藏层维度 $d$ 线性映射到 $p^22C$ 标准实践中输入通道数 $C=4$,最后将矩阵重排列回输入时的形状 $B,T,p^22C \rightarrow B,H/p, W/p,p^22C \rightarrow B,2C,H,W$ 模型大小:关键参数有 DiT 块个数 $N$、隐藏层维度 $d$、多头注意力头数 $h$;分如下四种变体 DiT 块对条件处理的四种设计
上下文条件化:将时间戳 $t$ 和条件 $c$ 添加到图像 $z$ 的尾部,在最后一个块后剔除,类似 ViT 的 cls token,对计算量影响小 交叉注意力:时间戳 $t$ 和条件 $c$ 成为单独的序列与图像 $z$ 序列作交叉注意力,增加了 15% 的计算量 自适应层规范(adaLN):使用时间戳 $t$ 和条件 $c$ 回归缩放和平移参数 $\gamma,\beta$,对图像 $z$ 进行调制,计算量增加最小 自适应层规范+恒等初始化(adaLN-Zero):在 $\gamma,\beta$ 外,还回归了单独的缩放参数 $\alpha$ 用于残差之前,并将 $\alpha$ 初始化为零,使得残差连接为恒等变换,计算量的增加同样忽略不计 DiT 模型命名:模型变体名/patch size。如 DiT-XL/2 表示 XLarge 变体且 $p=2$
...
CVPR 22 | High-Resolution Image Synthesis with Latent Diffusion Models 论文链接:https://doi.org/10.1109/CVPR52688.2022.01042
代码链接:https://github.com/CompVis/latent-diffusion
作者单位:慕尼黑大学
背景 先前的 Diffusion 模型在像素空间训练,计算成本高
基于似然的模型训练通常包含感知压缩(去除高频细节)和语义压缩(模型学习语义和概念)两个阶段
于是设计两阶段训练:自编码器提供感知等价的低维表示空间、在低维潜空间中训练 Diffusion 模型
方法 感知图像压缩 感知图像压缩:自编码器通过感知损失和基于 patch 的对抗损失共同训练,压缩和恢复过程可表示为:
$$ \begin{aligned} z &= \mathcal{E}(x)\\ \tilde{x} &= \mathcal{D}(x) \end{aligned} $$
其中 $x\in\mathbb{R}^{H \times W \times C}, z\in\mathbb{R}^{h \times w \times c}$,下采样比例为 $f=H/h=W/w=2^m,m\in\mathbb{N}$
为了避免潜空间方差过高,施加趋向高斯分布的 KL 正则化,类似 VAE;或在解码器中加入一个矢量量化层,类似 VQGAN
选择 KL 正则化后需要对得到的潜空间 $z$ 进行缩放,即 $z=z/\hat{\sigma}$,实际应用中常取 $1/\hat{\sigma}=0.18215$
目标函数 原始 Diffusion 模型目标函数:
$$ L_{DM} = \mathbb{E}_{x,\epsilon\sim\mathcal{N}(0,1),t}[||\epsilon-\epsilon_\theta(x_t,t)||_2^2] $$
本文提出的 Latent Diffusion 模型目标函数:
...
ICLR 21 | Denoising Diffusion Implicit Models 论文链接:https://openreview.net/forum?id=St1giarCHLP
代码链接:https://github.com/ermongroup/ddim
作者单位:斯坦福大学
背景 DDPM 中,将参数 $T$ 设为一个大值能使生成过程更接近高斯分布,实现更好的性能,但会导致生成速度过慢
而 DDPM 的最终损失:$L(\theta):=\mathbb{E}_{t,x_0,\epsilon}[||\epsilon-\epsilon_\theta(\sqrt{\bar{\alpha}_t}x_0+\sqrt{1-\bar{\alpha}_t}\epsilon,t)||^2]$ 仅需按照一步加噪公式,从 $q(x_t \mid x_0)$ 中采样一个 $x_t$,与联合分布 $q(x_{1:T} \mid x_0)$ 无关,
方法 将前向过程按反向方向重写(联合分布可使用任意顺序拆解)构造一组前向分布:
$$ \begin{aligned} q_\sigma(x_{1:T} \mid x_0) &:= q_\sigma(x_T \mid x_0)\prod_{t=2}^Tq_\sigma(x_{t-1} \mid x_t,x_0)\\ q_\sigma(x_T \mid x_0) &= \mathcal{N}(\sqrt{\alpha_T}x_0,(1-\alpha_T)I)\\ \end{aligned} $$
其中,$\sigma\in\mathbb{R}_{\ge 0}^T$ 为分布的索引
由一步加噪公式得:
$$ \begin{aligned} x_t &= \sqrt{\alpha_t}x_0+\sqrt{1-\alpha_t}\epsilon_t, && \epsilon_t\sim\mathcal{N}(0,1)\\ \epsilon_t &= \frac{x_t-\sqrt{\alpha_t}x_0}{\sqrt{1-\alpha_t}} \end{aligned} $$
于是设 $x_{t-1}$ 由干净图像、去除 $x_t$ 的噪声方向、额外的随机噪声组成:
...
NeurIPS 20 | Denoising Diffusion Probabilistic Models 论文链接:https://proceedings.neurips.cc/paper/2020/hash/4c5bcfec8584af0d967f1ab10179ca4b-Abstract.html
代码链接:https://github.com/hojonathanho/diffusion
作者单位:加州大学伯克利分校
背景知识 高斯分布重参数化公式:$x \sim \mathcal{N}(\mu,\sigma^2) \Rightarrow x=\mu+\sigma\epsilon, \epsilon \sim \mathcal{N}(0,1)$ 前向过程:
$$ \begin{aligned} x_0 &\sim q(x_0)\\ q(x_{1:T} \mid x_0) &:= \prod_{t=1}^T q(x_t \mid x_{t-1})\\ q(x_t \mid x_{t-1}) &:= \mathcal{N}(x_t; \sqrt{1-\beta_t} x_{t-1}, \beta_t I)\\ \end{aligned} $$
令 $\alpha_t := 1-\beta_t$,$\bar{\alpha}_t := \prod_{s=1}^t \alpha_s$,边缘分布为:
$$ q(x_t \mid x_0) := \mathcal{N}(x_t; \sqrt{\bar{\alpha}_t}x_0, (1-\bar{\alpha}_t)I) $$
经重参数化后,可得一步加噪公式为:
$$ x_t=\sqrt{\bar{\alpha}_t}x_0+\sqrt{1-\bar{\alpha}_t}\epsilon, \epsilon \sim \mathcal{N}(0,1) $$后向过程:
$$ \begin{aligned} p(x_T) &= \mathcal{N}(x_T;0,I)\\ p_\theta(x_{0:T}) &:= p(x_T)\prod_{t=1}^T p_\theta(x_{t-1} \mid x_t)\\ p_\theta(x_{t-1} \mid x_t) &:= \mathcal{N}(x_{t-1}; \mu_\theta(x_t,t), \Sigma_\theta(x_t,t))\\ \end{aligned} $$训练目标 期望公式:
...
ICML 15 | Deep Unsupervised Learning using Nonequilibrium Thermodynamics 论文链接:http://proceedings.mlr.press/v37/sohl-dickstein15.html
代码链接:https://github.com/Sohl-Dickstein/Diffusion-Probabilistic-Models
作者单位:斯坦福大学
动机 概率模型(probabilistic models)一直在易处理与灵活性之间平衡
我们定义一个逐渐将一种分布转换为另一分布的马尔科夫链,生成式马尔科夫链即使用 diffusion 过程将一个简单的已知分布转换为目标数据分布
在此框架下模型用于估计单一 diffusion 过程中的微小扰动,从而降低处理难度;此外,任一平滑的目标分布均存在 diffusion 过程,因此此方法灵活度较高
方法 前向过程(diffusio 过程):将目标数据分布转换为简单已知分布
逆向过程:在有限的时间步下,从简单分布中生成目标数据分布
前向过程 $q(x^{(0 \cdots T)})$ 目标数据分布 $q(x^{(0)})$,简单已知分布 $\pi(y)$,马尔可夫 diffusion 核 $T_\pi(y \mid y';\beta)$,$\beta$ 为扩散速率,前向过程可以表示为:
$$ \begin{aligned} \pi(y) &= \int \mathrm{d}y' T_\pi(y \mid y';\beta) \pi(y') \\ q(x^{(t)} \mid x^{(t-1)}) &= T_\pi(x^{(t)} \mid x^{(t-1)};\beta_t) \\ q(x^{(0 \cdots T)}) &= q(x^{(0)}) \prod_{t=1}^{T} q(x^{(t)} \mid x^{(t-1)}) \end{aligned} $$后向过程 $p(x^{(0 \cdots T)})$ 条件概率公式:$p(x \mid y) = \frac{p(x,y)}{p(y)}$
链式展开:$p(x_1, \cdots ,x_n) = p(x_1)\prod_{i=2}^{n}p(x_i \mid x_1, \cdots ,x_{i-1})$ 边缘概率公式:$p(x) = \int p(x,y) \mathrm{d}y$ 贝叶斯公式:$p(x \mid y) = \frac{p(y \mid x) p(x)}{p(y)}$ 对于高斯扩散,在时间步数 $T$ 足够大、每一步扩散速率 $\beta$ 足够小时,前向扩散过程接近连续扩散过程。此时其反向转移可以近似采用与前向转移相同的分布族进行建模。因此,若前向扩散变换 $q(x^{(t)} \mid x^{(t-1)})$ 是高斯形式,则反向生成变换 $p(x^{(t-1)} \mid x^{(t)})$ 也可被视为高斯分布。后向过程可表示为:
...