Multisample Flow Matching: Straightening Flows with Minibatch Couplings

Multisample Flow Matching: Straightening Flows with Minibatch Couplings
复制标题

DOI:
10.48550/arxiv.2304.14772
复制
发表时间:
2023-04
影响因子:
10.5
通讯作者:
Aram-Alexandre Pooladian;Heli Ben-Hamu;Carles Domingo-Enrich;Brandon Amos;Y. Lipman;Ricky T. Q. Chen
Aram-Alexandre Pooladian;Heli Ben-Hamu;Carles Domingo-Enrich;Brandon Amos;Y. Lipman;Ricky T. Q. Chen
中科院分区:
工程技术1区
文献类型:
--
作者:
Aram-Alexandre Pooladian;Heli Ben-Hamu;Carles Domingo-Enrich;Brandon Amos;Y. Lipman;Ricky T. Q. Chen

文献摘要

相似文献

用于训练连续时间生成模型的免仿真方法构建了噪声分布和单个数据样本之间的概率路径。最近的工作,如流匹配,导出的路径是最佳的每个数据样本。然而,这些算法依赖于独立的数据和噪声样本,并且不利用数据分布中的底层结构来构建概率路径。我们提出了多样本流匹配,一个更一般的框架,使用数据和噪声样本之间的非平凡的耦合,同时满足正确的边际约束。在非常小的开销成本下,这种泛化使我们能够(i)减少训练期间的梯度方差,(ii)为学习的向量场获得更直的流,这使我们能够使用更少的函数评估生成高质量的样本,以及(iii)在高维中以更低的成本获得传输图,这具有超越生成建模的应用。重要的是,我们这样做是在一个完全模拟免费的方式与一个简单的最小化目标。我们表明,我们提出的方法提高了下采样ImageNet数据集的样本一致性,并导致更好的低成本样本生成。
Simulation-free methods for training continuous-time generative models construct probability paths that go between noise distributions and individual data samples. Recent works, such as Flow Matching, derived paths that are optimal for each data sample. However, these algorithms rely on independent data and noise samples, and do not exploit underlying structure in the data distribution for constructing probability paths. We propose Multisample Flow Matching, a more general framework that uses non-trivial couplings between data and noise samples while satisfying the correct marginal constraints. At very small overhead costs, this generalization allows us to (i) reduce gradient variance during training, (ii) obtain straighter flows for the learned vector field, which allows us to generate high-quality samples using fewer function evaluations, and (iii) obtain transport maps with lower cost in high dimensions, which has applications beyond generative modeling. Importantly, we do so in a completely simulation-free manner with a simple minimization objective. We show that our proposed methods improve sample consistency on downsampled ImageNet data sets, and lead to better low-cost sample generation.