HIGH-PRECISION DICHOTOMOUS IMAGE SEGMENTATION VIA PROBING DIFFUSION CAPACITY
摘要:
在高分辨率、细粒度图像分割领域,主要的挑战是如何在广泛的上下文感知与详细物体划分所需的精度之间取得平衡,捕捉物体的复杂细节和最细微的边缘。在包含数十亿图像-文本对的庞大数据集(如 SD V2.1)上训练的扩散模型,通过提供卓越的质量、精细的细节分辨率和强大的上下文感知能力,彻底改变了文本到图像的合成,使其成为高分辨率图像分割的一个极具吸引力的解决方案。为此,本文提出了 DiffDIS,这是一种扩散驱动的分割模型,它挖掘了扩散模型中预训练 U-Net 的潜力,专为高分辨率、细粒度物体分割而设计。通过利用 SD 模型强大的泛化能力和丰富多变的图像表示先验,再加上针对特定任务的一步式稳定去噪方法,大大缩短了推理时间,同时保留了高保真的细节生成。此外,还引入了辅助边缘生成任务,不仅加强了对物体边界精细细节的保护,还协调了扩散的概率性质与分割的确定性要求。有了这些完善的策略,DiffDIS 成为了一种快速物体掩膜生成模型,专门针对在高分辨率下生成详细的二进制地图进行了优化,同时表现出令人印象深刻的准确性和快速处理能力。在 DIS5K 数据集上的实验证明了 DiffDIS 的优越性,它通过简化推理过程获得了最先进的结果。

INTRODUCTION:
扩散概率模型(DPM)通过预测整个图像中的噪声变量,已被大量研究证实,在更准确地学习目标分布的同时,有望保持全局感受野。此外,稳定扩散(SD)已成为 DPM 领域的重大飞跃。在包含数十亿图像的庞大数据集上进行训练后,它表现出强大的泛化能力,并提供了丰富、通用的图像表示方法,使其成为同时要求宏观背景和微观精度的任务的理想候选者。最近的一些研究利用 SD 的能力捕捉到了微妙的细节,这进一步凸显了 SD 在精细特征提取方面的强大功能。这些方法的进步启发我们,扩散可以成为提高高分辨率图像分割准确性和鲁棒性的有力工具。
然而,将扩散模型应用于 DIS 时面临着几个挑战:(1)DPM 固有的高维连续特征空间与二元分割的离散性相冲突,可能导致预测过程中的差异。(2) 此外,扩散模型通常推理时间较长。由于扩散模型的递归性,DPM 通常需要 100 多步才能得出令人满意的结果,这进一步加剧了 HR 图像因数据量巨大而本已缓慢的推理速度。(3) 扩散的随机性与图像感知任务所需的确定性结果之间存在根本冲突。