腾讯优图17篇论文入选ICCV2021,含跨模态检索与分割、车辆识别等领域( 二 )


文章图片

文章图片
04基于并列检测分割学习的弱监督实例分割
Parallel Detection-and-Segmentation Learning for Weakly Supervised Instance Segmentation
本文从自顶而下和自底向上的实例分割方法启发 , 为弱监督实例分割任务提出一种统一平行检测分割的学习框架 。特别地 , 检测模块和常见的弱监督目标检测一样 , 而分割模块采用自监督学习来学习类别无关的前景分割 , 然后再通过自训练来逐步获得特定类别的分割结果 。最后 , 本文在多个数据集上验证了该算法的有效性 。
腾讯优图17篇论文入选ICCV2021,含跨模态检索与分割、车辆识别等领域
文章图片

文章图片
05行人重识别的遮挡感知掩码网络
Occlude Them All: Occlusion-Aware Mask Network for Person Re-identification
随着深度学习时代的到来 , 行人重识别(ReID)取得了显着的成就 。然而 , 大多数方法仅解决了基于完整图片的行人重识别问题 。但在真实世界的场景常常涉及被遮挡的行人 , 这类行人图片提供部分视觉外观 , 所以降低了 ReID 的准确性 。一种常见的策略是通过辅助模型定位可见的身体部位 , 但是辅助模型的训练数据和待解决的数据存在领域偏差等 , 效果不佳 。为了避免在遮挡ReID问题 中使用额外的有问题的模型 , 我们提出了 OcclusionAware Mask Network (OAMN) 。该方法提出了一个基于注意力机制的的掩码模型 , 它需要有遮挡标签的数据来指导训练 , 为此 , 我们提出了一种新的适用于遮挡问题的数据增强方案 , 该方案可为任何全身数据集生成多样化且精确标记的遮挡 。我们所提出的方案比现有的策略更适合包含有限种遮挡类型的现实世界情景 。我们还提供了一种新颖的遮挡统一方案 。上述三个模型组件使现有的注意力机制能够准确地捕捉各种遮挡情形下的身体部位 。我们在多个行人重识别的benchmarks上进行了各种综合实验 , 证明了OAMN方法优于现有的SOTA方法 。
腾讯优图17篇论文入选ICCV2021,含跨模态检索与分割、车辆识别等领域
文章图片

文章图片
06 夜间场景高效自监督的单目深度估计方法
Regularizing the Night-time Weirdness: Efficient Self-supervised Monocular Depth Estimation in the Dark
单目深度估计旨在从单张图像或单目视频中预测深度信息 。近来一些自监督方法在KITTI和Cityscapes上获得了出色的效果 。然而 , 在更具挑战性的黑夜场景中 , 由于低能见度和极端光照导致的弱纹理和帧间不一致性 , 这些方法往往不能得到可用的结果 。为了处理这个问题 , 本文提出了一个新的框架:首先提出基于先验的正则化方法以学习深度信息的先验分布 , 避免出现异常结果;其次 , 提出了映射一致的图像增强模块以提升图像可见度和对比度 , 同时保持帧间一致性;最后 , 提出了基于统计的掩膜策略以去除弱纹理区域在训练中带来的干扰 。实验结果证明了本文方法的有效性 , 同时在两个常用的黑夜数据集上获得了当前最优的效果 。
腾讯优图17篇论文入选ICCV2021,含跨模态检索与分割、车辆识别等领域
文章图片

文章图片
07基于耦合语义注意力的弱监督目标定位
TS-CAM: Token Semantic Coupled Attention Map for Weakly Supervised Object Localization
弱监督目标定位是指仅根据图像层面的类别标签学习目标位置的任务 。基于卷积神经网络 (CNN)的分类模型往往仅会激活目标的局部判别区域 , 而忽略完整的目标范围 , 称为局部激活问题 。在这篇文章中 , 我们认为局部激活问题是由于CNN的内在特性导致 。CNN由一系列卷积操作组成 , 导致模型仅具有局部的感受野 , 无法获取长距离的特征依赖性 。基于此 , 我们提出我们提出基于Transformer的耦合语义类别激活图(TS-CAM)方法 , 借助自注意力机制提取长距离特征相似性 。TS-CAM 首先将图像分割为一系列子块 , 通过位置编码学习不同子块间全局的注意力 。之后 , 对每个子块进行重新排列得到得到类别语义图 。最后 , 融合模型学习的全局注意力图与类别语义图得到类别激活图 。在 ILSVRC/CUB-200-2011 数据集上的实验表明 , TS-CAM 的性能超过其他基于CNN-CAM结构的方法约 7.1%/27.1% , 达到SOTA 。