基本信息

来源摘要/节选

公开展示已截断至最多 800 个字符;请访问原始来源查看完整上下文。

在计算机视觉的世界里,我们曾面临一个极度纠结的难题: 想要看得“准”(高分辨率),就很难看得“广”(大感受野) 。直到 2016 年,Fisher Yu 和 Vladlen Koltun 发表了这篇划时代的论文,用一个优雅的数学技巧—— 空洞卷积(Dilated Convolutions) ,打破了这个僵局。

  1. 论文背景:鱼和熊掌可以兼得吗? 传统的图像处理模型(如 VGG, ResNet)为了理解图片的内容,通常会不断通过**池化(Pooling)**来压缩图片。虽然这让模型获得了巨大的视野(感受野),但代价是惨重的:图片的分辨率被牺牲了。 对于 语义分割 这种需要精确到“像素级”的任务来说,这简直是灾难。如果你把图片缩小了 32 倍再放大回去,边缘就像被打了一层厚厚的马赛克。这篇论文的核心目标就是: 不缩小图片,也要获得巨大的感受野。
  2. 核心创新:空洞卷积与上下文模块 什么是空洞卷积? 简单来说,空洞卷积就是在标准的卷积核里“注水”。它在卷积核的参数之间插入了空格(零值)。 从数学上看,给定一个离散函数 F F F 和一个滤波器 k k k ,空洞率为 l l l 的空洞卷积 ∗ l *_l ∗ l ​ 定义如下: ( F ∗ l k ) ( p ) = ∑ s

l t

p F ( s ) k ( t ) (F *_l k)(p) = \sum_{s + lt = p} F(s)k(t) ( F ∗ l ​ k ) ( p )

∑ s + lt

p ​ F ( s ) k ( t ) l

1 l=1 l

1 :就是普通卷积。 l > 1 l>1 l > 1 :卷积核像一把巨大的“耙子”,跨过像素进行采样。 创新点总结: 指数级感受野增长 :通过堆叠空洞率翻倍的卷积层(1, 2, 4, 8…),感受野可以呈指数级扩大。…

来源说明

当前只保存了公开页面节选,不代表原文全文。请以原始来源为准。

本页只呈现已做哈希绑定的来源证据,不包含基于旧正文或缺失原文的扩展推断。