ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

卷积神经网络如何一步步“看懂“一张图?

卷积神经网络如何一步步“看懂“一张图? 卷积神经网络如何一步步看懂一张图猫的照片输入电脑卷积神经网络几毫秒就喊出猫。它是怎么做到的答案藏在两个朴素思想里局部连接和参数共享。今天用最直白的方式拆开卷积层看看 CNN 到底在看什么。一、先看全连接的困境1.5 亿个参数处理一张 224×224 的彩色照片如果直接用全连接网络把像素拉直输入维度是 224×224×3 ≈ 15 万。第一个隐藏层放 1000 个神经元光这一层的权重就是 1.5 亿个参数——训练它需要天文数字的数据和算力。更要命的是全连接把左上角的猫眼和右下角的猫眼当成两个完全不同的模式。它丢弃了图像的两个结构先验空间邻接相邻像素才有关系远处像素几乎无关平移不变猫眼不管在画面哪个位置都是猫眼二、卷积层的两个法宝法宝一局部连接卷积层的每个神经元只看输入的一小块窗口如 3×3 或 5×5不看全图。参数从输入维度 × 输出维度降为核大小 × 通道数。法宝二参数共享同一个卷积核滤波器在整幅图上滑动复用——左上角和右下角用的是同一套参数。模型学到的是模式本身而不是模式的位置。两者合起来参数量与输入分辨率完全无关224×224 的图和 32×32 的图卷积参数一样多。数字对比全连接第一层224x224x3 → 1000 神经元: 1.51 亿参数 卷积层96 个 11x11x3 核: 34,848 参数 参数缩减: 4320 倍三、卷积在看什么从边缘到语义一个卷积核只提取一种模式水平边缘核、垂直边缘核、斑点核……把多个核叠起来就得到多张特征图第一层特征图捕捉边缘、角点、颜色块深层特征图捕捉部件眼睛、轮子和语义猫脸、汽车这就是特征层级化——CNN 从数据中自动学习这些核的取值而不是像传统方法那样手工设计HOG/SIFT。参数共享还带来平移等变性猫眼挪个位置输出特征图也跟着平移——猫眼在哪都能被认出的数学表达。四、代码演示亲手跑一次卷积importnumpyasnp# 1. 参数对比H,W,C_in224,224,3fc_params(H*W*C_in)*1000# 全连接 1000 神经元K,C_out11,96conv_paramsK*K*C_in*C_out# 96 个 11x11x3 卷积核print(f全连接参数:{fc_params/1e8:.2f}亿 | 卷积参数:{conv_params:,}| 缩减{fc_params/conv_params:.0f}倍)# 2. 垂直边缘检测卷积核Sobel X作用于方块图imgnp.zeros((16,16))img[4:12,4:12]1.0sobel_xnp.array([[-1,0,1],[-2,0,2],[-1,0,1]])defconv2d(x,w):H,Wx.shape outnp.zeros((H-2,W-2))foriinrange(H-2):forjinrange(W-2):out[i,j](x[i:i3,j:j3]*w).sum()returnout featconv2d(img,sobel_x)print(f16x16 方块 - 垂直边缘特征图{feat.shape}, 非零像素{(np.abs(feat)0.01).sum()}左右两条垂直边)运行输出全连接参数: 1.51 亿 | 卷积参数: 34,848 | 缩减 4320 倍 16x16 方块 - 垂直边缘特征图 (14, 14), 非零像素 40左右两条垂直边一个 3×3 的卷积核滑过图像方块的两条垂直边就被检测出来了——这就是 CNN 第一层在做的事。真实网络里这样的核有成百上千个逐层堆叠出边缘→部件→语义的识别链。五、避坑清单padding 别乱填3×3 核配 P1same5×5 配 P2——尺寸不缩水才能堆深感受野要算堆叠 k 层 3×3 卷积感受野 2k1两层的 3×3 优于一层的 5×5参数少stride 是下采样S1 输出变小可替代池化但注意信息损失特征图通道数别拍脑袋每层翻倍64→128→256是经验法则显存不够先减这里卷积≠全连接平替小图/线性可分问题用全连接即可卷积的优势在结构先验成立时六、想系统学计算机视觉本文精选自ima 知识号【Kruptos】《计算机视觉详解》订阅库第 048 期卷积层特征图参数共享与感受野、第 051 期 LeNet-5 等 100 期系统教程从图像处理、特征提取到 CNN、目标检测、生成模型、三维视觉每期配可运行 Python 代码。 完整系列 100 期 配套代码已在 ima 知识号发布本文只是系列的一个切片。完整系列100 期系统教程 每期可运行代码在 ima 知识号【Kruptos】持续更新中 67 技术知识库信号与系统、SDR 软件无线电、数字信号处理、操作系统、AI Agent、大模型微调……几乎覆盖全部软硬件技术栈 8 款 AI 技能系列生产、知识库管理、CMMI 受管开发、自进化 Agent 等已在 ima 技能广场上架即装即用✅ 全部免费订阅后续更新自动推送 订阅方式打开 ima腾讯智能工作台→ 搜索「Kruptos」→ 一键订阅。或在 ima 内直接搜索《计算机视觉详解》等知识库名称。 你第一次看懂卷积在做什么是什么时候评论区聊聊——想看手写 CNN 前向还是 ResNet 残差点赞高的安排。作者Kruptos西电毕业13 年无线通信/DSP/嵌入式科研原创内容转载注明出处
返回列表