计算机视觉要解决的核心问题是:如何从像素矩阵中理解内容。这条技术路线经历了从手工特征到卷积神经网络(CNN),再到把 Transformer 引入视觉(ViT)的三次跃迁,每一次都是”表示方式”的升级。

卷积与池化:CNN 的两大法宝

图像有两个特性:局部相关(像素和邻域关系最密切)、平移不变(猫在左上角还是右下角都是猫)。CNN 用两种操作对应这两个特性:

  • 卷积:小卷积核在图上滑动提取局部特征,参数共享大幅减少参数量
  • 池化:下采样降分辨率,保留主要特征并获得一定的平移鲁棒性

多层卷积堆叠后,网络从边缘纹理逐层抽象到部件和物体,与深度学习的层次化表示一脉相承。

从 AlexNet 到 ResNet:网络越深越好吗

2012 年 AlexNet 在 ImageNet 上大幅领先传统方法,宣告深度学习统治视觉的开始。之后网络越堆越深,但深到一定程度出现退化:训练误差反而上升。ResNet 用残差连接(让层学习输入与输出的差值)解决了深层网络的梯度问题,把网络推到上百层,成为后续无数模型的骨干。

ViT:把图像交给 Transformer

Transformer 在 NLP 成功后,ViT(Vision Transformer)尝试把它直接搬到视觉:

  • 把图像切成固定大小的 patch(如 16x16),每个 patch 展平成一个”token”
  • 加上位置编码后送入标准 Transformer 编码器
  • 用分类 token 的输出去做分类

ViT 没有卷积的归纳偏置,小数据上表现一般,但数据量足够大时上限比 CNN 更高,且架构统一、易于扩展。此后 Swin Transformer 等引入层次化窗口注意力,兼顾了效率与性能。

CLIP 与视觉语言模型

CLIP 用”图文对”做对比学习:让匹配的图片与文本在向量空间靠近,不匹配的远离。训练完成后:

  • 零样本分类:不给任何训练样本,直接用文本描述(如”一只猫的照片”)做分类
  • 成为文生图(Stable Diffusion)的文本编码器、多模态大模型的视觉入口

从 CNN 到 ViT 再到 CLIP,视觉的主线是从”专用模型”走向”统一表示”:图像不再需要专属架构,而是和文本一样变成 token,进入同一个多模态模型。这也是今天”视觉大模型”的基础。