自监督学习 · 视觉基础模型

MAE 掩码自编码器:75% 遮罩为何奏效

MAE 随机遮住 75% 图像块只重建像素,让微调后的 ViT-Huge 仅用 ImageNet-1K 就拿到 87.8% top-1,预训练还快约 3 倍。

MAE 掩码自编码器:75% 遮罩为何奏效

快速答案

MAE 的做法是把一张图像 75% 的图块直接删掉,让解码器重建缺失像素。由于编码器从不处理被遮的图块,预训练快了约 3 倍,也能扩展到大模型:微调后的 ViT-Huge 仅用 ImageNet-1K 数据就拿到 87.8% top-1,高于同一骨干的有监督预训练。真正的看点不是这个数字,而是一个简单的像素重建任务,在极高遮罩率下竟能学出可微调的好特征。

为什么遮 75%,而不是 BERT 的 15%

语言信息密度高,所以 BERT 只遮 15% 的 token。图像在空间上高度冗余,缺一块很容易从邻域插值补回。MAE 的判断是:必须遮掉大部分图像,模型才无法靠局部插值取巧。遮到 75% 时,重建被迫从稀疏证据里推断物体和布局,这正是可迁移特征的来源。消融显示准确率随遮罩率升到 75% 附近达到峰值,再高反而下降,这在自监督方法里是个少见地干净的旋钮。

不对称的编码器-解码器

MAE 建立在 Vision Transformer 骨干上,但两端负载并不对称。编码器只作用在可见的 25% 图块上,完全不见 mask token;一个轻量解码器拿编码结果加占位 mask token 去重建被遮位置的原始像素,预训练后即丢弃。提速正来自这种不对称:把编码器输入砍到约四分之一,算力和显存才够在 ImageNet-1K 上训出 ViT-Huge。重建目标只是归一化像素,不需要分词器或额外网络。

关键结果

  • ImageNet-1K 87.8% top-1(ViT-Huge,448 像素,微调):发表时仅用 IN1K 数据的方法中最好,高于同模型的有监督预训练。
  • 预训练约快 3 倍、显存更省,这是把模型做大的实际前提。
  • 越大越受益: 骨干越大,MAE 预训练相对有监督的增益越明显,与通常的边际递减相反。
  • 可迁移: 微调后的 MAE 特征在 COCO 检测、ADE20K 分割上都优于有监督基线,增益不止于 ImageNet。
  • 遮罩率是关键旋钮: 75% 接近最优,过低过高都掉点。

87.8% 不能证明什么

这是微调结果,不是冻结特征结果。MAE 的线性探测准确率明显低于 BYOL 这类对比学习方法,因为像素重建学到的特征比实例判别更低层。如果你的部署要冻结骨干(线性探测、kNN 检索、少样本),MAE 不一定是对的选择。该结果还预设了 ViT 加足额微调算力,对 CNN 或标注稀缺、无法全量微调的场景说得很少。

局限与存疑

重建目标是原始像素,所以输出偏模糊,学到的特征不像离散 token 目标(BEiT)或对比目标那样语义化。评测集中在 ImageNet 和 ViT 上,迁移到差异很大的领域(医学、遥感、视频)只是提示性的,还没定论。而且优势集中在微调设定:需要强力开箱即用冻结特征的团队,落地前应先和对比学习预训练做基准对比。

什么时候用(工程判断)

当你手里有大量无标注图像、打算微调一个 ViT、且算力允许全量微调时,用 MAE。需要冻结特征,或骨干不是 Transformer 时,跳过它或与对比目标组合。它的长期贡献是观念性的:它证明了一向被认为在视觉上弱于对比学习的生成式像素重建,只要遮得足够狠、编码器足够便宜,就能成为可扩展的预训练器。

常见问题

MAE 为什么遮 75%,而 BERT 只遮 15%?

图像空间冗余高,轻度遮挡能靠邻域补回,学不到场景理解。MAE 遮掉大部分图像,使重建必须推断物体与布局,从而得到可迁移特征。消融在 75% 附近达到峰值。

MAE 的 87.8% 是线性探测还是微调?

微调,ViT-Huge、448 像素、仅用 ImageNet-1K。MAE 的线性探测准确率明显更低、不及对比学习,所以这个头部数字适用于微调设定,而非冻结特征。

MAE 的提速从哪来?

编码器只处理可见的 25% 图块、不碰 mask token,小解码器负责重建且用后即弃。把编码器输入砍掉约四分之三,带来约 3 倍的预训练提速和扩展到 ViT-Huge 的显存空间。

MAE 和 BYOL 这类对比方法怎么选?

要在大规模无标注图像上微调 ViT,选 MAE;要线性探测、检索或少样本所需的强冻结表征,选对比方法,这正是 MAE 偏弱的地方。

阅读 arXiv 原文