CVPR 2022 | ViT版的Slimming来了，原作者团队打造，参数少，搜索更高效-阿里云开发者社区

CVPR 2022 | ViT版的Slimming来了，原作者团队打造，参数少，搜索更高效

2023-05-15 218

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： CVPR 2022 | ViT版的Slimming来了，原作者团队打造，参数少，搜索更高效

时隔 5 年，network slimming 原作者团队打造出了 ViT 版的 slimming，入选 CVPR 2022。

卷积网络版的 network slimming 在 ICCV 2017 上被提出，作为神经网络剪枝领域代表性的工作之一，目前已被引用超过 1400 次，五年之后的 CVPR 2022，原作者团队跟 Meta、印度理工学院等机构的研究者联合打造了 ViT 版的 slimming，据悉该工作得到了四个审稿人一致推荐接收！

论文地址：https://arxiv.org/pdf/2201.00814.pdf
代码地址：https://github.com/Arnav0400/ViT-Slim

是什么原因让 network slimming 的 ViT 版本得到所有审稿人的一致青睐呢，这里还得说一下 network slimming 这种方法的几个特点，即：简单 (simple) + 有效 (effective) + 灵活 (flexible)。通过简单的引入指示因子，slimming 可以边训练边搜索，类似于隐式的参数共享机制，压缩后的目标网络结构通过排序指示因子就可获得，非常高效方便。ViT-Slim 继承了这些优点，同时针对 ViT 主干网络结构的特性做出了几个改进。

在介绍改进前先回顾一下 network slimming 的方法和原理。用一句话概括就是，对于卷积神经网络，每层每个卷积核都用一个重要性系数去表征它对最后预测结果的贡献程度，如果这个系数接近于 0，就认为它是没有贡献并可以被去掉的。作者通过施加一个正则使得这些系数变得稀疏，同时作者发现由于通常会将卷积核与批量归一（BN）一起使用，因此可以直接使用 BN 层的缩放系数作为每层卷积的重要性系数，这样就不需要引入额外的参数了。

对于 ViT Slimming，需要解决的核心问题是如何在没有 BN 层的情况下设计合适的指示参数来反映不同模块规模对于整个分类性能的重要程度。文章采用的是通过显式地定义可导的 soft mask 来确定每个模块的大小和尺度，整个过程如下图所示。

ViT Slimming 同时考虑了 ViT 里面三个模块：输入 tokens，MHSA 和 MLP 模块，它的训练过程可以看成是一个基于权重共享的子网络搜索过程，主干网的权重可以通过加载预训练好的模型参数来加快搜索。训练过程中 soft mask 接近 0 对应的特征相当于动态地被裁剪 / 丢弃了。该方法的优点是只需训练 / 搜索一次，就可以通过排序 mask 得到无数个子网络，非常高效灵活。算法优化函数由原始的 cross-entropy 和稀疏正则组成，如下所示：

其中在 ViT 的 MHSA 模块内部加 soft mask 的处理如下：