标签: 注意力机制
所有带有"注意力机制"标签的文章。
-
Vision Transformer(ViT):当 Transformer 开始「看」图片
发布于:整理自 B 站《15分钟认识ViT》等视频与知乎资料:从「图片能不能变成 Token」出发,串讲 Patch、Patch Embedding、CLS、位置编码与 Transformer Encoder 的完整流程,对比 CNN 的归纳偏置,并给出 DeiT、Swin 等改进路线。
所有带有"注意力机制"标签的文章。
整理自 B 站《15分钟认识ViT》等视频与知乎资料:从「图片能不能变成 Token」出发,串讲 Patch、Patch Embedding、CLS、位置编码与 Transformer Encoder 的完整流程,对比 CNN 的归纳偏置,并给出 DeiT、Swin 等改进路线。