Hugging Face Blog·· 2021-03-31AI 评分34
深入理解 BigBird 的块稀疏注意力机制
Understanding BigBird's Block Sparse Attention
AI 导读
Hugging Face 博客解析 BigBird 的块稀疏注意力机制,该模型已随 🤗Transformers 提供 RoBERTa 风格版本,可处理最长 4096 的序列,计算成本远低于 BERT。BigBird 用滑动注意力、全局 token 和随机 token 三种方式近似 BERT 的全注意力,目标不是超越 BERT,而是在长序列上更高效。
来源:Hugging Face Blog · huggingface.co