跳到正文
原文
Hugging Face Blog·· 2021-03-31AI 评分34

深入理解 BigBird 的块稀疏注意力机制

Understanding BigBird's Block Sparse Attention

AI 导读

Hugging Face 博客解析 BigBird 的块稀疏注意力机制,该模型已随 🤗Transformers 提供 RoBERTa 风格版本,可处理最长 4096 的序列,计算成本远低于 BERT。BigBird 用滑动注意力、全局 token 和随机 token 三种方式近似 BERT 的全注意力,目标不是超越 BERT,而是在长序列上更高效。

来源:Hugging Face Blog · huggingface.co