Theme
自注意力把序列中每个 token 的表示更新为其他 token 表示的加权和。
缩放因子 用来控制 logits 的方差,避免 softmax 过早饱和。
多头注意力把表示投影到多个子空间:
然后拼接所有 head。更多线性映射背景见 线性代数。