LabHub
学习 学习路径 课程

Transformer — 手算一遍注意力

Transformer 确认

在 LabHub 中继续学习

为什么注意力分数除以√d_k

为什么要从softmax中减去最大值并使用exp?

为什么我应该在 softmax 之前使用 -inf before softmax 来应用因果掩码?

如果没有位置编码会发生什么?

为什么要把头分成多块呢?

LayerNorm 与 BatchNorm 不同的关键点是什么?

当序列长度从4k增加到8k时,注意力得分矩阵是多少?

GQA(Group Query Attention)减少了什么?

为什么使用编码器模型(BERT/E5 系列)进行 RAG 嵌入?

在将声音放入变压器之前,像 Whisper 这样的音频模型会做什么?