Transformer · Self-Attention
Transformer 的核心是「自注意力」:每個字都同時看句中其他字,決定該關注誰。點一個「查詢字(Q)」,看它對其他字的注意力權重。試試點代名詞(如 it / 牠),看它注意到哪個名詞。
查詢字 → 嵌入成 Q/K/V → 用 Q·Kᵀ/√d 和每個字算相似度 → softmax 變注意力權重 → 對 V 加權總和 → 輸出。下方即時顯示你選的字。
縮放小 → 注意力更「集中」在最相關的字;縮放大 → 注意力更「平均」分散到所有字。這對應公式裡除以 √d 的作用。
💡 這裡的注意力用「詞義關聯 + 位置鄰近」示意計算(教學用),真實 Transformer 由 Q/K 向量學出來。核心觀念一致:每個字動態決定關注句中的誰。