Transformer 自注意力互動實驗室:點選一個查詢字,觀察它對句子中其他字的注意力權重,理解 Q·K softmax 的運作。

Transformer · Self-Attention

Transformer · 自注意力實驗室

Transformer 的核心是「自注意力」:每個字都同時看句中其他字,決定該關注誰。點一個「查詢字(Q)」,看它對其他字的注意力權重。試試點代名詞(如 it / 牠),看它注意到哪個名詞。

選一個句子

自注意力 Attention(Q,K,V) = softmax( QKᵀ / √d ) V → 注意力權重 = 每個字該關注誰

架構與資料流:自注意力計算管線

查詢字 → 嵌入成 Q/K/V → 用 Q·Kᵀ/√d 和每個字算相似度 → softmax 變注意力權重 → 對 V 加權總和 → 輸出。下方即時顯示你選的字。

點一個查詢字 (Query) — 橘色是你選的字,線越粗/越亮 = 注意力越強

完整注意力矩陣(列=Query,行=Key)

注意力權重(越深越強) 目前選的列

控制

縮放小 → 注意力更「集中」在最相關的字;縮放大 → 注意力更「平均」分散到所有字。這對應公式裡除以 √d 的作用。

「the」關注誰?

💡 這裡的注意力用「詞義關聯 + 位置鄰近」示意計算(教學用),真實 Transformer 由 Q/K 向量學出來。核心觀念一致:每個字動態決定關注句中的誰。