自迴歸模型逐字生成互動實驗室:觀察模型如何根據前文預測下一個 token 的機率分佈,並用溫度參數調整取樣。

Autoregressive Model · Next-Token Prediction

自迴歸模型 · 逐字生成實驗室

GPT / Claude 的核心:每一步都根據「前文」算出「下一個詞的機率分佈」,抽一個、接上去,再重複。拖 溫度(temperature) 看取樣如何從保守變發散。(此處用真實 bigram 統計模型示範)

架構與資料流:自迴歸循環

前文 → 模型 → 下一詞機率分佈 → 取樣一個字 → 接回前文,如此循環(逐字接龍)。生成時模型會亮起。

生成控制

按「生成一步」看單步機率分佈;按「自動生成」連續產生。

自迴歸分解 P(句子) = ∏t P(xt | x1…xt−1)
帶溫度的 softmax 取樣 pi = softmax(logiti / T)

溫度 T→低(0.1):幾乎只挑最高機率的詞 → 保守、重複。
T→高(2.0):分佈變平 → 更隨機、更有創意但可能亂。

已生成序列(紫 = 當前前文 / context)

下一個 token 的機率分佈 P(xt | 前文)

候選詞機率 這步抽中的詞