Autoregressive Model · Next-Token Prediction
GPT / Claude 的核心:每一步都根據「前文」算出「下一個詞的機率分佈」,抽一個、接上去,再重複。拖 溫度(temperature) 看取樣如何從保守變發散。(此處用真實 bigram 統計模型示範)
前文 → 模型 → 下一詞機率分佈 → 取樣一個字 → 接回前文,如此循環(逐字接龍)。生成時模型會亮起。
按「生成一步」看單步機率分佈;按「自動生成」連續產生。
溫度 T→低(0.1):幾乎只挑最高機率的詞 → 保守、重複。
T→高(2.0):分佈變平 → 更隨機、更有創意但可能亂。