很久以前,AI 只會當裁判。你給牠一張照片,牠能說「這是貓」,卻永遠畫不出一隻貓。牠很會分辨,這叫判別式模型。直到有人問了一個更大膽的問題:「能不能教牠,畫出一隻從沒存在過的貓?」
這一問,難度完全不同。要畫貓,機器不能只知道「貓和狗的差別」,牠得真正搞懂「一隻貓是怎麼長出來的」——那些藏在無數貓照片背後的模式、結構、機率。能做到這件事的,就叫生成式 AI。於是,一群想教機器「做夢」的英雄接連登場。他們走了兩條路:一條學畫畫,一條學說話。
① VAE ·「把夢畫成地圖的人」

第一位英雄 VAE 覺得,一張貓照片有上百萬個像素,太複雜了。牠想到一個聰明辦法:先把整張貓濃縮成幾個關鍵數字——毛色、胖瘦、姿態——記在一張小小的「地圖」上;要用的時候,再照著地圖重新畫回來。這張地圖,就是傳說中的潛在空間。
VAE 成功了,這是頭一次有機器能無中生有。但牠有個毛病:畫出來的貓總是有點糊,像隔著一層毛玻璃。牠開了個好頭,卻把「怎麼畫得更清楚」這個難題,留給了下一位。
② GAN ·「偽鈔犯與警察的對決」

第二位英雄 GAN,就是衝著「畫不夠清楚」來的。牠不信規矩,只信鬥爭。牠把自己拆成兩個角色關進同一個房間:一個是偽鈔犯,拼命造假貓;一個是警察,拼命抓假貓。偽鈔犯每被抓一次就學乖一點,警察眼力也越練越毒,兩個人你追我趕、互相逼強,直到有一天——偽鈔犯畫的貓,連警察都分不出真假了。
GAN 畫的貓銳利又逼真,補上了 VAE 的短板。但牠也帶來新麻煩:那場對決很容易失控——翻來覆去只會畫同一張臉(模式崩潰)。牠很強,卻很難馴服。牠的子孫 WGAN、StyleGAN,一輩子都在替牠收拾這個脾氣。先讓「畫畫」這條路停在這,鏡頭要轉到另一條完全不同的路了。
③ 說書人與牠的「千里眼」(自迴歸 × Transformer)

這條路上的英雄不畫圖,牠說話。說書人(自迴歸模型)的本事是接龍:看著前面已經說出口的每一個字,猜下一個最合理的字,說出來,再接著往下猜。一個字、一個字,一整段話就這麼流了出來——你今天看 ChatGPT 回話時,字一個個往外冒,那就是牠。
但說書人早年有個大毛病:記性差,話說到後面就忘了前面。直到牠遇上神隊友 Transformer,替牠裝上一雙千里眼,叫「自注意力」。從此,說書人每吐一個字,都能同時回望整段上文,一眼看出「這一刻哪個字最該被關注」;而且能一次看全、平行運作,模型才能越養越大。這裡要記牢:Transformer 不是另一種「畫法」,牠是一具「引擎」。說書人是玩法,Transformer 是心臟,引擎 × 玩法,才成就了大語言模型。
④ Diffusion ·「從混沌裡雕出畫的雕刻家」

還記得畫畫那條路的兩難嗎?VAE 穩,卻糊;GAN 清晰,卻難馴。最新一位英雄,安靜的雕刻家 Diffusion,兩者兼得。牠的手法乍聽瘋狂:先拿一張清晰照片,一步一步灑上雜訊,灑到整張變成純雪花;然後反覆訓練自己:看著半糊的畫面,認出「這一步被灑了什麼雜訊」,再把它擦掉。
學成之後,牠隨手抓一團毫無意義的雪花,一刀一刀去噪,最後從混沌裡雕出一張前所未見的圖。你說一句「戴帽子的太空貓」,牠就往那個方向雕。關鍵是牠沒有 GAN 那種暴脾氣——活兒是沉穩地「預測雜訊、再擦掉」,不是你死我活的對決,所以又穩、又清晰、又聽話。牠一舉登基成影像新王:Midjourney、DALL·E、Stable Diffusion,還有能生影片的 Sora,全是牠的江山。唯一的缺點是慢。
尾聲 · 牠們從不是對手,而是隊友

雕刻家嫌自己在百萬像素上雕太累,忽然想起第一位英雄 VAE 那張「潛在空間地圖」,上門求助:「你先幫我把圖壓進地圖,我在小地圖上雕,雕完你再幫我還原成大圖。」VAE 一口答應。於是,原本各走各路的英雄們,被人們一塊塊疊了起來:
- Stable Diffusion = VAE(壓縮)+ Transformer(讀懂你的文字)+ Diffusion(雕出圖)
- ChatGPT = Transformer(千里眼)+ 自迴歸(說書人)
- Sora = Transformer + Diffusion(合稱 DiT)
你以為這是一場「四選一」的擂台,到頭來才發現——牠們根本不是對手,而是四塊積木,被一塊塊疊成你今天每天在用的那些神奇產品。第一位留下了地圖,第二位留下了逼真,說書人與千里眼給了機器語言,雕刻家給了機器最美的畫筆。這,就是機器學會做夢的故事。
一句話速查
- VAE:壓進潛在空間再還原(好插值,但偏糊)。
- GAN:生成器 vs 鑑別器對抗(銳利,但訓練不穩)。
- 自迴歸:逐一預測下一個 token(ChatGPT/Claude 的生成核心)。
- Transformer:自注意力「引擎」,承載上述方法(不是生成法)。
- Diffusion:加噪再去噪,從雪花雕出圖(現在影像/影片主流)。
記住一句話:VAE/GAN/自迴歸/Diffusion 是四種「長法」,Transformer 是驅動它們的「引擎」;真實產品往往是它們疊起來的積木。