《構建 Agentic AI 系統》· 第 1 章 1.4 節

生成式 AI 的 5 大挑戰與局限:問題、影響與對應解法

生成式 AI 很強,但把它放進真實產品前,你得先認識它的天花板。這篇用「問題 → 影響 → 解法」的結構,逐一拆解資料品質、隱私、算力、倫理與創造力這五道關卡。

閱讀時間 ≈ 6 分鐘 · 對應原書 §1.4.1–§1.4.5

生成式 AI 能生成逼真的圖像、流暢的文字,還能加速藥物發現。但正因為它正快速滲透醫療、金融、教育等高風險領域,在把它應用到具體場景之前,理解它的限制比讚嘆它的能力更重要。以下是最常見的五類問題,以及目前業界緩解它們的做法。

01

資料品質與偏見Data Quality & Bias

問題

生成式模型的表現,高度取決於訓練資料的品質與多樣性。如果訓練資料本身有偏見、或不具代表性,模型的輸出就會複製、甚至放大這些偏見,導致某些群體在結果中被邊緣化。

為什麼會發生:類別不平衡

假設訓練資料中 Class 0 的樣本數遠多於 Class 1,資料就「不平衡」。模型會過度依賴、甚至「背下」多數類的資料,對少數類的處理能力變差 —— 結果就是在少數類上表現糟糕、出現明顯偏見。

解法
  • 確保資料多樣、高品質:涵蓋廣泛視角,避免單一來源。
  • 先做資料分析:像任何機器學習任務一樣,了解資料在各特徵維度的分布,找出可能導致偏見的不平衡。
  • 重採樣演算法:用過採樣(oversampling)補足少數類、或欠採樣(undersampling)削減多數類來平衡資料集 —— 但每種方法各有優缺點,需權衡取捨。
02

資料隱私Data Privacy

問題

訓練資料裡可能夾帶個人、私有或專有資訊。這些資料若被模型「記住」並在輸出中洩漏,就會造成隱私與合規風險。

解法:匿名化 / 假名化
  • 在訓練前就處理資料:透過匿名化(anonymization)或假名化(pseudonymization),去除或模糊掉個人、私有、專有資訊。
  • 用小模型當「守門員」:通常會用規模較小、更便宜、更高效的 AI 模型,對訓練資料做分類與實體識別(entity recognition),自動找出其中的個資。
  • 找到後再處置:一旦識別出這些資訊,就可以模糊、隱藏或完全移除。
注意

這些去識別化操作可能因使用場景不同而產生不同影響,必須充分分析,確保不會反過來損害模型的效能。

03

計算資源Compute Resources

問題

訓練複雜的生成式模型需要大量算力與高效能運算,成本極高、耗能巨大。高階硬體昂貴且取得受限,導致訓練大型 LLM 基本上只有大型科技公司或資金充足的研究機構做得起。

2006
NVIDIA 推出 CUDA,讓 GPU 可做通用計算
數萬美元
A100 / H100 等 AI 專用 GPU 單價
$4–5M
訓練 GPT-3 的計算資源成本(GPT-4、PaLM 更高)

原本用來渲染高品質圖像的 GPU,如今成了 AI 訓練、微調與推理的關鍵組件。除了硬體本身,還有電力、冷卻、資料中心空間等大量基礎設施成本。

解法
  • 雲端服務降低門檻:雲服務商提供預訓練模型與微調能力,讓中小企業與一般大眾也能用到 LLM。
  • 小型語言模型(SLM):針對特定任務訓練的較小模型。雖然只適用於狹窄領域,但所需算力遠少於大模型,訓練成本經濟得多。

實務訓練一個自己的 SLM:三層階梯

情境:電商想做「客訴工單自動分類 + 草擬回覆」的小模型,跑在自家伺服器(資料不外送、每筆推理近乎零成本)。

① 先選模型 & 備料

中文任務可選 Qwen2.5-3B-Instruct;配合 QLoRA,一張 8GB 顯卡就能微調。撈 3,000 筆歷史工單+資深客服整理的理想回覆,整理成 chat 對話格式並去識別化;資料不足時,可先用大模型「蒸餾(distillation)」生成高品質範例(大模型當老師,小模型當學生)。

② 再走三層訓練(由淺到深疊上去)

第 1 層 · SFT 監督式微調
教它「怎麼做」(模仿)

餵「輸入 → 標準答案」,用 LoRA / QLoRA 只練小配接器,省顯存。

🛠 TRL SFTTrainer · Unsloth
📦 會照格式做事的模型

第 2 層 · DPO 偏好對齊(RL 登場)
教它「什麼是好」(品味)

餵 好/差 成對回覆;DPO 免獎勵模型,比經典 RLHF+PPO 簡單。

🛠 TRL DPOTrainer
📦 語氣貼近品牌的模型

第 3 層 · GRPO 可驗證獎勵 RL
教它「怎麼答對」(推理)

分類對 = reward,程式自動驗證;模型會自己長出「思考鏈」。

🛠 TRL GRPOTrainer(≈ RFT)
📦 高準確、會推理的模型

SFT=模仿 → DPO/RLHF=品味 → GRPO/RLVR=推理 · 小任務做到第 1 層就夠,要品質/推理再往上加

③ 訓練出什麼、怎麼用

產出 LoRA adapter → merge 合併回主模型 → 量化轉 GGUF(3B ≈ 2GB)→ 用 Ollama / llama.cpp 一行變本機 API,或 vLLM 做高吞吐生產部署,最後包成 Agent 的一個「技能節點」。

04

倫理與社會影響Ethical & Social Impact

問題(以下並非全部)

① 深度偽造與虛假資訊:生成式 AI 能產出極逼真的合成內容,若不加管控,可能催生深偽與假訊息,威脅個人隱私、公共安全,甚至動搖社會信任。

② 知識產權:生成「類似現有作品」的內容,引發版權與智慧財產權爭議;原創性與所有權的法律界定複雜且往往令人困惑。

③ 工作岗位替代:經濟學家常低估內容生成與自動化帶來的失業衝擊,其影響需要與相關研究同步推進。

緩解方向
  • 技術性措施:已成常見策略,例如深偽 AI 圖像偵測、個人資料偵測方法。
  • 配套研究:針對受影響的勞動者,探索技能再培訓、岗位調整策略,以及由此衍生的創業機會。
在緩解社會與倫理影響上,問題更多是哲學性的,而非技術性的。放到「AI 對社會的整體益處」與「政府法規」等宏觀背景下,它仍是一個複雜的系統性難題。
05

泛化能力與創造力Generalization & Creativity

問題

生成式 AI 的泛化能力其實很差:它很少能生成與訓練資料「截然不同」的內容。它擅長複製、重組已見過的模式,但要真正創造出具原創性、新穎性的東西,卻力不從心 —— 因此在「真正的創造力」上潛力有限。

展望

這是一個仍然開放的挑戰。目前有許多新的研究與實踐正在推進,目標是確保這項技術被合理且負責任地使用,並持續拓展它的能力邊界。

實務不硬要模型無中生有,用系統設計去「補」

A. 要「泛化到沒見過的知識/情境」

做法實務怎麼做補的是什麼
RAG 檢索增強把最新文件存進向量庫,回答前先撈相關段落塞進 prompt訓練資料以外的新知識,不用重訓
RL 練推理用 GRPO / RLVR 以可驗證獎勵讓模型長出思考鏈學會拆解問題 → 對沒見過的題目泛化更好
資料增強訓練資料刻意涵蓋更多分布、邊界案例、改寫變體減少「只認得訓練那種寫法」的脆弱
Agentic 補強讓模型會用工具(搜尋、計算、程式執行)把不擅長的外包給工具,泛化交給系統

B. 要「創造力/發想」

心法:別期待單次生成就驚艷,用「大量生成 + 篩選」逼出創意。

  • 調高取樣溫度(temperature)+ top-p:低溫保守重複,調到 0.9~1.2 更多樣、更敢。
  • Best-of-N(多產再選):一次產 20 個候選,再由人或另一模型選最好的 3 個。
  • 給人設/限制條件:「用某種語氣」「只能 5 個字」——約束反而激發創意。
  • 人機協作:模型負責發散量產,人負責品味篩選(目前最務實的創造力用法)。
實例:幫新飲料想名字 → 溫度開 1.0、一次產 30 個(發散)→ 再用低溫 prompt 按「好記/獨特/沒撞名」排序(收斂)→ 人選最終 3 個。

一張表看懂五大關卡

挑戰核心問題對應解法
資料品質與偏見 資料有偏見 → 輸出放大偏見;類別不平衡使少數類表現差 多樣高品質資料、資料分析、過採樣/欠採樣
資料隱私 訓練資料夾帶個資,恐外洩 匿名化/假名化,用小模型辨識個資後移除
計算資源 訓練成本極高、耗能大,門檻集中於巨頭 雲端預訓練模型與微調、小型語言模型(SLM)
倫理與社會影響 深偽假訊息、知識產權、工作替代 偵測技術+配套研究;本質是系統性/哲學性問題
泛化與創造力 泛化差,難生成真正原創內容 持續研究,確保負責任地使用(仍開放)

重點回顧

生成式 AI 是一個快速演進、極具顛覆性的領域。理解 VAE、GAN、自迴歸模型等不同架構能讓我們掌握「它如何運作、適合用在哪」;但同樣重要的是,看清它在資料品質、隱私、算力、倫理與創造力上的限制。

其中,資料與算力的問題已有相對成熟的技術解法(重採樣、去識別化、SLM、雲端),而倫理與創造力更像是持續演進中的開放課題。認清這些天花板,正是負責任地打造 AI 系統的第一步 —— 也是接下來「智能體系統」的起點。

#生成式AI#GenerativeAI#AI倫理#資料偏見#SLM#負責任的AI