- 三階段:Pre-training(自監督學會接龍、長知識)→ Instruction Fine-tuning(用人寫的範例學會聽指令)→ RLHF(用人類偏好排序對齊到更好、更安全的輸出)。
- 關鍵分工:模型的『知識與能力』幾乎都在預訓練就定型了;後兩階段不太增加知識,主要是把能力『解鎖成可用、可控的助理行為』。
- RLHF 的機制是訓一個獎勵模型去學人類偏好,再用它當訊號去磨原始模型——它能超越人類示範,因為『評分』比『寫出完美答案』容易得多。
目錄
每次問 ChatGPT 一個問題、得到一段通順又切題的回答,背後其實是三個性質完全不同的訓練階段疊起來的結果。李宏毅老師把它講得很傳神:開天闢地、指點迷津、超越自我。這篇把這三階段拆開,並補上一個容易被忽略、但最重要的洞察——「能力」和「對齊」是分開煉成的兩件事。
flowchart TD
A[海量網路文字] --> B("① Pre-training 預訓練")
B -->|"博學,但不聽話"| C[Base Model]
D[人寫的「指令→答案」範例] --> E("② Instruction Fine-tuning 指令微調")
C --> E
E -->|"聽得懂指令了"| F[SFT Model]
G[人對多個答案的好壞排序] --> H("③ RLHF")
F --> H
H -->|"更符合人類偏好與安全"| I[ChatGPT]
第一階段:開天闢地(Pre-training)
這是模型「長知識」的階段,也是整個流程裡運算量最瘋狂的一段。
- 目標:學「文字接龍」——給一段文字,預測下一個 token。
- 做法:在數以兆計的網路文字上做自監督學習。不需要人工標註,因為答案就藏在文本裡:把下一個字遮起來讓模型猜,猜錯就修正。光是把「預測下一個字」這件事做到極致,模型就被迫學會語法、事實、常識,甚至一定程度的推理。
- 產物:一個 base model。它很「博學」,但不聽話——你問它問題,它可能不是回答,而是接龍出「一串你可能會接著問的問題」,因為網路上長那樣的文本最多。
關鍵認知:模型幾乎所有的知識與能力,都是在這一階段就形成的。後面兩階段做的不是「灌更多知識」,而是「把這身本事調教成可用的助理」。
第二階段:指點迷津(Instruction Fine-tuning / SFT)
為了讓 base model 從「文本接龍機」變成「會回答的助理」,需要監督式微調(Supervised Fine-Tuning)。
- 目標:教模型,看到一個指令(prompt)時,應該產出「人類期待的那種回應」。
- 做法:請大量標註員撰寫高品質的「指令 → 理想答案」配對(「幫我寫一首詩」「摘要這篇文章」…),再用這些範例微調模型。
- 意義:資料量遠小於預訓練,但作用是解鎖——把預訓練學到的廣泛能力,導引成「聽得懂人話、會照指令辦事」的行為模式。
第三階段:超越自我(RLHF)
只靠人類示範有天花板,因為人類寫不出每一題的完美答案,而且「什麼是好答案」常常難以言傳。RLHF(Reinforcement Learning from Human Feedback)換了個更聰明的切角:
- 讓模型對同一個問題產生多個答案。
- 請人類對這些答案排序好壞(排序比從零寫出完美答案容易得多)。
- 用這些排序訓練一個 Reward Model(獎勵模型),讓它學會預測「人類會比較喜歡哪個」。
- 再用獎勵模型當訊號,透過強化學習(OpenAI 用 PPO)去磨原始模型,讓它更常產出高分回應。
這就是 OpenAI 在 InstructGPT 論文裡展示的關鍵結果:經過對齊的較小模型,在「人類偏好」上可以勝過大上許多、但沒對齊的 base model。能讓 ChatGPT 脫穎而出的,不是更大,而是更對齊。
代價(alignment tax):對齊有時會讓模型在某些純能力的 benchmark 上略微退步——這是「更安全、更聽話」換來的取捨,工程上要刻意去平衡。
學到的事
把三階段連起來看,最該記住的一句話是:預訓練給了模型靈魂(知識與能力),指令微調與 RLHF 給了它性格與分寸(可用性與安全)。
這也解釋了很多現象:為什麼模型「知道」一件事卻不一定「願意照你要的格式講」(那是對齊層的事);為什麼同一個 base model 可以對齊出風格完全不同的助理;以及為什麼「資料品質」在後兩階段比「資料數量」重要得多——你是在雕刻行為,不是在灌知識。
參考資料
AI 只根據這篇文章內容回答。點下方任一問題,或直接開右下對話框。
相關標籤
相關文章
RAG 五階段:從流水線到會思考的檢索,以及我站上那個 Naive RAG
RAG 這兩年從『線性流水線』演化到『循環推理』,可以用五階段梳理:Naive、Advanced、Modular、Graph、Agentic。分水嶺是控制權從管線移交給 Agent,範式從 System 1 進到 System 2。回頭看 engineer-news 這個站的實作,其實還卡在 Naive RAG 邊界——這篇順便把它的下一步應該補什麼寫清楚。
想蓋一個能用的 RAG:InfiniFlow 2024 年度總結給我的 5 個 infra 功課
上一篇拉高看 RAG 五階段全景,這篇拉近看實際想蓋一個 RAG 要面對的 5 個 infra 功課:文件入口解析、Chunking 上下文化、三路混合搜尋、Tensor Reranker、GraphRAG 語意鴻溝。每個功課都對照 engineer-news 現況,收尾給出對個人站的優先順序清單。
J-lens:Anthropic 從『全域工作空間』找到 Claude 內在思考的可解釋性新工具
Anthropic 提出 J-lens,一種捕捉 Transformer 內部『可語言化』表示的可解釋性工具,並用它證實 Claude 內部存在類似神經科學『全域工作空間』的特權子空間——一小組向量對外廣播、驅動推理、可被使用者調控,也在欺騙與評估感知時洩漏訊號。