連Andrej Karpathy都為之著迷的RLVR

OpenAI 創始元老之一的 Andrej Karpathy 在 2025 年度回顧中直接點出,今年是屬於 RLVR(Reinforcement Learning with Verifiable Rewards) 的一年。過去常見的 RLHF (Reinforcement learning from human feedback 人類回饋強化學習) 需要人類去評分,很主觀又貴,但 RLVR 的核心在於「獎勵是客觀可驗證的」。
megapx
簡單來說,只要是「有標準答案」的任務(例如:數學題有沒有算對? 程式碼能不能跑過 Unit Test?格式是不是正確的 XML?),模型就能透過這種 RLVR 的獎勵機制瘋狂自我訓練,不需要人類介入。
megapx
這張圖詳細拆解了 RLVR 的運作原理: 1. 從 RLHF 到 RLVR:這是一個範式轉移 (Paradigm Shift)。OpenAI 的 o1 和 DeepSeek R1 都是這個路徑的產物,讓模型從「模仿人類說話」轉向「學會多步驟推理」。 2. 關鍵演算法 GRPO:圖中提到的 GRPO (Group Relative Policy Optimization) 是最近很紅的算法,它不需要訓練一個巨大的價值模型 (Value Model),節省了大量顯存,讓模型能在推理過程中透過不斷嘗試來優化答案。 3. 推理時間擴展 (Inference Time Scaling):這也是 RLVR 的一大重點。透過讓模型在回答前「思考」更久(產生更長的 Chain of Thought),可以大幅提升解決複雜問題的能力。 最新的研究甚至發現,RLVR 其實是在權重變化比較平緩的「低曲率子空間」進行微調,這意味著它可以在不破壞模型原本預訓練知識的前提下,大幅增強推理能力。 這也解釋了為什麼現在我們可以用比較小的模型,透過 RLVR 特訓,在特定領域達到超越大模型的效果。
愛心
跪
驚訝
21
1
全部留言