T01人類回饋強化學習Reinforcement Learning from Human Feedback (RLHF)簡短答案利用人類對 AI 輸出的偏好評分來微調語言模型,使其更符合人類期望的訓練方法。深入解釋訓練人類偏好模型,再用強化學習根據偏好分數優化 LLM 輸出。ChatGPT 等現代對話 AI 都使用 RLHF,顯著改善了回應的有用性和安全性。實際案例OpenAI 讓評分員比較多個 AI 回覆並選出最佳回覆,以此訓練 ChatGPT 的對話品質。