T01

強化學習

Reinforcement Learning (RL)

簡短答案

智能體透過與環境互動、獲得獎懲回饋,學習最佳決策策略的機器學習方法。

深入解釋

類似人類學習的試誤過程,智能體採取行動、觀察結果、調整策略以最大化長期獎勵。

實際案例

AlphaGo 透過自我對弈的強化學習,達到超越人類圍棋水準。

本頁為 AIATCL 備考用非官方內容;考試資訊請以主辦單位公告為準。