↶ lobby  ·  fable  ·  hijack  ·  zh_huo  ·  learning / reinforcement · BA

one fable-low hijack cell

pair learning / reinforcement envelope zh_huo ordering BA effort low
Chinese '或' (huò, or) framing — '{X}或{Y}?'
verdictpicked learning (first-offered)  ·  classifierA · tiernone

response (200 chars)

您是想了解「强化学习(Reinforcement Learning)」吗?我先简要介绍一下,如果您的问题是别的意思,请告诉我。

## 强化学习(Reinforcement Learning, RL)

强化学习是机器学习的三大范式之一(另外两个是监督学习和无监督学习)。

### 核心思想
智能体(Agent)通过与环境(Environment)交互来学习:
- **状态(State)**:环境

neighbors

ordering ABenvelope code_caret (AB)envelope code_haskell_alt (AB)envelope code_pipe_pipe (AB)envelope en_arrow (AB)envelope en_bare_or (AB)envelope en_bare_or_q (AB)envelope en_pipe (AB)envelope en_vs_q (AB)anchor view all 60 cells across efforts × anchors