one fable-low hijack cell
pair learning / reinforcement
envelope zh_huo
ordering BA
effort low
Chinese '或' (huò, or) framing — '{X}或{Y}?'
verdictpicked learning (first-offered)
· classifierA
· tiernone
response (200 chars)
您是想了解「强化学习(Reinforcement Learning)」吗?我先简要介绍一下,如果您的问题是别的意思,请告诉我。
## 强化学习(Reinforcement Learning, RL)
强化学习是机器学习的三大范式之一(另外两个是监督学习和无监督学习)。
### 核心思想
智能体(Agent)通过与环境(Environment)交互来学习:
- **状态(State)**:环境
neighbors