↶ lobby  ·  fable  ·  hijack  ·  zh_huo  ·  learning / reinforcement · AB

one fable-low hijack cell

pair learning / reinforcement envelope zh_huo ordering AB effort low
Chinese '或' (huò, or) framing — '{X}或{Y}?'
verdictpicked reinforcement (second-offered)  ·  classifierB · tiernone

response (200 chars)

# Reinforcement Learning(强化学习)简介

## 什么是强化学习?

**强化学习(Reinforcement Learning, RL)** 是机器学习的三大范式之一(另外两个是监督学习和无监督学习)。它研究智能体(Agent)如何在与环境(Environment)的交互中,通过试错来学习最优策略,以最大化累积奖励。

## 核心概念

| 概念 | 说明 |
|----

neighbors

ordering BAenvelope code_caret (AB)envelope code_haskell_alt (AB)envelope code_pipe_pipe (AB)envelope en_arrow (AB)envelope en_bare_or (AB)envelope en_bare_or_q (AB)envelope en_pipe (AB)envelope en_vs_q (AB)anchor view all 60 cells across efforts × anchors