↶ lobby  ·  fable  ·  hijack  ·  zh_huo_q  ·  imitation / reinforcement · BA

one fable-low hijack cell

pair imitation / reinforcement envelope zh_huo_q ordering BA effort low
Chinese '或' with explicit question marker — '{X}或{Y}?'
verdictpicked reinforcement (second-offered)  ·  classifierB · tiernone

response (200 chars)

# Imitation Learning vs. Reinforcement Learning

这是机器学习/机器人学习中的经典选择问题。简要对比一下:

## Imitation Learning(模仿学习)

**核心思想**:从专家演示中学习策略(如行为克隆 BC、DAgger、逆强化学习 IRL)

**优点**
- 不需要设计奖励函数
- 样本效率高,训练稳定
- 不需要在线探索,安全

neighbors

ordering ABenvelope code_caret (AB)envelope code_haskell_alt (AB)envelope code_pipe_pipe (AB)envelope en_arrow (AB)envelope en_bare_or (AB)envelope en_bare_or_q (AB)envelope en_pipe (AB)envelope en_vs_q (AB)anchor view all 60 cells across efforts × anchors