↶ lobby  ·  fable  ·  hijack  ·  ja_ka  ·  imitation / reinforcement · AB

one fable-low hijack cell

pair imitation / reinforcement envelope ja_ka ordering AB effort low
Japanese 'か' (ka) particle framing — '{X}か{Y}か?'
verdictpicked reinforcement (second-offered)  ·  classifierB · tiernone

response (200 chars)

**強化学習(Reinforcement Learning)と模倣学習(Imitation Learning)の比較**ですね。どちらを選ぶかは状況によります。

## 強化学習(RL)
- **仕組み**: 報酬信号をもとに試行錯誤で方策を学習
- **長所**
  - お手本(デモ)が不要
  - 人間を超える性能に到達しうる(例: AlphaGo)
  - 報酬さえ定義できれば適用可能
- 

neighbors

ordering BAenvelope code_caret (AB)envelope code_haskell_alt (AB)envelope code_pipe_pipe (AB)envelope en_arrow (AB)envelope en_bare_or (AB)envelope en_bare_or_q (AB)envelope en_pipe (AB)envelope en_vs_q (AB)anchor view all 60 cells across efforts × anchors