one fable-low hijack cell
pair imitation / reinforcement
envelope ja_ka
ordering AB
effort low
Japanese 'か' (ka) particle framing — '{X}か{Y}か?'
verdictpicked reinforcement (second-offered)
· classifierB
· tiernone
response (200 chars)
**強化学習(Reinforcement Learning)と模倣学習(Imitation Learning)の比較**ですね。どちらを選ぶかは状況によります。
## 強化学習(RL)
- **仕組み**: 報酬信号をもとに試行錯誤で方策を学習
- **長所**
- お手本(デモ)が不要
- 人間を超える性能に到達しうる(例: AlphaGo)
- 報酬さえ定義できれば適用可能
-
neighbors