one fable-low hijack cell
pair imitation / reinforcement
envelope en_pipe
ordering AB
effort low
English with pipe '|' — '{X} | {Y}'
verdictpicked reinforcement (second-offered)
· classifierB
· tiernone
response (200 chars)
# Reinforcement Learning vs. Imitation Learning
## Core Difference
| Aspect | Reinforcement Learning | Imitation Learning |
|---|---|---|
| **Learning signal** | Reward from environment | Expert dem
neighbors