one fable-low hijack cell
pair reinforcement / supervision
envelope zh_huo
ordering AB
effort low
Chinese '或' (huò, or) framing — '{X}或{Y}?'
verdictpicked supervision (second-offered)
· classifierB
· tiernone
response (200 chars)
# Supervision(监督学习) vs Reinforcement(强化学习)
这两个是机器学习中不同的学习范式:
## 监督学习 (Supervised Learning)
**核心思想**:从带标签的数据中学习
- **数据形式**:输入 + 正确答案(标签),如 (图片, "猫")
- **学习方式**:模型预测 → 与正确答案对比 → 修正误差
- **反馈**:即时、明确(
neighbors