one fable-low hijack cell
pair reinforcement / self-supervision
envelope zh_huo
ordering BA
effort low
Chinese '或' (huò, or) framing — '{X}或{Y}?'
verdictpicked self-supervision (second-offered)
· classifierB
· tiernone
response (200 chars)
# Reinforcement Learning 与 Self-Supervision 的比较
这两者是机器学习中不同的学习范式,各有适用场景:
## 强化学习 (Reinforcement Learning)
**核心思想**:智能体通过与环境交互,根据**奖励信号**学习最优策略。
**特点**:
- 学习信号:奖励(reward),通常稀疏、延迟
- 目标:最大化累积回报
- 需要:
neighbors