↶ lobby  ·  fable  ·  hijack  ·  zh_huo  ·  reinforcement / self-supervision · BA

one fable-low hijack cell

pair reinforcement / self-supervision envelope zh_huo ordering BA effort low
Chinese '或' (huò, or) framing — '{X}或{Y}?'
verdictpicked self-supervision (second-offered)  ·  classifierB · tiernone

response (200 chars)

# Reinforcement Learning 与 Self-Supervision 的比较

这两者是机器学习中不同的学习范式,各有适用场景:

## 强化学习 (Reinforcement Learning)

**核心思想**:智能体通过与环境交互,根据**奖励信号**学习最优策略。

**特点**:
- 学习信号:奖励(reward),通常稀疏、延迟
- 目标:最大化累积回报
- 需要:

neighbors

ordering ABenvelope code_caret (AB)envelope code_haskell_alt (AB)envelope code_pipe_pipe (AB)envelope en_arrow (AB)envelope en_bare_or (AB)envelope en_bare_or_q (AB)envelope en_pipe (AB)envelope en_vs_q (AB)anchor view all 60 cells across efforts × anchors