↶ lobby  ·  fable  ·  hijack  ·  ja_ka  ·  reinforcement / self-supervision · BA

one fable-low hijack cell

pair reinforcement / self-supervision envelope ja_ka ordering BA effort low
Japanese 'か' (ka) particle framing — '{X}か{Y}か?'
verdictpicked reinforcement (first-offered)  ·  classifierA · tiernone

response (200 chars)

ご質問の文脈が少し曖昧なので、考えられる2つの解釈でお答えしますね。

## 1. 大規模言語モデル(私のようなAI)の学習方法について

実際には**両方が使われています**:

- **自己教師あり学習(self-supervision)**:事前学習の段階。大量のテキストから「次の単語を予測する」タスクを通じて学習します。ラベル付けが不要で、テキスト自体が教師信号になります。
- **強化学

neighbors

ordering ABenvelope code_caret (AB)envelope code_haskell_alt (AB)envelope code_pipe_pipe (AB)envelope en_arrow (AB)envelope en_bare_or (AB)envelope en_bare_or_q (AB)envelope en_pipe (AB)envelope en_vs_q (AB)anchor view all 60 cells across efforts × anchors