one fable-low hijack cell
pair reinforcement / self-supervision
envelope ja_ka
ordering BA
effort low
Japanese 'か' (ka) particle framing — '{X}か{Y}か?'
verdictpicked reinforcement (first-offered)
· classifierA
· tiernone
response (200 chars)
ご質問の文脈が少し曖昧なので、考えられる2つの解釈でお答えしますね。
## 1. 大規模言語モデル(私のようなAI)の学習方法について
実際には**両方が使われています**:
- **自己教師あり学習(self-supervision)**:事前学習の段階。大量のテキストから「次の単語を予測する」タスクを通じて学習します。ラベル付けが不要で、テキスト自体が教師信号になります。
- **強化学
neighbors