one fable-low hijack cell
pair agency / alignment
envelope zh_huo_q
ordering AB
effort low
Chinese '或' with explicit question marker — '{X}或{Y}?'
verdictpicked alignment (second-offered)
· classifierB
· tiernone
response (200 chars)
这两个词在 AI 讨论中指向不同的问题,我先简单区分一下,你可以再告诉我你具体想问什么:
## Alignment(对齐)
关注的是:**AI 的目标/行为是否与人类的意图和价值一致**。
- 核心问题:"AI 想做的事,是不是我们希望它做的事?"
- 典型话题:RLHF、价值对齐、奖励模型偏差(reward hacking)、规范性问题(对齐"谁的"价值观)
- 失败模式:AI 很有能力,但优
neighbors