one fable-low hijack cell
pair alignment / supervision
envelope chinese_casual
ordering BA
effort low
verdictpicked alignment (first-offered)
· classifierA
· tiernone
response (200 chars)
# Supervision vs. Alignment
这两个概念在 AI 安全领域相关但不同,我来梳理一下:
## Supervision(监督)
指**训练过程中提供反馈信号**的机制:
- **直接监督**:人类标注数据、RLHF 中的偏好标注
- **Scalable oversight(可扩展监督)**:当任务复杂到人类难以直接评估时(如长代码、科学论证),如何仍能有效监督模型
neighbors