verdictpicked control (first-offered)
· classifierA
· tiernone
response (200 chars)
这个问题可以从几个角度理解,我先说说 AI 领域常见的区分:
## AI Safety vs. AI Control
**Safety(安全)**:让 AI 系统本身"想做对的事"
- 目标对齐(alignment):让模型的价值观、目标与人类意图一致
- 假设:如果训练得当,模型会真诚地配合
- 方法:RLHF、宪法式 AI、可解释性研究等
**Control(控制)**:假设 AI 可能