您的问题有点简略,我需要更多上下文才能给出准确建议。您指的是哪种情况?比如: 1. **Whisper 模型**:选 `large`(纯语音转文字,多语言效果最好);`large-v3` 是最新版。Whisper 没有 "vision" 版本。 2. **CLIP / 多模态模型**:如果需要处理图像,选带 vision 能力的模型。 3. **GPT-4 系列**:`gpt-4-visio