主题
Audio(即将开放)
语音类接口,含语音合成(TTS)与语音识别(ASR)两个端点(规划中 · OpenAI 兼容形态)。
TIP
该模态为预留位,接口以最终发布公告为准。当前调用对应模型将返回 400 modality_not_ready。
语音合成(tts)
POST /v1/audio/speech:文本转语音,音频二进制直接返回。
| 字段 | 类型 | 说明 |
|---|---|---|
| model | string | 语音合成模型名 |
| input | string | 待合成文本(初期上限 5000 字符) |
| voice | string | 音色 |
| response_format | string | mp3 / wav 等 |
计费口径:按输入字符数计费。
语音识别(asr)
POST /v1/audio/transcriptions:音频转文本,multipart 上传,音频 ≤ 25MB。
计费口径:按音频时长计费。