Skip to content

Audio(即将开放)

语音类接口,含语音合成(TTS)与语音识别(ASR)两个端点(规划中 · OpenAI 兼容形态)。

TIP

该模态为预留位,接口以最终发布公告为准。当前调用对应模型将返回 400 modality_not_ready

语音合成(tts)

POST /v1/audio/speech:文本转语音,音频二进制直接返回。

字段类型说明
modelstring语音合成模型名
inputstring待合成文本(初期上限 5000 字符)
voicestring音色
response_formatstringmp3 / wav 等

计费口径:按输入字符数计费。

语音识别(asr)

POST /v1/audio/transcriptions:音频转文本,multipart 上传,音频 ≤ 25MB。

计费口径:按音频时长计费。