Skip to content

模型分类

平台按模态对模型分类。广场筛选项用短名(语言 / 图文 / 向量 / 图像 / 视频),卡片、后台和文档用完整业务名。 GET /v1/models 返回每个模型的 modality 字段,可用 ?modality= 过滤。

模态总览

模态筛选项业务名端点计费单位状态
chat语言语言模型POST /v1/chat/completionstoken(输入/输出分计)✅ 已开放
vlm图文图文理解POST /v1/chat/completionstoken(图片折算)✅ 已开放
embedding向量向量模型POST /v1/embeddingstoken(输入)✅ 已开放
rerank重排重排序POST /v1/reranktoken(query + 文档)敬请期待
image图像图像生成POST /v1/images/generations按张(按分辨率)✅ 已开放
tts语音合成POST /v1/audio/speech按字符敬请期待
asr语音识别POST /v1/audio/transcriptions按音频时长敬请期待
video视频视频生成POST /v1/videos/generations(异步任务;时长/精度由请求自选)token((输入视频秒+输出秒)×宽×高×24/1024)✅ 已开放(Seedance / MoMa)
omni全模态规划中

选型指引

  • 语言模型modality=chat
  • 图文理解(看图说话、截图、OCR):modality=vlm(协议与 chat 完全一致,把 content 换成数组即可,见 Chat API);
  • RAG 检索:embedding 建索引 + rerank 精排(rerank 即将开放,可先以 embedding 相似度粗排过渡)。
  • 视频生成:文生 / 图生 / 视频生 / 参考音频都走 POST /v1/videos/generations 同一套入参;目录上的输入形态只做展示,网关不拦。

预留模态的接口形态以最终发布公告为准;开放前调用对应模型将返回 400 modality_not_ready