主题
模型分类
平台按模态对模型分类。广场筛选项用短名(语言 / 图文 / 向量 / 图像 / 视频),卡片、后台和文档用完整业务名。 GET /v1/models 返回每个模型的 modality 字段,可用 ?modality= 过滤。
模态总览
| 模态 | 筛选项 | 业务名 | 端点 | 计费单位 | 状态 |
|---|---|---|---|---|---|
| chat | 语言 | 语言模型 | POST /v1/chat/completions | token(输入/输出分计) | ✅ 已开放 |
| vlm | 图文 | 图文理解 | POST /v1/chat/completions | token(图片折算) | ✅ 已开放 |
| embedding | 向量 | 向量模型 | POST /v1/embeddings | token(输入) | ✅ 已开放 |
| rerank | 重排 | 重排序 | POST /v1/rerank | token(query + 文档) | 敬请期待 |
| image | 图像 | 图像生成 | POST /v1/images/generations | 按张(按分辨率) | ✅ 已开放 |
| tts | — | 语音合成 | POST /v1/audio/speech | 按字符 | 敬请期待 |
| asr | — | 语音识别 | POST /v1/audio/transcriptions | 按音频时长 | 敬请期待 |
| video | 视频 | 视频生成 | POST /v1/videos/generations(异步任务;时长/精度由请求自选) | token((输入视频秒+输出秒)×宽×高×24/1024) | ✅ 已开放(Seedance / MoMa) |
| omni | — | 全模态 | — | — | 规划中 |
选型指引
- 语言模型:
modality=chat; - 图文理解(看图说话、截图、OCR):
modality=vlm(协议与 chat 完全一致,把 content 换成数组即可,见 Chat API); - RAG 检索:embedding 建索引 + rerank 精排(rerank 即将开放,可先以 embedding 相似度粗排过渡)。
- 视频生成:文生 / 图生 / 视频生 / 参考音频都走
POST /v1/videos/generations同一套入参;目录上的输入形态只做展示,网关不拦。
预留模态的接口形态以最终发布公告为准;开放前调用对应模型将返回 400 modality_not_ready。