音频模型
图标说明
输入: 文本 · 音频 · 输出: 文本 · 音频
语音合成 / TTS
Azure OpenAI
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 上线时间 | 预计下线时间 | 负载能力 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|---|---|
| Azure | turing/tts-1 | 输入: 输出: Tools: 不支持 | v1/audio/speech | $15 | 2024-12-16 | - | 全球 | 中国区 欧洲区 北美区 | - |
| Azure | turing/tts-1-hd | 输入: 输出: Tools: 不支持 | v1/audio/speech | $30 | 2024-12-16 | - | 全球 | 中国区 欧洲区 北美区 | - |
语音转写 / ASR
用于会议纪要、录音转文字、说话人分离和专有名词识别。接口采用异步任务模型,先创建转写任务,再轮询结果。
| 厂商 | 服务名称 | 模型能力 | endpoint | 计费方式 | 上线时间 | 预计下线时间 | 负载能力 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|---|---|
| 阿里云 | aliyun/tingwu | 输入: 输出: 说话人分离 / 专有名词识别 / 音视频格式转换 | v1/audio/transcriptions/runs | 按音频时长计费 | - | - | - | 中国区 | 会议纪要 ASR;使用说明见 语音转写 / STT |
实时语音 / GPT-Live
全双工实时语音对话:边听边说、可随时打断,检索与工具调用委托给您的应用或 Responses 模型完成。浏览器和 App 通过 WebRTC 接入,音频直连服务;服务端和设备可以通过图灵的 WebSocket 收发音频。
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格 | 上线时间 | 预计下线时间 | 负载能力 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|---|---|
| Azure | gpt-live-1 | 输入: 输出: Tools: client / Responses 委托 | v1/live/sessions(WebRTC)ws/v1/live/sessions(WebSocket) | $0.05 / 分钟,按秒计费 | - | - | 全球 | 中国区 | 单会话上限 $10;使用说明见 GPT-Live 实时语音会话 |