模型 API
语音、音效与转写
根据服务能力选择文本朗读、音色、视频音效或语音识别。
语音合成
POST /audio/generations 创建异步音频任务。Qwen3-TTS 类服务使用 text 和受控音色字段,而不是所有场景都使用 prompt。
{"model":"<TTS_MODEL_ALIAS>","text":"欢迎使用星海智算。","voiceMode":"text"}| 模式 | 字段 | 提醒 |
|---|---|---|
| 普通朗读 | voiceMode=text | 不上传视频、不猜预计音频秒数。 |
| 内置音色 | voiceMode=custom_voice,speaker | speaker 使用模型支持的枚举,例如服务允许时的 serena。 |
| 音色描述 | voiceMode=voice_design,instruct | 只在服务开放此模式时使用。 |
可用音色见 音色目录 与 详情,以及目标服务的实际能力。音乐生成或其他音频模型按其请求合同选择参数,不复用 TTS 的字段猜测。
为视频生成音效
先以 video 字段上传受支持的视频,再向音效模型提交:
{"model":"<FOLEY_MODEL_ALIAS>","prompt":"与画面同步的脚步和衣物摩擦声","input_video_asset_id":"<VIDEO_ASSET_ID>"}它生成音频,不自动替你把音轨合并回原视频。使用 任务查询和下载,按真实 MIME 保存输出。
语音转写
POST /audio/transcriptions 使用 multipart 上传文件,不能把 Python bytes 放进 JSON。
curl --fail-with-body --max-time 180 "$JUSP_BASE_URL/audio/transcriptions" \
-H "Authorization: Bearer $JUSP_API_KEY" \
-F "model=$JUSP_MODEL" -F 'file=@speech.wav'支持的格式、时长、语言和返回选项由目标 ASR 服务决定。转写为同步文本响应,不要按媒体 Job 的 jobId 读取它。