星海智算开发文档
模型 API

语音、音效与转写

根据服务能力选择文本朗读、音色、视频音效或语音识别。

语音合成

POST /audio/generations 创建异步音频任务。Qwen3-TTS 类服务使用 text 和受控音色字段,而不是所有场景都使用 prompt

{"model":"<TTS_MODEL_ALIAS>","text":"欢迎使用星海智算。","voiceMode":"text"}
模式字段提醒
普通朗读voiceMode=text不上传视频、不猜预计音频秒数。
内置音色voiceMode=custom_voicespeakerspeaker 使用模型支持的枚举,例如服务允许时的 serena
音色描述voiceMode=voice_designinstruct只在服务开放此模式时使用。

可用音色见 音色目录详情,以及目标服务的实际能力。音乐生成或其他音频模型按其请求合同选择参数,不复用 TTS 的字段猜测。

为视频生成音效

先以 video 字段上传受支持的视频,再向音效模型提交:

{"model":"<FOLEY_MODEL_ALIAS>","prompt":"与画面同步的脚步和衣物摩擦声","input_video_asset_id":"<VIDEO_ASSET_ID>"}

它生成音频,不自动替你把音轨合并回原视频。使用 任务查询和下载,按真实 MIME 保存输出。

语音转写

POST /audio/transcriptions 使用 multipart 上传文件,不能把 Python bytes 放进 JSON。

curl --fail-with-body --max-time 180 "$JUSP_BASE_URL/audio/transcriptions" \
  -H "Authorization: Bearer $JUSP_API_KEY" \
  -F "model=$JUSP_MODEL" -F 'file=@speech.wav'

支持的格式、时长、语言和返回选项由目标 ASR 服务决定。转写为同步文本响应,不要按媒体 Job 的 jobId 读取它。

本页目录