文字转语音
OpenAI Audio Speech 兼容接口,将文本合成为音频。接口直接返回音频二进制内容。
请求格式
使用 application/json。必须包含 model、input 和 voice。
参数要点
input:要朗读的文本。长文本按段落拆分,停顿更自然,失败后也更容易重试。voice:音色 ID,不同模型的音色列表不同。response_format:常见值为 mp3、wav、opus、aac、flac、pcm。speed:语速设置,默认 1。
读取结果
响应体是音频文件本体,不是 JSON。服务端写入文件或对象存储;浏览器端转成 Blob 后播放或下载。
POST
Authorizations
在请求头中传入:Authorization: Bearer sk-...
Body
application/json
文字转语音请求。提交文本、模型和音色后,接口返回音频二进制内容。
语音合成模型 ID,例如 tts-1、tts-1-hd 或兼容模型。
要合成的文本。较长内容按段落拆分,停顿、重试和结果保存都会更可控。
音色 ID,例如 alloy、nova、shimmer 等。可用音色以模型页或控制台展示为准。
输出音频格式。mp3 面向通用播放;wav/pcm 面向后续音频编辑;opus/aac/flac 面向特定播放或压缩需求。
Available options:
mp3, opus, aac, flac, wav, pcm 语速设置。常见范围为 0.25 到 4.0,默认 1。
Response
音频文件