POST
语音转文字

Authorizations

Authorization
string
header
required

在请求头中传入:Authorization: Bearer sk-...

Body

multipart/form-data

音频转写或翻译请求。使用 multipart/form-data 上传音频文件,并按模型说明选择输出格式、语言提示和其他扩展字段。

file
file
required

要提交的音频文件。常见格式包括 mp3、mp4、mpeg、mpga、m4a、wav、webm;具体限制以模型为准。

model
string
required

音频转写或翻译模型 ID,例如 whisper-1 或兼容模型。

language
string

音频语言,使用 ISO-639-1 两位代码,例如 zh、en、ja。不传时由模型自动识别。

prompt
string

提示词。填写专有名词、人名、产品名或上下文,用来减少术语误写。

response_format
enum<string>

输出格式。json 供程序读取;text 只返回纯文本;srt/vtt 生成字幕;verbose_json 通常包含更详细的分段或时间信息。

Available options:
json,
text,
srt,
verbose_json,
vtt
temperature
number

采样温度。低值输出更确定,高值输出更自由;音频转写一般保持默认。

Response

转写结果

The response is of type object.