# 语音转文字

`POST /v1/audio/transcriptions`

OpenAI Audio Transcriptions 兼容接口，将音频转成原语言文本。

## 请求格式
使用 `multipart/form-data` 上传音频文件。必须包含 `file` 和 `model`。

## 参数要点
- `language`：音频语言，优先填 `zh`、`en` 这类两位代码；不传时自动识别。
- `prompt`：填写人名、品牌名、产品名或上下文，减少术语误写。
- `response_format`：`json` 供程序读取，`text` 返回纯文本，`srt`/`vtt` 生成字幕，`verbose_json` 返回分段和时间信息。

## 接入顺序
先用 10 到 30 秒音频确认模型、格式和语言识别，再接入长音频切片、批量转写和结果保存。

## 错误定位
1. 文件无法识别：检查音频格式、文件大小和 Content-Type。
2. 专有名词错误：把术语写进 `prompt`。
3. 字幕时间不准：使用 `verbose_json` 查看分段，再决定是否后处理。

Tags: 语音与音频
