> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-f533effe.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# 语音转文本模型

> 用于将音频转录为文本的 Venice 语音转文本模型，支持多语言、时间戳，并提供 OpenAI 兼容的 /audio/transcriptions 端点。

<div id="model-search-placeholder" data-filter="asr">
  在 API 请求中，将 `id` 值用作 `model` 参数。当前有 5 个模型可用。

  | Model                 | ID                            | Per audio second | Privacy    |
  | --------------------- | ----------------------------- | ---------------- | ---------- |
  | ElevenLabs Scribe V2  | `elevenlabs/scribe-v2`        | \$0.0002         | Anonymized |
  | Parakeet ASR          | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001         | Private    |
  | Whisper Large V3      | `openai/whisper-large-v3`     | \$0.0001         | Private    |
  | Wizper (Whisper v3)   | `fal-ai/wizper`               | \$0.0001         | Private    |
  | xAI Speech to Text v1 | `stt-xai-v1`                  | \$0.0000         | Anonymized |
</div>

***

## 使用方式

语音转文本模型可将口语音频转录为书面文本。它们通过 [Audio Transcriptions API](/api-reference/endpoint/audio/transcriptions) 访问。

### 支持的音频格式

`mp3`、`mp4`、`mpeg`、`mpga`、`m4a`、`wav`、`webm`、`flac`、`ogg`

### 响应格式

| 格式             | 说明                         |
| -------------- | -------------------------- |
| `json`         | 默认。返回 `{ "text": "..." }`。 |
| `text`         | 纯文本转录结果。                   |
| `srt`          | 带时间戳的 SubRip 字幕格式。         |
| `vtt`          | 带时间戳的 WebVTT 字幕格式。         |
| `verbose_json` | 包含段级时间戳和元数据的完整响应。          |

<Note>
  计费按输入音频的秒数进行。请参阅 [Audio Transcriptions API](/api-reference/endpoint/audio/transcriptions) 了解请求示例和参数细节。
</Note>
