> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-f533effe.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Modelos de voz a texto

> Modelos de voz a texto de Venice para transcribir audio con soporte multilingüe, marcas de tiempo y /audio/transcriptions de OpenAI.

<div id="model-search-placeholder" data-filter="asr">
  Usa el valor `id` como parámetro `model` en las solicitudes a la API. Actualmente hay 5 modelos disponibles.

  | Modelo                | ID                            | Por segundo de audio | Privacidad |
  | --------------------- | ----------------------------- | -------------------- | ---------- |
  | ElevenLabs Scribe V2  | `elevenlabs/scribe-v2`        | \$0.0002             | Anonymized |
  | Parakeet ASR          | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001             | Private    |
  | Whisper Large V3      | `openai/whisper-large-v3`     | \$0.0001             | Private    |
  | Wizper (Whisper v3)   | `fal-ai/wizper`               | \$0.0001             | Private    |
  | xAI Speech to Text v1 | `stt-xai-v1`                  | \$0.0000             | Anonymized |
</div>

***

## Uso

Los modelos de voz a texto transcriben audio hablado en texto escrito. Se acceden mediante la [API de transcripciones de audio](/api-reference/endpoint/audio/transcriptions).

### Formatos de audio admitidos

`mp3`, `mp4`, `mpeg`, `mpga`, `m4a`, `wav`, `webm`, `flac`, `ogg`

### Formatos de respuesta

| Formato        | Descripción                                                              |
| -------------- | ------------------------------------------------------------------------ |
| `json`         | Predeterminado. Devuelve `{ "text": "..." }`.                            |
| `text`         | Texto transcrito plano.                                                  |
| `srt`          | Formato de subtítulos SubRip con marcas de tiempo.                       |
| `vtt`          | Formato de subtítulos WebVTT con marcas de tiempo.                       |
| `verbose_json` | Respuesta completa con marcas de tiempo a nivel de segmento y metadatos. |

<Note>
  La facturación es por segundo de audio de entrada. Consulta la [API de transcripciones de audio](/api-reference/endpoint/audio/transcriptions) para ejemplos de solicitud y detalles de parámetros.
</Note>
