Skip to main content
Il text-to-speech trasforma il testo scritto in audio parlato. Scegli un modello TTS, seleziona una voce supportata da quel modello, invia il testo a /audio/speech e salva la risposta audio binaria. Usa questa guida per la generazione vocale standard. Se vuoi creare audio a partire da una voce di riferimento personalizzata, consulta Voice Cloning.

Utilizzo di Base

Il corpo della risposta di successo è audio binario nel formato predefinito del modello, non JSON. Attualmente tts-kokoro usa MP3 come formato predefinito.

Scelta di Modello e Voce

Le voci sono specifiche per modello. Il valore di voice deve essere valido per il model che scegli. Usa la pagina Modelli Text-to-Speech per esplorare i modelli e le voci disponibili. Il selettore delle voci elenca gli ID esatti da passare nella richiesta.
Gli ID delle voci fanno distinzione tra maiuscole e minuscole. Se cambi modello TTS, aggiorna contemporaneamente il valore di voice.

Struttura della Richiesta

Formato di Output

Puoi omettere response_format per usare il formato predefinito del modello. Prima di scegliere un’estensione di file o sovrascrivere il formato, interroga l’API Models per conoscere i valori correnti di default_format e supported_formats del modello:
L’header Content-Type della risposta identifica il formato audio restituito. Richiedere un formato non supportato dal modello selezionato restituisce HTTP 400.

Consigli per la Produzione

  • Metti in cache l’audio generato quando il testo sorgente e la voce vengono riutilizzati.
  • Normalizza e revisiona il testo prima della sintesi. La punteggiatura influenza ritmo e intonazione.
  • Salva l’output con l’estensione di file corretta in base al formato di risposta del modello.

Risorse Correlate

Devi narrare qualcosa di più lungo di poche frasi? Narrare articoli con il Text-to-Speech copre il limite di 4096 caratteri in input, la suddivisione del testo sui confini delle frasi, l’unione dei pezzi in un unico file audio e lo streaming per la riproduzione interattiva.