Référence API
Audio
Utilisez les API de génération vocale, de transcription audio et de traduction audio.
Les API Audio incluent la génération vocale, la transcription et la traduction. La génération vocale utilise un corps de requête JSON ; la transcription et la traduction utilisent généralement des données multipart form pour téléverser le fichier audio.
Points de terminaison
| Méthode | Chemin | Description |
|---|---|---|
POST | /v1/audio/speech | Synthèse vocale |
POST | /v1/audio/transcriptions | Transcription audio |
POST | /v1/audio/translations | Traduction audio |
Champs de la requête
| Champ | Type | S'applique à | Description |
|---|---|---|---|
model | string | Toutes | Identifiant du modèle audio, requis |
input | string | vocal | Texte à synthétiser |
voice | string | vocal | Identifiant de la voix |
instructions | string | vocal | Style vocal ou instructions supplémentaires |
response_format | string | Toutes | Format de réponse. La transcription et la traduction utilisent json par défaut |
speed | number | vocal | Vitesse de la parole |
stream_format | string | vocal | Définir sur sse pour activer le streaming lorsque le modèle le prend en charge |
metadata | object | vocal | Métadonnées transmises telles quelles |
file | file | transcriptions/traductions | Fichier audio en données multipart form, requis |
language | any | extension | Option de langue prise en charge par certains canaux |
Génération vocale
curl https://api.tensoraxis.ai/v1/audio/speech \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $TENSORAXIS_API_KEY" \
-d '{
"model": "tts-1",
"voice": "alloy",
"input": "Hello from TENSORAXIS.",
"response_format": "mp3"
}' \
--output speech.mp3Transcription
curl https://api.tensoraxis.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $TENSORAXIS_API_KEY" \
-F model="whisper-1" \
-F file="@audio.mp3" \
-F response_format="json"Traduction
curl https://api.tensoraxis.ai/v1/audio/translations \
-H "Authorization: Bearer $TENSORAXIS_API_KEY" \
-F model="whisper-1" \
-F file="@audio.mp3" \
-F response_format="json"Structure de la réponse
Les réponses JSON de transcription et de traduction incluent généralement text :
{
"text": "Transcribed text..."
}La génération vocale renvoie directement l'audio binaire. Le Content-Type de la réponse dépend de response_format et du modèle en amont.