Referencia de la API

Audio

Utiliza las API de generación de voz, transcripción de audio y traducción de audio.

Las API de audio incluyen generación de voz, transcripción y traducción. La generación de voz utiliza un cuerpo de solicitud JSON; la transcripción y la traducción suelen utilizar datos de formulario multipart para cargar el archivo de audio.

Puntos de conexión

MétodoRutaDescripción
POST/v1/audio/speechTexto a voz
POST/v1/audio/transcriptionsTranscripción de audio
POST/v1/audio/translationsTraducción de audio

Campos de solicitud

CampoTipoAplica aDescripción
modelstringAllID del modelo de audio, obligatorio
inputstringspeechTexto a sintetizar
voicestringspeechID de voz
instructionsstringspeechEstilo de voz o instrucciones adicionales
response_formatstringAllFormato de respuesta. La transcripción y la traducción usan json de forma predeterminada
speednumberspeechVelocidad de la voz
stream_formatstringspeechConfigúralo en sse para habilitar el streaming cuando el modelo lo admita
metadataobjectspeechMetadatos de transferencia directa
filefiletranscriptions/translationsArchivo de audio en datos de formulario multipart, obligatorio
languageanyextensionOpción de idioma admitida por algunos canales

Generación de voz

curl https://api.tensoraxis.ai/v1/audio/speech \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -d '{
    "model": "tts-1",
    "voice": "alloy",
    "input": "Hello from TENSORAXIS.",
    "response_format": "mp3"
  }' \
  --output speech.mp3

Transcripción

curl https://api.tensoraxis.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -F model="whisper-1" \
  -F file="@audio.mp3" \
  -F response_format="json"

Traducción

curl https://api.tensoraxis.ai/v1/audio/translations \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -F model="whisper-1" \
  -F file="@audio.mp3" \
  -F response_format="json"

Estructura de la respuesta

Las respuestas JSON de transcripción y traducción suelen incluir text:

{
  "text": "Transcribed text..."
}

La generación de voz devuelve audio binario directamente. El Content-Type de la respuesta depende de response_format y del modelo subyacente.