Référence API

Génération vidéo HappyHorse

Appelez les modèles HappyHorse d'Alibaba Cloud Bailian (DashScope) via TENSORAXIS — texte-vers-vidéo, image-vers-vidéo, référence-vers-vidéo et montage vidéo, ainsi que les paramètres et la facturation.

HappyHorse est l'intégration TENSORAXIS des modèles vidéo Alibaba Cloud Bailian (DashScope) (canal HappyHorse). Il s'agit d'une tâche asynchrone : soumettez une tâche pour obtenir un task_id, interrogez l'état de la tâche, puis récupérez l'URL de la vidéo une fois terminée. Le flux commun de soumission/interrogation se trouve dans la vue d'ensemble de la génération vidéo ; cette page ne couvre que les quatre capacités et paramètres de HappyHorse.

Les quatre capacités se distinguent par le suffixe du nom de modèle :

CapacitéModèlesDescription
Texte-vers-vidéo (t2v)happyhorse-1.1-t2v, happyhorse-1.0-t2vGénère à partir d'un prompt uniquement
Image-vers-vidéo (i2v)happyhorse-1.1-i2v, happyhorse-1.0-i2vGénère à partir d'une image initiale
Référence-vers-vidéo (r2v)happyhorse-1.1-r2v, happyhorse-1.0-r2vGénère à partir de plusieurs images de référence
Montage vidéo (video-edit)happyhorse-1.0-video-editModifie à partir d'une vidéo source + images de référence

Champs de requête

POST /v1/video/generations

ChampTypeRequisDescription
modelstringOuiNom du modèle HappyHorse (voir le tableau ci-dessus)
promptstringOuiPrompt vidéo ; vide renvoie 400 prompt is required
metadata.mediaarraySelon la capacitéTableau des entrées média ; chaque élément a type et url ; type vaut first_frame / reference_image / video
imagesstring[]Selon la capacitéURLs des images de référence (pour r2v) ; traitées comme images de référence lorsque metadata.media est absent
imagestringSelon la capacitéURL d'une image unique (image initiale pour i2v)
input_referencestringSelon la capacitéURL de référence d'entrée (entrée de compatibilité pour l'image initiale i2v / image de référence r2v)
metadataobjectNonRésolution, durée, format d'image, etc. — voir Paramètres

Préférez transmettre les médias via metadata.media, en étiquetant l'usage de chaque élément avec type. images / image / input_reference sont des entrées de compatibilité : lorsque metadata.media est absent, i2v prend input_reference/image comme première image, et r2v prend images/input_reference comme images de référence. La vidéo source pour le montage vidéo doit être transmise via metadata.media (type: video).

Texte-vers-vidéo (-t2v)

Nécessite uniquement prompt ; aucune entrée média n'est acceptée.

curl https://api.tensoraxis.ai/v1/video/generations \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "happyhorse-1.1-t2v",
    "prompt": "A lake at the foot of a snowy mountain reflects the sunset; the camera slowly pushes in",
    "metadata": {
      "resolution": "1080P",
      "ratio": "16:9",
      "duration": 5
    }
  }'

Image-vers-vidéo (-i2v)

Exactement une image initiale. Transmettez-la via metadata.media (type: first_frame), ou utilisez les entrées de compatibilité input_reference / image. ratio n'est pas accepté (le format d'image est déterminé par l'image initiale).

curl https://api.tensoraxis.ai/v1/video/generations \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "happyhorse-1.1-i2v",
    "prompt": "The subject slowly looks up and smiles",
    "metadata": {
      "resolution": "1080P",
      "duration": 5,
      "media": [
        { "type": "first_frame", "url": "https://example.com/first-frame.jpg" }
      ]
    }
  }'

Référence-vers-vidéo (-r2v)

Génère à partir de plusieurs images de référence. La passerelle accepte 1 à 9 images de référence (éléments reference_image dans metadata.media, ou images au niveau supérieur) ; en amont, il est recommandé de ne pas dépasser 5, et au-delà, le résultat dépend de la réponse en amont.

curl https://api.tensoraxis.ai/v1/video/generations \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "happyhorse-1.1-r2v",
    "prompt": "Have these characters interact in the same scene",
    "images": [
      "https://example.com/ref-1.jpg",
      "https://example.com/ref-2.jpg"
    ],
    "metadata": {
      "resolution": "1080P",
      "ratio": "16:9",
      "duration": 5
    }
  }'

Montage vidéo (-video-edit)

Modifie à partir d'une vidéo source. Vous devez transmettre exactement une vidéo source type: video via metadata.media ; vous pouvez ajouter des images de référence (type: reference_image, ≤5 au niveau de la passerelle, ≤4 en amont).

  • duration n'est pas accepté : la sortie conserve la durée de la vidéo source, donc aucun paramètre de durée n'est envoyé.
  • Prend en charge audio_setting (cette capacité uniquement) : auto (par défaut) / origin.
curl https://api.tensoraxis.ai/v1/video/generations \
  -H "Authorization: Bearer $TENSORAXIS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "happyhorse-1.0-video-edit",
    "prompt": "Replace the background with a dusk city skyline",
    "metadata": {
      "resolution": "1080P",
      "audio_setting": "origin",
      "media": [
        { "type": "video", "url": "https://example.com/source.mp4" },
        { "type": "reference_image", "url": "https://example.com/style.jpg" }
      ]
    }
  }'

Paramètres

Les paramètres sous metadata correspondent aux champs de requête DashScope en amont. « Valeur de la passerelle » est la valeur que ce site valide/limite réellement ; « Remarques » sont fournies à titre indicatif et sont en définitive déterminées par la réponse en amont.

ParamètreTypeS'applique àValeur de la passerelle / Par défautRemarques
resolutionstringToutes720P / 1080P, par défaut 1080PLes valeurs non reconnues reviennent à 1080P
ratiostringt2v / r2v uniquement16:9 / 9:16 / 1:1 / 4:3 / 3:4 ; par défaut 16:9 en amont si omisNon accepté par i2v / video-edit
durationintegert2v / i2v / r2vLimité à [3,15], par défaut 5Non accepté par video-edit (la sortie conserve la durée de la source)
seedintegerToutes[0, 2147483647]Fixe l'aléa ; un 0 explicite est conservé et envoyé
watermarkbooleanToutesPar défaut false (envoyé explicitement)Indique si un filigrane doit être ajouté
audio_settingstringvideo-edit uniquementauto (par défaut) / originGestion audio

La plage officielle de duration varie selon le scénario (texte-vers-vidéo environ [2,15], avec-vidéo environ [2,10]), mais la passerelle limite uniformément à [3,15] ; les valeurs hors plage sont tronquées à la limite.

Facturation

HappyHorse est facturé à la seconde, multiplié par un coefficient de résolution (1080P est environ 1,78× de 720P).

  • Pour t2v / i2v / r2v, la durée est connue au moment de la requête et est facturée selon la durée réelle × coefficient de résolution.
  • Le montage vidéo n'a pas d'entrée duration (sortie = durée de la vidéo source), il est donc facturé selon la valeur déclarée metadata.duration ; lorsqu'elle n'est pas déclarée, une valeur par défaut prudente (environ 10 secondes) est utilisée.

Les prix unitaires exacts suivent la configuration « Tarification vidéo » de la console et la page de tarification ; les opérateurs peuvent remplacer les valeurs par défaut par les derniers tarifs officiels.

Interrogation des tâches

Le flux commun de soumission/interrogation, les codes de statut et les chemins de récupération compatibles OpenAI/Sora se trouvent dans la vue d'ensemble de la génération vidéo.