Génération de vidéo SeeDance
Appelez les modèles Volcengine Ark Doubao Seedance via TENSORAXIS — texte-vers-vidéo, image-vers-vidéo, première/dernière image, référence/continuation vidéo, ainsi que les paramètres avancés de metadata et la facturation.
SeeDance est l'intégration TENSORAXIS des modèles vidéo Volcengine Ark Doubao Seedance (canal doubao-video). Comme tout modèle vidéo, il est asynchrone : soumettez une tâche pour obtenir un task_id, interrogez le statut de la tâche, puis lisez l'URL de la vidéo une fois terminée. Le flux commun de soumission/interrogation se trouve dans la présentation de la génération de vidéo ; cette page ne couvre que les capacités et paramètres spécifiques à SeeDance.
Utilisez les champs de requête TENSORAXIS prompt, images et metadata ; le relais les traduit dans la forme de tâche de génération de contenu Volcengine. N'envoyez pas directement le corps content[] de premier niveau en amont à /v1/video/generations, sinon TENSORAXIS ne trouvera pas de prompt et renverra 400 prompt is required.
Modèles et matrice des capacités
| Modèle | Texte-vers-vidéo | Image-vers-vidéo (première image) | Première/dernière image | Référence multimodale (image/vidéo/audio) | Audio natif |
|---|---|---|---|---|---|
doubao-seedance-1-0-lite-t2v | ✅ | — | — | — | — |
doubao-seedance-1-0-lite-i2v | — | ✅ | — | — | — |
doubao-seedance-1-0-pro-250528 | ✅ | ✅ | — | — | — |
doubao-seedance-1-5-pro-251215 | ✅ | ✅ | — | — | — |
doubao-seedance-2-0-260128 | ✅ | ✅ | ✅ | ✅ | ✅ |
doubao-seedance-2-0-fast-260128 | ✅ | ✅ | ✅ | ✅ | ✅ |
2-0-fast correspond à 2-0 en termes de capacités, mais il est optimisé pour une génération plus rapide. La prise en charge des capacités est en définitive déterminée par le modèle en amont.
Champs de la requête
POST /v1/video/generations
| Champ | Type | Obligatoire | Description |
|---|---|---|---|
model | string | Oui | Nom du modèle SeeDance (voir le tableau ci-dessus) |
prompt | string | Oui | Invite (prompt) vidéo ; si vide, renvoie 400 prompt is required |
images | string[] | Non | URLs d'images de référence pour l'image-vers-vidéo (première image) ; les références multiples vont également ici |
image | string | Non | URL d'une image de référence unique ; normalisée dans images lorsque images est vide |
seconds | string | Non | Durée en secondes ; un entier positif correspond au champ duration en amont, équivalent à metadata.duration |
metadata | object | Non | Paramètres avancés SeeDance — voir paramètres avancés de metadata |
Texte-vers-vidéo
Fournissez uniquement prompt ; ajoutez la résolution, la durée, le format d'image, etc. via metadata.
curl https://api.tensoraxis.ai/v1/video/generations \
-H "Authorization: Bearer $TENSORAXIS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "doubao-seedance-2-0-260128",
"prompt": "An old man wearing a hat smiles and walks forward down an autumn street",
"metadata": {
"resolution": "1080p",
"ratio": "16:9",
"duration": 5
}
}'Image-vers-vidéo
Première image
Transmettez une image de référence via images pour l'utiliser comme première image ; les autres paramètres correspondent à ceux du texte-vers-vidéo.
curl https://api.tensoraxis.ai/v1/video/generations \
-H "Authorization: Bearer $TENSORAXIS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "doubao-seedance-1-0-lite-i2v",
"prompt": "Slow push-in, the subject smiles",
"images": ["https://example.com/first-frame.jpg"],
"metadata": {
"resolution": "1080p",
"duration": 5
}
}'Première/dernière image (Seedance 2.0)
La première/dernière image nécessite que metadata.content étiquette chaque image avec un role explicite (first_frame / last_frame) ; cela remplace la liste de contenu générée à partir de images. Voir forme de metadata.content.
{
"model": "doubao-seedance-2-0-260128",
"prompt": "A time-lapse from dawn to sunset",
"metadata": {
"resolution": "1080p",
"duration": 5,
"content": [
{ "type": "image_url", "image_url": { "url": "https://example.com/start.jpg" }, "role": "first_frame" },
{ "type": "image_url", "image_url": { "url": "https://example.com/end.jpg" }, "role": "last_frame" }
]
}
}Référence/continuation vidéo (équivalent à « modification vidéo »)
Le backend SeeDance ne dispose d'aucun point de terminaison dédié à la modification vidéo au niveau de l'image. La capacité de « référence multimodale vidéo » de Seedance 2.0 vous permet de fournir une vidéo comme source de référence/continuation — transmettez un élément metadata.content avec video_url.
{
"model": "doubao-seedance-2-0-260128",
"prompt": "Continue the motion in this clip, the camera keeps panning right",
"metadata": {
"resolution": "1080p",
"content": [
{ "type": "video_url", "video_url": { "url": "https://example.com/source.mp4" } }
]
}
}Lorsqu'une requête contient une entrée vidéo, TENSORAXIS la classe comme « entrée vidéo » en fonction du contenu média réel (et non de la déclaration metadata) et la facture selon le palier le moins cher — voir Facturation. Si vous avez besoin d'une modification vidéo au niveau de l'image (remplacement/retouche de segments spécifiques), utilisez plutôt HappyHorse video edit (happyhorse-1.0-video-edit) à la place.
Paramètres avancés de metadata
Les champs sous metadata correspondent aux champs de premier niveau de la tâche Volcengine. La colonne « Plage / Valeur par défaut » provient de la documentation officielle Volcengine et est en définitive déterminée par le modèle en amont ; TENSORAXIS se contente de recevoir et de transmettre ces champs.
| Champ | Transmis en tant que | Type | Plage / Valeur par défaut | Description |
|---|---|---|---|---|
resolution | resolution | string | 480p / 720p / 1080p / 2k, par défaut 1080p | Résolution de sortie |
ratio | ratio | string | 16:9 / 9:16 / 4:3 / 3:4 / 21:9 / 1:1 / adaptive | Format d'image |
duration | duration | integer | 4–15, par défaut 5 | Durée en secondes ; équivalent au champ de premier niveau seconds |
frames | frames | integer | Déterminé par le modèle | Nombre total d'images (lié au fps/à la durée) |
seed | seed | integer | Graine aléatoire | Fixe l'aléatoire pour reproduire les résultats |
camera_fixed | camera_fixed | boolean | Par défaut false | Indique si la caméra doit être fixée |
watermark | watermark | boolean | Par défaut false | Indique s'il faut ajouter un filigrane |
generate_audio | generate_audio | boolean | Par défaut false | Génère un audio natif (Seedance 2.0) |
return_last_frame | return_last_frame | boolean | Par défaut false | Renvoie l'image de la dernière frame |
draft | draft | boolean | Par défaut false | Mode brouillon/aperçu |
service_tier | service_tier | string | Déterminé par le modèle | Palier de service |
execution_expires_after | execution_expires_after | integer | Déterminé par le modèle | Expiration de la tâche (secondes) |
callback_url | callback_url | string | — | URL de rappel à la fin de la tâche |
tools | tools | array | — | Configuration des outils (par ex. recherche web) |
content | content | array | — | Tableau de contenu avancé, voir ci-dessous |
Remarques :
metadata.modelest supprimé et ne peut pas remplacer le modèle facturé.- Les clés de
metadatanon mappées aux champs ci-dessus ne sont généralement pas transmises en amont. - Si
secondsetmetadata.durationsont envoyés tous les deux,metadata.durationa priorité.
Forme de metadata.content
metadata.content est un tableau de contenu avancé utilisé pour la première/dernière image, la référence vidéo, la référence audio, etc. Une fois fourni, il remplace la liste de contenu générée à partir de images (tout élément type: text est ignoré ; le corps provient de prompt).
| Type d'élément | Champs | Contraintes officielles (définies en amont) |
|---|---|---|
image_url | image_url.url, role optionnel | Image ≤30 Mo, ≤9 éléments ; role sert pour la première/dernière image |
video_url | video_url.url | Vidéo 2 à 15 s, ≤3 clips |
audio_url | audio_url.url | Audio ≤15 Mo, ≤3 clips |
text | text | Ignoré ; le corps provient du champ de premier niveau prompt |
Facturation
SeeDance est facturé au jeton (token) ; la résolution est déjà reflétée dans le nombre de jetons, donc aucun coefficient de résolution distinct ne s'applique.
- La génération classique (texte/image-vers-vidéo) utilise le palier
generate. - L'entrée vidéo (référence/continuation vidéo) est détectée à partir du contenu média réel et relève du palier réduit
video_inputmoins cher (prix unitaire inférieur à la génération classique).
Les prix unitaires exacts suivent la configuration « Video Pricing » de la console et la page de tarification ; les opérateurs peuvent remplacer les valeurs par défaut par les derniers tarifs officiels.
Interrogation de la tâche
Le flux commun de soumission/interrogation, les codes de statut et les chemins de récupération compatibles OpenAI/Sora se trouvent dans la présentation de la génération de vidéo.
Génération de vidéo
Soumettez des tâches de génération de vidéo, interrogez l'état des tâches et transmettez les paramètres avancés Seedance/Doubao via TENSORAXIS.
Génération vidéo HappyHorse
Appelez les modèles HappyHorse d'Alibaba Cloud Bailian (DashScope) via TENSORAXIS — texte-vers-vidéo, image-vers-vidéo, référence-vers-vidéo et montage vidéo, ainsi que les paramètres et la facturation.