Lo que ves arriba en el reel no es una segunda cámara: es la misma toma, reencuadrada por un modelo que salió hace ocho días. Aquí está qué modelo es, cuál de sus endpoints hace eso, qué se sube exactamente, cómo se escribe el prompt, lo que cuesta de verdad — y los cinco errores que te van a cobrar en la primera tarde.
¿Sin ganas de tocar una API? El mismo modelo vive
dentro de Dreamina,
el producto de ByteDance — la lógica de esta guía es idéntica, sólo cambia dónde subes los
archivos.
Límites, parámetros y precios consultados en el blog de ByteDance Seed y en fal.ai el
8 de agosto de 2026, ocho días después del lanzamiento. Todo esto es material nuevo y
puede cambiar; cada captura lleva su fecha.
→ No es un recorte del video: es una generación nueva que usa tu toma como
referencia.
→ Se hace en el endpoint reference-to-video, el único que acepta un video de entrada.
→ Tu toma se sube troceada a 30 segundos o menos, más 2–4 fotos sueltas de tu cara.
→ El ángulo se escribe en el prompt — no hay perilla de cámara: «low angle, slow
push-in, handheld drift».
→ Apaga generate_audio o el modelo te reinventa la voz. Y cuesta
~$0.28 USD por segundo, contando también los segundos que subes.
Seedance 2.5 es el modelo de generación de video de ByteDance Seed — la misma casa de TikTok y CapCut. ByteDance saltó de la versión 2.0 directo a la 2.5: no existen 2.1 a 2.4. Se lanzó primero dentro de sus propios productos (Jimeng y Doubao) y la API pública para desarrolladores llegó una semana después.
El titular de su anuncio dice exactamente de qué va la versión — y no habla de píxeles:
Los dos párrafos que sostienen todo lo demás, textuales de ese anuncio:
La diferencia entre “generar un video con IA” y “darle tu video a una IA para que lo reencuadre” es la diferencia entre un resultado que no controlas y uno que sí. Grabas una vez, con la cámara donde puedas ponerla, y los ángulos se deciden después. Eso mueve el cuello de botella de la producción a la edición — que es exactamente donde una persona sola puede competir con un equipo.
Seedance 2.5 tiene tres endpoints públicos en fal.ai, y sólo uno sirve para esto:
text-to-video genera desde cero. image-to-video anima una imagen (y acepta un frame final, que es el clásico “primer y último cuadro”). Y reference-to-video es el único que acepta un video como referencia — el tuyo. Ése es el que reencuadra una toma que ya existe.
Dentro del prompt, cada cosa que subes se invoca con una etiqueta numerada según el orden
en que la subiste: @Video1, @Image1, @Image2,
@Audio1. La documentación de Replicate usa corchetes —
[Video1] — para lo mismo.
Y éstos son los límites reales de lo que puedes subir. Vale la pena leerlos antes de cortar nada, porque tres de ellos deciden cómo tienes que preparar el material:
Los 30.2 segundos no son una recomendación: es un tope duro y es la suma de todos los videos que subas. Si tu toma dura más —y casi cualquier talking-head real dura más— el primer paso del workflow no es escribir el prompt: es partir el clip. Es la restricción que más planes rompe, y no aparece en ningún tutorial de portada.
| Lo que pides | Segundos que te cobran | Costo |
|---|---|---|
| Un ángulo: subes 10 s, pides 10 s · 720p | 20 s (entrada + salida) | ≈ $5.68 |
| Cuatro ángulos del mismo trozo · 720p | 80 s | ≈ $22.70 |
| Un clip completo: subes 30 s, pides 30 s · 720p | 60 s | ≈ $17.03 |
| La misma prueba de un ángulo · 480p | 20 s | ≈ $4.41 |
Esa última fila es el consejo que más dinero ahorra: las primeras cinco o seis tiradas son para descubrir qué palabras mueven la cámara, y para eso la resolución da igual. Cuando el encuadre ya sale como lo quieres, cambias una línea y tiras el bueno. Quienes lo usan a diario van más lejos todavía: prueban en Seedance 2.0, que es ~50% más barato, y sólo pagan 2.5 en el render final.
Éste es el camino completo. No hay que programar nada: los tres primeros pasos son ffmpeg o cualquier editor, y el resto se hace en el panel que viste en la sección 02.
Cada trozo es una generación aparte. Corta en pausas naturales del habla, no a mitad de una palabra: el modelo va a re-sintetizar el movimiento y una frase partida se nota.
Son las imágenes que le dicen al modelo cómo eres. Van como archivos separados, uno por encuadre.
Esto ahorra dineroMeter varios encuadres dentro de una sola imagen tipo collage o cuadrícula da peores resultados que subirlos por separado. Cada referencia debe enseñar una cosa.La numeración de las etiquetas sigue el orden de subida dentro de cada tipo. Si te equivocas de orden, el prompt va a estar hablando de la imagen equivocada.
La sección 05 trae los prompts listos para copiar y el vocabulario de cámara que el modelo entiende.
Viene encendida por defecto y el modelo reinventa la voz a partir de lo que deduce de tus imágenes. Si vas a conservar tu audio original —y en un talking-head siempre es que sí— este interruptor no es opcional.
Lo que pasa si noEn una prueba documentada, el modelo le puso a un personaje una voz que no correspondía en absoluto. No es un error que puedas arreglar después: hay que volver a pagar la tirada.La semilla es lo que te deja repetir la misma tirada cambiando una sola palabra del prompt. Sin ella cada intento es un experimento nuevo y no aprendes nada de la comparación.
{
"video_urls": ["tu-toma-cortada.mp4"],
"image_urls": ["frente.jpg", "perfil.jpg", "plano-medio.jpg"],
"prompt": "…",
"resolution": "720p",
"aspect_ratio": "9:16",
"duration": "10",
"generate_audio": false,
"seed": 1234
}
La estructura que recomienda la propia guía de ByteDance es siempre la misma: sujeto → acción → cámara → estilo. Y hay una lista corta de movimientos que el modelo reconoce por su nombre. Escribirlos así vale más que describirlos con adjetivos:
El patrón base para reencuadrar es “cambia X, conserva el movimiento original”. Éste es el ejemplo textual que publica la documentación de Replicate — cámbiale el sujeto y ya tienes el tuyo:
Keep the person, the room and the timing from @Video1 exactly as they are. The face and clothing match @Image1 and @Image2. Re-frame the same moment as a slow push-in from a low angle, ending at a medium close-up. Handheld drift, very subtle. Natural daylight, no color grade, no added text. Do not use the background from @Image1.
Same person, same room, same audio timing as @Video1. Face reference: @Image1, @Image2. 0-4s wide shot from the side, static. 4-9s cut to a top-down angle looking down at the desk. 9-15s cut to a medium close-up, slow push-in, handheld drift. Keep the subject consistent across all three shots. Natural daylight.
Create a 28.6-second Seedance 2.5 video-to-video transformation using the uploaded footage as the exact performance reference. Preserve the same room, chair, microphone, clothing, hair, body proportions, facial identity, skin texture, hand gestures, eyeline, lip movement, speech timing and acting. He wears no cap and no hat. He holds a small handheld microphone in his right hand the whole time. The main character's face must remain identical in every frame. Do not beautify, reshape, replace or reinterpret him. Keep every spoken word unchanged with accurate lip sync. Make it one continuous, dynamic music-video-style take inside the same room. No cuts, scene changes, teleporting, duplicate characters or random objects. Every virtual camera move must connect smoothly with believable perspective, parallax, motion blur and room geometry. Keep the character anchored to his original performance. Do not distort or cover his face. Use polished kinetic supers timed to key phrases, appearing beside or behind him with realistic depth and clean dissolves. Do not subtitle the spoken words — the only on-screen text is the supers listed below, exactly as written. 0-2.65s, "¿Sabías que puedes lograr estas tomas cinematográficas" Start from the original framing. The daylight and the room lights power off, turning the room dark and creating a dramatic stage silhouette with a thin rim light around his hair and shoulders, subtle haze and a back spotlight. Add a slight floating camera push. Large 3D text "TOMAS DE CINE" briefly forms behind him, partially hidden by his body, then fades. Preserve enough facial detail to maintain identity. 2.65-4.3s, "sin tener que mover tu cámara?" Accelerate smoothly into a tight face close-up using a physical camera push, not a digital crop. Keep his face sharp and unchanged. "¿SIN MOVER LA CÁMARA?" appears briefly beside him without blocking his face. 4.3-8.2s, "Simplemente tienes que grabarte sentado y completamente quieto con tu tripié" Normal daylight returns. Pull rapidly backward beyond the original framing and extend the same room naturally, revealing a smartphone on a tripod in the foreground recording him. Correct perspective must show this was a locked static setup. Add "TOMA ESTÁTICA" near the tripod. Do not duplicate the character. 8.2-11.5s, "Pasar esa toma estática a Seedance 2.5" Lower the virtual camera toward desk height and arc smoothly to one side, ending on a strong side-profile angle. Keep his performance and lip sync exact from the new perspective. "SEEDANCE 2.5" travels through the room with dimensional depth, then dissolves. 11.5-15s, "y describirle ahí el ángulo de la cámara o el movimiento que quieras" A translucent holographic interface appears beside him. "TOP DOWN" types itself into the interface, glows, then dissolves as the command activates. The camera cranes vertically upward into a high top-down angle while he continues speaking and looks naturally toward the moving camera. Preserve the room layout and avoid ceiling or body warping. 15-18s, "Puede ser algo suave como un gimbal acercándose" Descend to eye level and perform a clean gimbal move: smooth push toward him, ease backward, then settle. No jerky digital zoom. "GIMBAL SUAVE" passes behind his shoulders. 18-21s, "o algo más agresivo como un dron dando la vuelta alrededor" Accelerate into one complete 360-degree indoor drone orbit around him. Keep him fixed in the chair and the room consistent. Use believable motion blur and near-object parallax, then land precisely at the original frontal position. No cloning, room mutation or lip-sync interruption. 21-24.6s, "¿O hasta títulos 3D gigantes apareciendo detrás de ti?" Kinetic 3D words appear behind him in sequence: "3D", "GIGANTE", "DETRÁS DE TI". The letters occupy real space, cast subtle light and shadow, and are correctly hidden where his body overlaps them. They pop outward with impact, then retract and dissolve. 24.6-28.6s, "Te lo juro, nunca vas a tener que contratar un camarógrafo, nunca más." A cameraman enters naturally from the right side carrying a compact camera rig. Without stopping his speech or changing his eyeline, the main character firmly but playfully pushes and signals him out with his free left hand. The cameraman reacts and exits. "SIN CAMARÓGRAFO" appears behind them, then disappears. Return to the original framing.
La regla que más repiten quienes ya lo usan: decir qué se toma de cada referencia y qué no. “@Image1 define la cara y el peinado, nada más” evita que el modelo te copie también el fondo, la luz o la ropa de esa foto. Y al revés: cuanto más se llena el prompt de acciones concretas, más sube la probabilidad de error. Pide una cosa por tirada.
true por defecto y el modelo inventa una voz. Se paga la tirada completa para descubrirlo.
seed fijo, cambiar una palabra te da un video distinto por razones que no controlas. No aprendes nada comparando.
Sigue aprendiendo
Video en vivo · 12 sep 2026Una transmisión que nunca termina y que el público dirige
GPT Image · 22 ago 2026100 comandos para transformar cualquier foto con IA
Seedance 2.5 · 20 ago 2026Una toma fija, una toma de cine¿Lo quieres funcionando en tu negocio sin armarlo tú?
Escríbenos
Lo que acabas de leer es una herramienta suelta. Lo que de verdad cambia un negocio es el sistema alrededor: que el material entre, se procese y salga publicado sin que alguien lo empuje a mano. En Sotai armamos justo eso, a la medida — agentes y automatizaciones con tus datos y tu forma de trabajar. Escríbenos y en cinco minutos te decimos si te conviene o si con esta guía ya la hiciste.
Escríbenos →
Guía preparada por Sotai · 8 de agosto de 2026 · No estamos afiliados a ByteDance