Vídeo con IA
Vídeo para redes sociales y fichas de producto con IA: vídeos a partir de texto, avatares-presentador que hablan, portadas de vídeo. Más rápido y más barato que el rodaje, como complemento al SMM y a la promoción.
Qué incluye el servicio de vídeo con IA
Tomamos la tarea del cliente y la llevamos de la idea al vídeo terminado: formulamos y afinamos el prompt, ejecutamos la generación del vídeo con la red neuronal, y luego montamos y hacemos el postprocesado del resultado. A la entrada recibimos la descripción, las referencias, los materiales de marca y el texto del guion; a la salida entregamos un clip montado con la duración y el formato necesarios. Trabajamos por iteraciones: la primera pasada da fotogramas en borrador, después afinamos el encuadre, el movimiento, la luz y las uniones entre escenas hasta que la imagen coincide con la tarea. Por separado configuramos la repetibilidad del estilo para que una serie de vídeos parezca un único material y no un conjunto de generaciones distintas. No realizamos producción de rodaje físico: todo el trabajo transcurre en un entorno de software del lado de nuestro equipo.
Cómo funciona la tecnología en esencia
La red neuronal de generación de vídeo está entrenada con grandes conjuntos de pares «texto-fotograma» y «fotograma-fotograma» y predice cómo debe verse una secuencia de imágenes según una descripción dada. Los modelos actuales se construyen sobre difusión: primero a partir de ruido aleatorio, luego paso a paso ese ruido se elimina hasta que aparece un fotograma con sentido, coherente con los vecinos en el tiempo. El prompt fija el contenido y el estilo, mientras que los parámetros de servicio mantienen un mismo objeto y el movimiento entre fotogramas para que no haya temblores ni sustitución de detalles. La salida en bruto del modelo casi siempre requiere ajuste: empalmes de escenas, corrección de color, estabilización, sustitución de fragmentos débiles y encaje con el sonido. Por eso el resultado real se compone de dos partes más o menos a partes iguales: la propia generación y el postprocesado de ingeniería sobre ella.
Historia del surgimiento del vídeo generativo
El punto de partida de esta línea es 2014, cuando Ian Goodfellow y sus coautores publicaron el trabajo «Generative Adversarial Nets» y propusieron las redes antagónicas GAN, donde el generador y el discriminador aprenden uno contra el otro. El segundo fundamento se sentó en 2015: Sohl-Dickstein y sus coautores describieron en el artículo «Deep Unsupervised Learning using Nonequilibrium Thermodynamics» el enfoque de difusión: convertir los datos en ruido para luego reconstruir los datos a partir del ruido. El auge empezó en 2022: el 22 de agosto Stability AI, junto con el grupo CompVis, lanzó Stable Diffusion para imágenes, y en noviembre de 2022 Google mostró Imagen Video, ya para vídeo. Después el ritmo se aceleró: en junio de 2023 Runway abrió Gen-2 con generación de vídeo a partir de texto, y el 15 de febrero de 2024 OpenAI presentó Sora, cuyo lanzamiento público (Sora Turbo) tuvo lugar el 9 de diciembre de 2024. En diez años la línea recorrió el camino desde las GAN de investigación hasta modelos comerciales accesibles al negocio.
Por qué importan la precisión y la configuración
La calidad de un clip no la determina el hecho de la generación, sino con cuánta precisión se han fijado el prompt, los parámetros del modelo y la lógica del postprocesado. Una formulación imprecisa da un objeto que se descuadra, parpadeo y fotogramas imposibles de empalmar en un vídeo coherente, y entonces la generación hay que rehacerla desde cero. El ajuste de los parámetros de control (el grado de correspondencia con el texto, la duración y la frecuencia de fotogramas, las imágenes de referencia) influye directamente en la estabilidad y la predictibilidad del resultado. El postprocesado cubre lo que el modelo no logra por sí mismo: color, nitidez, artefactos, ritmo del montaje y sincronización con el sonido. Sin esa parte de software y de ingeniería en las manos queda un conjunto de fragmentos en bruto, y no un material apto para publicar.
Con qué herramientas trabajamos
El stack se divide en tres capas: las redes neuronales de generación de vídeo, las herramientas de montaje y las herramientas de postprocesado. En el nivel de generación aplicamos modelos de vídeo de difusión de las familias Runway, Stable Video Diffusion y compatibles, eligiendo el modelo según la tarea: dinámica, estilo, duración de la escena. El montaje, los empalmes, el timing y el trabajo con el sonido los llevamos en editores de vídeo, y las operaciones por lotes y la automatización del procesado las construimos sobre FFmpeg, que convierte formatos, corta y ensambla las pistas. El color, la limpieza de artefactos, el upscale y la estabilización los hacemos como nodos aparte sobre la salida del modelo. El conjunto concreto lo elegimos según el presupuesto, el formato y la plataforma, en lugar de imponer una única herramienta universal.
Cuándo aparecieron las herramientas clave
La herramienta de trabajo base para el procesado de vídeo, FFmpeg, se lanzó el 20 de diciembre de 2000 de la mano del programador francés Fabrice Bellard, y desde entonces se ha convertido en el estándar de recodificación y ensamblaje de vídeo. La capa moderna de generación se apoya en la difusión, formalizada en 2015 en el trabajo de Sohl-Dickstein, y en su realización aplicada, Stable Diffusion, del 22 de agosto de 2022. Los modelos de vídeo aparecieron de forma masiva a continuación: Imagen Video en noviembre de 2022, Runway Gen-2 en junio de 2023, OpenAI Sora en febrero de 2024. Es decir, la herramienta de procesado madura existe ya desde hace más de veinte años, y la capa generativa sobre ella se ha formado literalmente en los últimos años. Combinamos ambos estratos: el procesado probado por el tiempo y los modelos de generación recientes.
Por qué puede confiárnoslo
ASI Robotics es un equipo de desarrollo con una experiencia total en TI de más de 45 años, y al vídeo lo abordamos como un problema de ingeniería, no como un acto creativo puntual. Escribimos los prompts y configuramos el pipeline para un resultado concreto, fijamos los parámetros y comprobamos las salidas antes del lanzamiento en producción, en lugar de entregar la primera pasada que salga. El mismo principio de ingeniería está en la base de todo lo que hacemos: para las tareas de corte, soldadura, impresión 3D o logística de almacén preparamos el programa y la configuración, mientras que cortan, sueldan, imprimen y transportan los equipos del cliente. Esa separación es honesta: la parte productiva la ejecuta la técnica del cliente, y a nosotros nos corresponden el software, la lógica y el afinado hasta una calidad estable. Por eso el riesgo se limita a la fase de desarrollo y verificación, y al circuito de producción llega ya una solución depurada.
Qué incluye
Cómo trabajamos
Un flujo de contenido en vídeo sin equipo de rodaje, para redes sociales, fichas de producto y publicidad.
Preguntas frecuentes
¿Es un sustituto del rodaje?+
Para formatos sencillos, sí; para vídeos de imagen, la IA complementa al estudio, no lo sustituye.
¿Y los derechos de autor?+
Usamos modelos legales y etiquetamos el contenido de IA según los requisitos.