La fascinante ciencia detrás de los videos generados por IA
La ciencia detrás de los videos generados por IA ha alcanzado nuevas alturas gracias a avanzadas herramientas de inteligencia artificial que están más accesibles que nunca. Este año, hemos sido testigos del lanzamiento de innovadores modelos como Sora de OpenAI, Veo 3 de Google DeepMind, y Gen-4 de la startup Runway, los cuales son capaces de crear videos casi indistinguibles de los grabados de forma convencional o la animación CGI. Por primera vez, Netflix también ha utilizado generación de video en su serie The Eternaut, marcando un hito en el uso de esta tecnología para el mercado masivo.
Acceso sin precedentes y desafíos emergentes
Con estos potentes modelos disponibles en plataformas como ChatGPT y Gemini para suscriptores de pago, incluso los realizadores más casuales pueden crear videos impactantes. En contraste, esta democratización de la tecnología también ha llevado a un aumento en la producción de contenido de baja calidad y desinformación, ya que las redes sociales se inundan de imágenes engañosas generadas por IA. Además, es importante señalar que la generación de video consume significativamente más energía que la creación de texto o imágenes.

La ciencia detrás de los videos generados por IA
Para entender cómo funcionan estos modelos, debemos conocer los principios detrás de la generación de video IA. Normalmente, los usuarios suelen interactuar con estas herramientas solicitando algo específico, como «Crea un video de un unicornio comiendo espaguetis y haz que su cuerno despegue como un cohete». Sin embargo, el resultado puede ser impredecible y a menudo se requiere de múltiples intentos para conseguir el producto deseado.
Bajo el capó, los modelos de generación de video actuales se basan en una tecnología llamada transformadores de difusión latente. Este enfoque implica convertir ruido aleatorio en imágenes coherentes, y a continuación, en secuencias de video.
¿Qué es un modelo de difusión?
Imagina tomar una imagen y agregarle ruidos aleatorios hasta convertirla en un caos pixelado. Un modelo de difusión es capaz de revertir este proceso, tomando ruido y transformándolo en una imagen entendible. Para hacer esto, se entrena con millones de imágenes a diferentes niveles de pixelación, aprendiendo a deshacer los cambios introducidos por el ruido.
Sin embargo, para obtener la imagen deseada basada en una descripción textual, los modelos de difusión son acoplados a un modelo de lenguaje grande (LLM) que ayuda a dirigir el proceso de regeneración.
La eficiencia del modelo de difusión latente
Debido a la complejidad involucrada, la ciencia detrás de los videos generados por IA requiere de una gran cantidad de recursos computacionales. Para hacer frente a este desafío, muchos de los modelos de difusión actuales implementan una técnica de difusión latente. Este método implica trabajar en un espacio latente, donde los datos se comprimen para capturar sólo las características esenciales, haciendo el proceso más eficiente.
Transformadores y consistencia visual como ejes tras la ciencia detrás de los videos generados por IA
La innovación clave en este espacio ha sido la incorporación de transformadores de difusión. Estos modelos son excepcionales para procesar largas secuencias de datos, permitiendo que los fotogramas generados mantengan continuidad y coherencia visual. Al dividir los videos en bloques y utilizar estas técnicas, los modelos pueden entrenarse en una enorme variedad de formatos, desde clip verticales hasta películas de gran presupuesto.

Ciencia detrás de los videos generados por IA; Sincronización de audio y video
Un avance significativo en la ciencia detrás de los videos generados por IA en modelos como Veo 3 es su capacidad para generar video y audio que coincida perfectamente con las imágenes. Al crear un proceso de «bloqueo» para audio y video, Google DeepMind ha logrado que sus modelos generen contenido audiovisual sincronizado, marcando el fin de la «era silenciosa» en la generación de video.
El futuro de la IA en creación de contenido
Aunque actualmente los modelos de difusión son predominantemente usados para video, también funcionan bien con imágenes y audio. A medida que las investigaciones a favor de la ciencia detrás de los videos generados por IA avanzan, incluso se están explorando formas de integrar modelos de difusión en aplicaciones de generación de texto, haciendo que el futuro de la IA en la creación de contenido sea aún más emocionante y diverso.
La explosión de herramientas de generación de video por IA está revolucionando la forma en que creamos y consumimos contenido, desafiando nuestras concepciones de autenticidad y autoría en el ámbito digital.