10 equipos de filmación independientes nos enseñaron sobre el trabajo en equipo de agentes
Los equipos de agentes de IA pueden colaborar para crear una película corta. Como parte de un hackathon interno de medios generativos de Google, probamos esta pregunta, específicamente para descubrir si los agentes de IA podrían colaborar en un dominio menos familiar que el desarrollo de software. Se les dio a cada equipo tres agentes con roles distintos y trabajaron juntos a través de mensajes y archivos compartidos dentro de su propio hackathon. Los agentes se ejecutaron en Scion, un entorno de prueba de orquestación de agentes de código abierto. A diferencia del código o el texto, los medios y la composición son temas menos familiares para los agentes de IA, por lo que este experimento nos enseñó cómo los agentes pueden colaborar con comprobaciones y mecanismos para llevar los proyectos a buen término. Diez equipos produjeron una película corta. Un equipo separado de producción documentó el proceso. Ese documental se convirtió en la entrada del hackathon. El resultado fue la creación de cientos de instancias individuales de agentes. Más de 25 producciones en total en las rondas piloto y la competición. Aproximadamente 44 minutos de película entregada. El feedback humano sobre la salida se alimentó a un bucle de mejora continua con las herramientas generadas por los agentes. Aquí hay dos ejemplos de cortometrajes generados por agentes: Paper Frontier The Printmaker’s Ghost Estructura del equipo Cada equipo tenía tres agentes. La “Idea Person” escribió el guion y definió el estilo visual. El “Technical Lead” operó las herramientas de medios generativos. El “Editor” controló el ritmo y la composición final. Un agente entrenador supervisó los puntos de control, pero no escribió ni dirigió. La “Idea Person” generó tres ideas iniciales. Luego, el equipo evaluó las ideas desde la perspectiva de su rol: ¿se generaría bien con medios generativos? ¿Sería complejo editarlo? Luego, propusieron la idea a otros equipos en el hackathon, para que un equipo pudiera ajustarla o modificarla. Por ejemplo, si tres equipos eligieran un combate espacial de ciencia ficción, no sería una entrada competitiva. Un agente coordinador programó la competición, ejecutando dos equipos a la vez en cinco rondas. El evento duró aproximadamente 21 horas. Los equipos siguieron un flujo de trabajo de siete pasos basado en los fundamentos del cine tradicional: concepto, beat sheet, workshop de personajes, storyboard, rodaje principal, montaje, render final. Cada paso tenía una puerta de verificación, asegurando que al menos un agente revisara el trabajo de otro para garantizar el cumplimiento técnico (como la resolución o el tiempo). En un piloto inicial, un equipo informó haber completado una película que resultó ser un archivo placeholder de 94 bytes. Resulta que los agentes pueden convencer de que han completado el trabajo que no han hecho. Aunque sorprendente (e incluso divertido), descubrimos otras formas en que los agentes tomaron el control de la película. Por ejemplo, los agentes dividieron la labor entre sí de formas inesperadas. En un equipo, la “Idea Person” escribió una línea de prosa en el primer borrador. El “Editor” construyó independientemente un silencio de ocho segundos alrededor de esa línea y lo marcó como “NO NEGOCIABLE” en la línea de tiempo. El “Technical Lead” regeneró un único plano varias veces hasta que una flor se separó de una rama. Nadie coordinó esto. Leyeron los archivos compartidos y tomaron decisiones editoriales independientes. Este proceso de colaboración y uso de herramientas se desarrolló en conjunto con los agentes durante la fase piloto. Durante esta fase, los equipos de agentes crearon vídeos que recibieron feedback humano, como colisiones de audio y niveles, personajes inconsistentes, historia o narración difíciles de seguir. Este feedback, combinado con retrospectivas escritas por los agentes para cada fase piloto, se utilizó para reestructurar no solo el playbook y las guías que instruían a los equipos futuros, sino que también los agentes construyeron y revisaron una herramienta de medios personalizada que combinaba CLIs de golang con automatización por lotes de python. Explicación de la arquitectura del agente Cada película combinaba múltiples modelos de IA de Google. Los agentes los llamaban a través de una herramienta de línea de comandos compartida llamada genmedia: Gemini image generation (Nano Banana) produjo hojas de personajes, fotogramas de storyboard y composiciones de escenas. Los agentes mantuvieron a los personajes visualmente consistentes en una película a través de encadenamiento de referencias: generaron primeros planos, luego usaron esos como entrada para hojas corporales, luego usaron las hojas corporales como entrada para pruebas de escena. Cada llamada de generación incluía estas referencias acumuladas como anclas. Veo 3.1 generó el vídeo. Los clips duraban de 4 a 8 segundos a 720p. Los agentes eligieron diferentes modos de generación según el plano: texto a vídeo para composiciones simples, imagen a vídeo para planos anclados en fotogramas de storyboard, interpolación de fotogramas cuando necesitaban un fotograma de inicio y final. Para planos más largos de ocho segundos, alimentaron el último fotograma de un clip como el primer fotograma del siguiente. Veo 3.1 también genera audio dentro de cada clip: sonido ambiente, tono de habitación y diálogo de personajes con sincronización. Un equipo (Lambda) construyó su película en función de esta capacidad. Estructuraron el guion como una partitura musical con marcas de movimiento (Allegretto, Accelerando, Adagio) porque el sincronismo entre el habla generada y el movimiento de los labios daba peso a las pausas. Lyria 3 generó música original. Un editor compuso una partitura de jazz de tres movimientos antes de que se filmara cualquier cosa y la usó como reloj maestro para la producción. Los equipos también “coaccionaron” a Lyria para que produjera efectos de sonido al enmarcar los prompts como paisajes de sonido. Gemini Flash TTS generó voces y narración de personajes con estilo, desde personalidades de voz con dirección de estilo (narrador cansado, ritmo lento y medido). El ritmo de TTS fue difícil de predecir. Uno de los narradores entregó a 108 palabras por minuto en lugar de las 130 planificadas, lo que hizo que la duración del programa se extendiera un minuto. Otro equipo tuvo un problema similar pero decidió que el ritmo lento era apropiado para su personaje, un proyectista de 68 años. Una película de cuatro minutos requirió más de 40 imágenes, 25+ clips de vídeo, varios “stems” de música, docenas de grabaciones de voz y cientos de operaciones de montaje. Scion: El sistema de orquestación. Los agentes se ejecutaron en Scion, un entorno de orquestación de agentes multi-agente de código abierto. Scion define agentes a partir de plantillas (persona, instrucciones, habilidades, herramientas), los ejecuta en contenedores sandbox, permite que los agentes invoquen y envíen mensajes a otros agentes a través de una línea de comando compartida, despierta a los agentes a través de notificaciones basadas en eventos, y da a todos los agentes en un proyecto acceso a un sistema de archivos compartido. Los mensajes y las notificaciones permitieron la colaboración en torno a un flujo de trabajo compartido. En diferentes puntos del proceso, diferentes agentes aportaron su contribución enfocada a esa etapa. Fundamentalmente, esto permitió compartir el complejo proceso en múltiples ventanas de contexto. Algunos fueron de larga duración, otros de corta duración. Se utilizaron combinaciones de diferentes modelos y “harnesses” porque Scion es modelo y “harness” independiente. El mismo agente plantilla se ejecuta en Claude, Gemini o Codex. El sistema de archivos compartido proporcionó resiliencia. Los agentes se caen, se quedan sin contexto y los reinicia el sistema. Los archivos que escriben persisten. Cuando el editor de un equipo falló durante el montaje final, el “Technical Lead” abrió el plan de línea de tiempo del editor, lo leyó y terminó el trabajo. El coordinador reinició varias veces el agente productor de documental a lo largo del proyecto. Cada nueva instancia leyó los archivos de la instancia anterior y continuó. Lo que aprendimos: Los agentes colaboran mejor a través de archivos que a través de mensajes. Los equipos que escribieron sus decisiones (los términos visuales que van en los prompts, dónde se sitúan los planos en la línea de tiempo, qué instrumentos prohibir en la partitura) se recuperaron de los fallos sin perder la dirección. Los equipos que mantuvieron las decisiones en el historial de mensajes las perdieron cuando los agentes volvieron a iniciarse. La combinación efectiva fue pasar mensajes que contenían rutas de archivo. Elegir estilos que coincidan con las fortalezas de la generación de IA produce mejores películas. Los equipos eligieron la animación de barro porque el movimiento hizo que el deslizamiento temporal fuera invisible. Eligieron la animación de silueta porque evitaba los problemas de consistencia facial. Un equipo no pudo generar un beso porque un filtro de seguridad lo bloqueó. Mostraron dos sombras fusionándose en una pared. Su entrenador lo llamó el mejor plano de la película. Los prompts específicos superaron la dirección general. La salida predeterminada de la generación de vídeo es un cine noir. Los equipos que hicieron un trabajo distintivo especificaron códigos de color hexadecimales en lugar de nombres de color, listaron los instrumentos prohibidos y escribieron prompts negativos que descartaban estéticas no deseadas. Hacerlo cálido produjo resultados genéricos. #F4A261, sin instrumentos de cuerda, sin efectos de lente, no funcionó. Cambiar el rol de un entrenador en las puertas de verificación cambió los resultados. El entrenador podía observar la producción completa pero solo podía intervenir en los límites de los pasos. Ese requisito obligó a los entrenadores a juzgar los resultados en lugar de supervisar el proceso. Uno de los entrenadores describió la dinámica: Es una sala llena de especialistas que pueden hacer una cosa a una velocidad sobrehumana, pero ninguno de ellos puede saborear la sopa. Para saber más Puede ver el documental completo aquí, y obtener más información sobre el framework Scion, y cómo se utilizó en el hackathon.
Artículos relacionados
El WAF de Cloudflare protege las aplicaciones de WordPress de dos vulnerabilidades de alta gravedad
Cloudflare ha implementado dos reglas de WAF en respuesta a las vulnerabilidades de alta gravedad que nos informaron el equipo de seguridad de WordPress. Las nuevas reglas protegen a todos los clientes de Cloudflare que utilizan las versiones de WordPress afectadas, pero los clientes deben actualizar inmediatamente a una versión parcheada.
Componentes de Eclipse Dataspace en AWS: Estrategias de optimización de costes
Al desplegar los conectores de Eclipse Dataspace Components (EDC) en AWS, uno de los primeros desafíos que enfrentará es predecir y controlar el costo de la infraestructura necesaria. Sin criterios claros, es difícil tomar decisiones informadas sobre el dimensionamiento de la carga de trabajo, la configuración del entorno y la inversión a largo plazo. La parte 1 de esta serie de 3 artículos cubrió los fundamentos
Componentes de Eclipse Dataspace en AWS: Patrones de arquitectura en producción
Ejecutar los componentes de Eclipse Dataspace (EDC) en producción en AWS requiere decisiones de arquitectura deliberadas sobre aislamiento, servicios gestionados y capas de seguridad. En la Parte 1 de esta serie, analizamos los fundamentos de las arquitecturas de espacios de datos y el EDC según los estándares de la International Data Space Association (IDSA). Si es nuevo en EDC, recomendamos comenzar por ahí.