Por qué las aplicaciones de IA fallan en producción (Y cómo lo solucionó Google)
ARCHITECT ANÁLISIS DESTACADO

Por qué las aplicaciones de IA fallan en producción (Y cómo lo solucionó Google)

POR

Stephanie Wong

FUENTE

Cloud Blog

DATE

READ

5 min de lectura

Los desarrolladores pueden crear rápidamente prototipos de IA, pero solo el 5% llegan a la producción debido a la infraestructura rígida y los ciclos de validación. El enfoque de YouTube desacopla la experimentación de …

Vivimos en la era dorada de los proyectos de IA de fin de semana. Gracias a la ingeniería centrada en el agente y los LLM, el tiempo para pasar de un IDE en blanco a una aplicación local funcional ha disminuido de trimestres a horas. Puedes construir tus ideas más descabelladas mientras tomas un café. Pero dentro de un ecosistema empresarial con una infraestructura rígida y millones de usuarios, el código rápido choca con una pared invisible. Tu prototipo local se desmorona contra las redes corporativas, errores en cascada o se bloquea debido a la dirección ejecutiva que teme la volatilidad operativa. Los datos son contundentes: solo el 5% de los prototipos de IA llegan a la producción; el 95% restante caen en el abismo de la validación. Para los desarrolladores, ver a la gente en las redes sociales lanzar implementaciones de IA de “rayo” mientras uno se queda atascado en bucles interminables de validación, es exasperante. Para averiguar cómo cerrar esta brecha, entré en las trincheras de la ingeniería en YouTube para ver cómo gestionan este mismo paradoja de velocidad frente al riesgo. Lo que descubrí reescribe por completo la hoja de ruta del desarrollo de software de IA (SDLC). El paradoja de velocidad frente al riesgo Cuando se construye solo, el fracaso es barato. Escribir código centrado en el agente es como pilotar un avión de combate ágil: si un agente de IA se comporta mal, se reescribe el prompt e inmediatamente se reinicia el servidor. Pero, según Addy Osmani, líder de ingeniería de IA en Emergent, la orquestación sin restricciones de agentes dentro de una empresa introduce un radio de impacto impredecible. Addy recuerda haber ejecutado diez agentes en paralelo en un proyecto personal, saltando de contexto y empujando código basándose únicamente en previsiones rápidas. La deuda técnica se acumuló rápidamente, causando que dos aplicaciones fallaran catastrófico porque las modificaciones no estaban aisladas correctamente. Amplía ese riesgo a la escala de YouTube. Su infraestructura maneja miles de millones de usuarios en una base de código robusta de 20 años. Esencialmente, es una utilidad pública; no puedes arriesgarte a sobrecargarlo con una deuda técnica experimental. Proteger una plataforma de esta escala requiere guardias extensos y lentos: en el momento en que construyes un prototipo primitivo a través de este flujo, los modelos de IA subyacentes han evolucionado, dejando tu idea desactualizada. ¿Cómo se puede avanzar a gran velocidad minimizando el riesgo sistémico? La pila de prototipado de IA de YouTube: Deepmind y el antiguo ingeniero de software de YouTube, Benji Bear, resolvieron este acertijo no acelerando las revisiones, sino cambiando la filosofía de la infraestructura. Él y su equipo construyeron una pila de prototipado: una plataforma de ciclo de vida unificada de diseño a código que desconecta completamente la experimentación rápida de los servidores de producción. Esto resuelve sistemáticamente los dos principales puntos de fricción de la velocidad del desarrollador. Desacoplar la capa de datos Aislar una aplicación autónoma crea un lienzo en blanco donde no puedes probar prototipos contra condiciones realistas. Para solucionar esto, los desarrolladores utilizan plantillas de Google AI Studio para poner en marcha sus ideas. Estas plantillas se conectan a un servidor proxy configurado en Google Cloud para acceder a datos de solo lectura aprobados para prototipos. Esto otorga instantáneamente al prototipo acceso API de solo lectura y autenticado a paquetes de metadatos en vivo (listas de reproducción, vídeos, canales) a través de estrictos tokens. Los desarrolladores obtienen la precisión técnica de los parámetros de producción en vivo sin ninguna capacidad de escribir, ensuciar o hacer que fallen las bases de datos centrales. Inyección de UI en vivo Cuando un concepto requiere una validación real, la pila ofrece envoltorios de extensión de YouTube para el lado del cliente. Este envoltorio actúa como código pegajoso, permitiendo a los desarrolladores inyectar sus características experimentales directamente en la superficie web de producción real de YouTube. El “code split” y los mecanismos de aislamiento permiten que estas actualizaciones se desplieguen en un entorno de staging seguro en minutos. El resultado: YouTube pasó de tomar varios trimestres para validar una idea a lanzar varios prototipos exitosos, incluyendo YouTube Recap y Ask YouTube, en estudios de UX en semanas. Acepta el código desechable La implementación de esta pila requiere un cambio psicológico profundo. Se entrena a los ingenieros para tratar el código como una infraestructura permanente, puliéndolo y refactorizándolo hasta que esté impecable. Pero la filosofía de IA de nivel empresarial de Benji aquí es simple: adopta el código desechable. Las plantillas de Google AI Studio están pensadas para ser caóticas con cierta deuda técnica; su objetivo es utilizar datos cuantitativos para validar la adecuación del producto al mercado. Intentar refactorizar una aplicación de IA generada en un código empresarial crea una trampa arquitectónica que puede generar fricción. Pero, Google AI Studio construye tu prototipo directamente en una versión espejo de la infraestructura de producción, lo que establece una línea base precisa desde el principio. Todavía descartas el script de IA caótico, pero cuando una idea tiene éxito, reescribirla para la producción se vuelve significativamente más rápida, más barata y más segura más adelante en el ciclo de vida del desarrollo, dándote un esquema verificado en el que codificar, en lugar de un lienzo en blanco. Avanza a gran velocidad sin romper nada La realización clave aquí es que un 95% de las tasas de fracaso no es un error, es la estrategia. Deberíamos diseñar entornos que animen a nuestros equipos a fallar con más frecuencia y de forma segura. La IA ha reducido drásticamente el costo de la generación de código. Como resultado, nuestros roles están cambiando de ser gatekeepers de la sintaxis a arquitectos de sistemas. Nuestro trabajo es diseñar los puentes, las sandbox de solo lectura y los flujos de trabajo aislados que permiten a los equipos probar ideas salvajes sin provocar estallidos catastróficos. El mayor riesgo no es romper un servidor con código de IA caótico, sino perderse el momento tecnológico porque los bucles de validación son demasiado lentos. Al construir restricciones estructurales que hacen que el fracaso sea seguro, les das a tu equipo la libertad de avanzar a gran velocidad. Para ver el desglose técnico completo, las entrevistas con los principales ingenieros de infraestructura de YouTube, y una mirada al Google AI Studio Proto-Stack, mira nuestro episodio inaugural de Emergent en YouTube.