El lago sin fronteras: Lleva los datos de AWS, Databricks y Snowflake a tus agentes de IA.
ARCHITECT ANÁLISIS DESTACADO

El lago sin fronteras: Lleva los datos de AWS, Databricks y Snowflake a tus agentes de IA.

POR

Will Ochandarena

FUENTE

Cloud Blog

DATE

READ

8 min de lectura

El Lago Sin Fronteras de Google convierte los datos en un motor de acción de IA. Construido sobre Apache Iceberg, federará datos locales, en múltiples nubes y de SaaS a través de un catálogo REST para que los agentes de …

El lago de datos sin fronteras de hoy ya no es simplemente un repositorio de datos, sino que cada vez más se convierte en un sistema de acción, ejecutando tareas de manera activa a través de agentes de inteligencia artificial autónomos y siempre activos. En lugar de esperar informes estáticos, estos agentes ejecutan bucles de razonamiento continuos y en tiempo real, monitoreando cadenas de suministro, señalando anomalías y ejecutando flujos de trabajo empresariales. Para escalar este modelo, los agentes de IA necesitan acceder a toda su infraestructura de datos y al contexto adecuado para entender qué datos utilizar y cuándo. Sin embargo, las arquitecturas de datos tradicionales, con sus altos costos, seguridad fragmentada y gobernanza débil, no facilitan esto. Hoy en Next Tokyo, estamos presentando mejoras a nuestro lago de datos sin fronteras. Construido sobre Apache Iceberg abierto, conecta sus sistemas operativos en las instalaciones, en la nube y las aplicaciones SaaS, para que pueda activar y consultar sus datos dondequiera que se encuentren, sin moverlos. Federando múltiples catálogos con Iceberg REST El lago de datos sin fronteras permite a Gemini Enterprise y a los agentes conversacionales analizar y actuar sobre datos sin importar su ubicación física. Construido sobre el catálogo Iceberg REST, le permite descubrir y consultar datos remotos al instante, eliminando los altos costos y retrasos de construir canalizaciones de datos. Esta conectividad es posible gracias a la federación de catálogos (ahora en vista previa) para AWS Glue, Databricks Unity y Snowflake Horizon, proporcionando acceso seguro y bidireccional a través de BigQuery, Managed Service for Apache Spark y cualquier motor compatible con Iceberg. Este enfoque abierto también se extiende a la capa de aplicación, con integraciones de datos sin copia para aplicaciones SaaS importantes como SAP, Salesforce y Workday. BigQuery ahora puede consultar directamente datos en vivo de estas plataformas sin necesidad de complejas canalizaciones ETL, mientras que ellas pueden ejecutar los motores de IA de BigQuery sobre sus propios datos en su lugar para unificar fácilmente los datos de finanzas, recursos humanos y clientes. Estas capacidades desbloquean tres beneficios significativos: Análisis sin copia y multiplataforma: Descubra y consulte datos empresariales al instante a través de plataformas sin duplicar archivos, lo que permite a varios equipos de datos analizar la misma copia exacta de los datos de Apache Iceberg. Interoperabilidad bidireccional: Leer y escribir a través de entornos, consultando tablas externas desde BigQuery o Managed Spark, y luego compartiendo conjuntos de datos derivados enriquecidos por Google AI de vuelta a los sistemas de socios para acciones posteriores. Gobernanza y control de acceso unificados: Obtenga gobernanza lista para usar con contexto confiable e información de Gemini para sus agentes. Control de acceso seguro a nivel de tabla con soporte para distribución de credenciales, independientemente de qué plataforma inicie la consulta. El lago de datos sin fronteras se expande a la cartera de bases de datos de Google Cloud que le permite integrar sistemas transaccionales con lagos de datos: Spanner Omni le permite ejecutar la base de datos altamente escalable en cualquier entorno fuera de Google Cloud, y la Federación de Lakehouse para AlloyDB permite que los sistemas transaccionales consulten directamente los almacenes. Al eliminar el costoso movimiento de datos, sus equipos pueden analizar de manera segura y eficiente datos operativos en vivo e históricos juntos en tiempo real. Ahora, su lago de datos es verdaderamente sin fronteras. Lleve Google AI directamente a sus datos de AWS y Azure Históricamente, realizar análisis avanzados o entrenar modelos de ML a través de nubes significaba un impuesto por cruce de nubes: altos costos de egreso, latencia de red y frágiles canalizaciones ETL. El lago de datos sin fronteras resuelve esto con Interconexiones entre Nubes. Estos enlaces privados y dedicados ofrecen un ancho de banda consistente y menor latencia que el internet público, a una fracción del costo de las conexiones tradicionales entre nubes. El lago de datos sin fronteras admite costos de egreso variables cero al acceder a sus datos desde AWS. Con la tarifa de Interconexión entre Nubes de Socios, obtiene costos mensuales predecibles con una conexión respaldada por SLA. Esta conectividad privada y administrada simplifica la provisión de 1G a 100G utilizando un modelo de pago por suscripción a tarifa plana. Además, la memoria caché inteligente entre nubes en el lago de datos sin fronteras almacena de forma segura fragmentos de datos remotos temporalmente dentro de Google Cloud para eliminar transferencias repetidas y costosas para consultas ad hoc o de BI subsiguientes. Estas capacidades, combinadas con el procesamiento vectorizado de BigQuery, las funciones de IA de BigQuery para análisis multimodal, el tiempo de ejecución del motor Lightning de Spark y el almacenamiento escalable de metadatos, escalan a petabytes de datos sin sacrificar rendimiento y habilitan: IA y aprendizaje automático en su lugar: Aplique poderosos modelos de IA y Gemini directamente a datos de AWS y Azure sin migración. Ingestar metadatos y contexto justo donde residen ayuda a garantizar un anclaje de alta precisión y un tiempo de comercialización más rápido. Evite el costo y el retraso de la copia de datos: Consulte datos en vivo almacenados en otras nubes directamente y acerque sus datos a sus agentes. Experiencia analítica unificada: Ofrezca un rendimiento consistente y optimizado para hardware a través de BigQuery, Spark o motores de código abierto centralizando el cómputo multiplataforma de vuelta a la infraestructura de Google Cloud. Cerrando la brecha de confianza del agente con contexto universal Para prevenir alucinaciones, los agentes de IA necesitan más que metadatos técnicos en bruto; necesitan un profundo contexto empresarial. El lago de datos sin fronteras se basa en el Catálogo de Conocimiento, nuestro motor de contexto agéntico siempre activo, para establecer una vista unificada de su contexto empresarial a través de nubes, sin mover archivos físicos. Para respaldar esto, el catálogo en tiempo de ejecución del lago de datos sin fronteras se sincroniza automáticamente con AWS Glue, Databricks Unity Catalog y Snowflake Horizon, todo en vista previa. El Catálogo de Conocimiento luego ingiere estas fuentes para agregar, extraer e indexar sus metadatos, traduciendo esquemas en bruto en una terminología empresarial clara y un linaje a nivel de columna que se puede buscar. A medida que los esquemas cambian, el Catálogo de Conocimiento actualiza instantáneamente su significado empresarial, proporcionando: Menores costos y gastos generales: Minimice costosas y lentas canalizaciones de migración de datos mientras obtiene una vista consolidada de toda su infraestructura multiplataforma. Decisiones de IA confiables: Proporcione a los agentes una capa semántica clara y seguimiento de linaje para que puedan descubrir, confiar e interpretar datos de manera precisa. Gobernanza automatizada: Incruste seguridad directamente en la capa de metadatos, ayudando a garantizar que los agentes de IA respeten estrictamente las pautas de cumplimiento y los permisos de acceso. Construya y escale agentes con Gemini Enterprise Al combinar el Kit de Agente de Datos de Google Cloud de código abierto con la API de Análisis Conversacional, puede construir y publicar agentes de datos personalizados que operan en el lago de datos sin fronteras directamente en Gemini Enterprise. Esto permite a los usuarios empresariales interactuar con sus datos utilizando lenguaje natural. El Kit de Agente de Datos es una colección de capacidades de construcción de agentes de pila completa, reuniendo a los desarrolladores dentro de sus IDE favoritos (como VS Code) para empaquetar habilidades analíticas pre-codificadas y herramientas del Protocolo de Contexto de Modelo (MCP). Con el lago de datos sin fronteras, sus agentes operan a través de toda su infraestructura de datos y ayudan con: Ecosistema de datos y agentes integrado: Las herramientas MCP integradas establecen conexiones directas y seguras a BigQuery, Managed Spark y Cloud Storage, eliminando la necesidad de escribir código de canalización compleja o copiar y pegar enormes esquemas de tabla en los mensajes de LLM. Análisis autoservicio: Los usuarios empresariales evitan los paneles de control estáticos, consultando y visualizando conjuntos de datos multiplataforma al instante en lenguaje sencillo dentro de la interfaz de Gemini Enterprise. Resultados de agentes anclados y de alta precisión: Los agentes funcionan sobre el Catálogo de Conocimiento, asegurando que las traducciones de lenguaje natural a SQL estén ancladas en esquemas empresariales curados, altamente seguros y estrictamente gobernados. La economía del lago de datos sin fronteras y los agentes El lago de datos sin fronteras redefine la economía de la IA empresarial al ofrecer ahorros compuestos en transferencia de datos, computación y consumo de tokens. Al utilizar Interconexiones entre Nubes y compartir sin copia, evita canalizaciones de datos frágiles y costos de egreso impredecibles para consultar conjuntos de datos remotos a una tarifa plana y predecible. El Catálogo de Conocimiento filtra y entrega el contexto empresarial preciso y mínimo requerido para cada mensaje, previniendo la proliferación de tokens y eliminando bucles de razonamiento innecesarios. BigQuery AI previene la facturación descontrolada de agentes a través de controles de tokens incorporados que le permiten estimar el uso de tokens antes de la consulta, hacer cumplir límites estrictos y aprovechar un modo optimizado que utiliza automáticamente modelos más pequeños y destilados. De hecho, los clientes están viendo una reducción de 230 veces en el consumo de tokens utilizando las funciones de IA optimizadas por costos e incorporadas de BigQuery. Próximos pasos El futuro pertenece al sistema de acción, y el lago de datos sin fronteras permite a sus agentes de IA consultar, razonar y actuar sobre sus datos dondequiera que se encuentren, de manera segura, instantánea y rentable. Para comenzar a construir, consulte la Guía oficial de Google Cloud Lakehouse y explore nuestro codelab Construyendo un lago de datos sin fronteras. Los clientes deben pagar una tarifa por hora por el servicio de interconexión.