
Integrando datos públicos y privados: Escalar grafos de conocimiento con Data Commons en Spanner
POR
Piyush Mathur
FUENTE
Cloud Blog
DATE
READ
7 min de lectura
Data Commons ahora funciona en Spanner Graph, integrando más de 400 mil millones de puntos de 100+ fuentes en un solo gráfico. El modelo nativo elimina los cachés de Bigtable, permitiendo actualizaciones incrementales, …
Para tomar decisiones informadas, las empresas a menudo necesitan conectar sus datos internos con datos de referencia públicos, para crear un grafo de conocimiento que conecte cosas del mundo real y sus relaciones. Sin embargo, conectar datos de los mundos público y privado tradicionalmente ha sido complejo. Hoy, estamos simplificando estas conexiones con la disponibilidad general de Data Commons en Spanner Graph y la vista previa de la nueva Plataforma Data Commons para unificar sus conocimientos privados con grafos de conocimiento de conjuntos de datos públicos. El proyecto Data Commons general apoya la misión de Google de organizar la información del mundo y hacerla universalmente accesible y útil. Data Commons unifica conjuntos de datos públicos fragmentados de más de 100 proveedores autorizados, incluyendo las Naciones Unidas, el Banco Mundial, la Oficina del Censo de EE. UU., Eurostat, la OMS y la NOAA, con más de 400 mil millones de puntos de datos estructurados utilizando definiciones estandarizadas de Schema.org. Data Commons proporciona herramientas de exploración de datos, herramientas MCP y APIs basadas en la nube para acceder e integrar conjuntos de datos limpios. Data Commons integra información pública en múltiples dominios, incluyendo agricultura, demografía, economía, medio ambiente y salud. Este enfoque estandarizado desbloquea casos de uso poderosos, por ejemplo, permitiéndole analizar tendencias de PIB nacional, mapear niveles de contaminación por humo regional, rastrear equidad de salud local o distribuciones demográficas a lo largo del tiempo, todo utilizando datos que ya han sido preprocesados y normalizados para usted. Data Commons dimensiones Tamaño Descripción técnica Observaciones estadísticas 400+ mil millones Puntos de datos individuales de métricas Bordes del grafo 2.6+ mil millones Relaciones Nodos del grafo de conocimiento 1.7+ mil millones Entidades estandarizadas Fuentes de datos 100+ proveedores Instituciones autorizadas Data Commons hace disponibles cantidades significativas de datos administrativos públicos a los usuarios en una infraestructura basada en la nube fácilmente consumible. Una infraestructura moderna impulsada por Spanner Graph Cuando construimos Data Commons por primera vez, nuestro objetivo era agregar conjuntos de datos públicos masivos y dispares utilizando las herramientas disponibles en ese momento. La plataforma dependía de Bigtable como una capa de almacenamiento en caché, que fue una estrategia efectiva para manejar búsquedas a gran escala en ausencia de la tecnología de bases de datos de grafos nativas. Hoy, hemos migrado nuestra arquitectura a un modelo de grafo nativo con Spanner Graph, que brinda la comodidad de una interfaz similar a SQL y la expresividad de grafos a Spanner, con su alta disponibilidad, escalado horizontal, consistencia transaccional multi-región y soporte nativo de GQL (Lenguaje de consulta de grafos ISO/IEC 39075). Al adoptar un esquema de grafo de múltiples entidades, representamos entidades como nodos y sus enlaces de dominio como bordes dinámicos del grafo, lo que nos permite alejarnos de las estructuras de almacenamiento en caché precomputadas y realizar consultas de relaciones complejas directamente dentro de la base de datos utilizando GQL. Esta arquitectura también simplifica nuestros flujos de trabajo eliminando la necesidad de índices complejos y precomputados que requieren reconstrucciones de memoria costosas y múltiples instantáneas. Spanner Graph permite actualizaciones incrementales de conjuntos de datos específicos sin refrescar toda la base de datos, mientras que las lecturas estancadas mantienen instantáneas de datos consistentes durante la ingestión. Beneficios clave al pasar a Spanner Graph Al utilizar el esquema de múltiples entidades de Spanner Graph, la plataforma reemplaza las complejas cachés con un modelo que admite la importación de datos incremental, lo que permite actualizaciones dirigidas de conjuntos de datos específicos. Transiciones de grafo dinámicas a través de GraphRAG: El sistema ejecuta consultas de múltiples saltos como navegar jerarquías como continente → país → estado → condado → ciudad sobre la marcha. Esto elimina la dependencia de las cachés estáticas y permite flujos de trabajo GraphRAG, donde la base de datos mapea consultas en lenguaje natural directamente a traversales de coincidencias de rutas estructuradas. Instantáneas de datos consistentes: Aprovechando Spanner TrueTime y lecturas estancadas, la plataforma le proporciona un instantánea de datos consistente en versión, manteniendo la integridad en los nodos distribuidos durante los ciclos de ingestión por lotes. Análisis operativos a escala: El motor columnar de Spanner escanea eficientemente grandes conjuntos de datos de series temporales leyendo solo los campos necesarios, mientras que la federación de BigQuery, que aprovecha la tecnología Data Boost de Spanner, realiza complejas agregaciones a través de EXTERNAL_QUERY en un entorno aislado, lo que ayuda a aislar el tráfico de producción. Puente de sistemas con interoperabilidad SDMX 3.0 Para facilitar el uso de datos estadísticos complejos, Data Commons adopta una implementación eficiente del estándar técnico de intercambio de datos y metadatos estadísticos (SDMX). Como especificación ISO, SDMX proporciona un enfoque coherente para describir y intercambiar datos estadísticos junto con información estadística descriptiva. En esta actualización de la Plataforma Data Commons, hemos agregado soporte para el estándar técnico SDMX versión 3.0, lo que proporciona integración “out-of-the-box” con herramientas de terceros como Tableau, Flourish y Observable para conjuntos de datos multidimensionales. Esto se hace posible utilizando los formatos estándar API SDMX-JSON y SDMX-CSV 2.0 en dos extremos de alto valor: El API de disponibilidad: Un mecanismo programático para identificar dimensiones, variables y rangos de fechas existentes sin leer valores brutos. El API de datos: Recupera observaciones y metadatos reales utilizando parámetros nombrados para ayudar a evitar que el código falle cuando se agregan dimensiones. Transformar instancias privadas de la Plataforma Data Commons Para las organizaciones que desean construir instancias privadas de la Plataforma Data Commons, esta nueva arquitectura moderna resuelve los límites de escalado heredados y simplifica la esquematización de datos. Los desarrolladores pueden instanciar una instancia privada de la Plataforma Data Commons utilizando la misma tecnología escalable que impulsa la instancia de Data Commons de Google. Como instancia privada, los usuarios conservan el control total de sus propios datos y tienen la capacidad de limitar el acceso, al mismo tiempo que habilitan consultas en lenguaje natural para mezclar resultados de sus datos privados con datos públicos que se alojan en la instancia pública de Data Commons de Google. Al federar con nuestro grafo de conocimiento público y un grafo de conocimiento privado que contiene sus propios datos, puede activar nuevos casos de uso, al mismo tiempo que mantiene el aislamiento de datos y garantiza que no haya duplicación de datos. Por ejemplo, una empresa minorista puede combinar datos públicos como tendencias de PIB nacional, desgloses demográficos regionales y estadísticas de empleo con sus propios datos empresariales, que incluyen historiales de ventas, métricas de rendimiento de la tienda y datos de logística de la cadena de suministro. Esto permite a los analistas contrastar indicadores macroeconómicos públicos con sus transacciones empresariales para optimizar la distribución de mercancías e identificar mercados no atendidos. Ejemplo de una consulta en lenguaje natural que combina datos estadísticos de la Directorate General of Commercial Intelligence and Statistics (DGCIS) almacenados en una instancia privada de la Plataforma Data Commons con Indicadores del Mundo del Banco Mundial almacenados en la instancia pública de Data Commons de Google. Un usuario consulta un agente para tendencias promedio anuales de temperatura en el país. El agente recupera información de Data Commons, explicando que si bien los datos históricos están disponibles, proporciona cambios de temperatura proyectados, impulsores climáticos y escenarios de modelos climáticos CMIP6 (SSPs), con opciones para exportar el informe generado. Un usuario pregunta al agente para comparar la Proporción de la población trabajadora (WPR) de los hombres rurales y urbanos en un país. Recuperando datos de Data Commons, el agente define WPR, que es el porcentaje de trabajadores en relación con la población total, y define las variables demográficas disponibles para analizar y comparar ambos grupos. Para empezar hoy Explore Data Commons: Visite datacommons.org para consultar conocimiento estadístico global. Explore los casos de uso y la guía de configuración para Spanner Graph para sus grafos de conocimiento. Despliegue de la Plataforma Data Commons: póngase en contacto con support@datacommons.org para solicitar acceso anticipado y para revisar las herramientas de desarrollador.