
Összetartó nyilvános és magánadatokat: A Data Commons segítségével bővítse a tudásgráfokat a Spanner-ben
SZERZŐ
Piyush Mathur
FORRÁS
Cloud Blog
DATE
READ
5 perc olvasás
A Data Commons most a Spanner Graph-on, amely 100+ forrásból származó több mint 400 milliárd pontot egyesíti egyetlen gráfba. A natív modell eltávolítja a Bigtable-cache-okat, lehetővé téve az inkrementális …
Az üzletek számára fontos, hogy kapcsolják az üzleti adatokat a nyilvános adatforrásokkal, hogy megalkozzák a tudásgrafot, amely összekapcsolja a valós világ dolgait és a közöttük lévő kapcsolatokat. Az nyilvános és magán adatforrások összekapcsolása hagyományosan bonyolult volt. Ma a Data Commonson, amely elérhető Spanner Graphon, és a Data Commons Platform előzetes verzióján, megkönnyítjuk ezeket a kapcsolatokat, hogy egységesítsd a magán tudásodat a nyilvános adatforrásokból származó tudásgrafokkal. A Data Commons projekt, amelyet a Google indított, a világ információinak megszervezésére és univerzális hozzáférésére és használatára törekszik. A Data Commons egységesíti a több mint 100 megbízható szolgáltató által biztosított fragmentált nyilvános adatforrásokat, beleértve az ENSZ-t, a Világbankot, az Egyesült Államok népességi hivatalát, az Eurostatot, a WHO-t és a NOAA-t, melyek több mint 400 milliárd adatpontot tartalmaznak, melyek szabványos Schema.org definíciókkal vannak megtervezve. A Data Commons adatfelderítő eszközökkel, MCP eszközokkal és felhőalapú API-kkal rendelkezik, hogy hozzáférjen és integrálja a tiszta adatokat. A Data Commons több területen is elérhető nyilvános információkat tartalmaz, beleértve a mezőgazdaságot, a demográfia, a gazdaságot, a környezetet és az egészséget. Ez a szabványos megközelítés hatalmas lehetőségeket nyit meg, például lehetővé téve, hogy elemzed a nemzeti GDP trendeket, térségi füstmérséklet-szinteket, helyi egészségügyi egyenlőséget vagy demográfiai eloszlásokat időben, minde a már előfeldolgozott és normalizált adatok segítségével. A Data Commons tudásgraf dimenziói: Dimenzió Méret Technikai leírás Statisztikai megfigyelések 400+ milliárd Egyedi mérési pontok Grafikus szélek 2,6+ milliárd Kapcsolatok Tudásgraf csomópontok 1,7+ milliárd Szabályos entitások Adatforrások 100+ szolgáltató Megbízható intézmények A Data Commons lehetővé teszi, hogy felhasználók számára elérhető felhőalapú infrastruktúrában elérhető jelentős mennyiségű nyilvános adminisztratív adatot. Egy modern infrastruktúra, amely Spanner Graphon alapul. Amikor először megalkoztuk a Data Commons-t, az célunk volt, hogy a rendelkezésre álló eszközökkel összegyűjtsük a hatalmas, eltérő nyilvános adatokat. A platform Bigtable-t használt egy caching rétegként, ami hatékony megoldás volt a nagy mértékű kereséshez, amikor nincsen elérhető native graf adatbázis technológia. Ma átalakítottuk architektúránkat egy natív graf modellre a Spanner Graphon, amely a SQL-hez hasonló interfészt és a graf kifejezhetőséget kínálja a Spanner-en, magával a nagy elérhetőséggel, a vízszintes 확장ítással, a több régióban lévő transzacionalis konzisztenciával és a natív ISO/IEC 39075 Graph Query Language (GQL) támogatással. A multi-entitású Spanner Graph-os schema alkalmazásával az entitásokat csomópontoknak, a domain linkeket pedig dinamikus grafikus széleknek definiáljuk, így el tudjuk elhagyni a előre számolt cache struktúrákat és a komplex kapcsolat kérdéseket közvetlenül a adatbázisban megvalósítani a GQL segítségével. Ez az architektúra megkönnyíti a folyamatokat, eltávolítva a bonyolult, előre számolt indexek szükségességét, amelyek drága memóriában ismételnek és több képet is. A Spanner Graph lehetővé teszi a specifikus adatok incremental frissítését anélkül, hogy az egész adatbázist frissítenénk, miközben a “stale reads” konzisztens adat snapshot-okat biztosítanak a beépítés során. A fő előnyök a Spanner Graph-ra való átállásban: A multi-entitású Spanner Graph-os schema alkalmazásával a platform bonyolult cache-okat helyettesíti egy olyan modelllel, amely támogatja a incremental adat import-ot, lehetővé téve a célzott frissítéseket a specifikus adatforrásokhoz. Dinamikus grafikus útválasztás a GraphRAG segítségével: A rendszer képes multi-hop kérdéseket, például hierarchiákat navigálni, például a kontinens → ország → állam → megye → város a településeken futtatni. Ez elkerüli a statikus cache-ok igényét és lehetővé teszi a GraphRAG workflow-okat, ahol a adatbázis közvetlenül párosíthatja a természetes nyelvi kérdéseket a strukturált útválasztás segítségével. Konzisztensek a adat snapshot-ok: A Spanner TrueTime és “stale reads” használatával, a platform verzió-kompatibilis snapshot-ot biztosít a adatokról, biztosítva a konzisztenciát a terjesztett csomópontok között a többfázisú beépítés során. A nagy mértékben operációs elemzéseket a Spanner segítségével. A Spanner kolomális motora hatékonyan szkennálja a hatalmas idősor adatokat, csak a szükséges mezőket olvassa el, miközben a BigQuery a Spanner Data Boost technológiáját használja a komplex aggregációkat az EXTERNAL_QUERY segítségével egy elszigetelt környezetben, segít a termelő forgalmat izolálni. A SDMX 3.0-val való interoperabilitás a rendszerek közötti. A Data Commons a komplex statisztikai adatokat használva a Statistical Data and Metadata eXchange (SDMX) technikai szabvány egy “lean” implementációját alkalmazza. Az SDMX egy ISO specifikáció, amely biztosít egy konzisztens megközelítést a statisztikai adatok leírásának és cserélik, valamint a leíró statisztikai meta-információk. A Data Commons Platform frissítésében a SDMX 3.0 technikai szabvány támogatását adtuk, mely közvetlen integrációt biztosít a harmadik fél eszközokkal, például Tableau, Flourish és Observable-hoz, melyek multi-dimenziós adatokat kezelnek. Ez a SDMX-JSON és SDMX-CSV 2.0 formátumokon keresztül két magas értékű ponton keresztül valósul meg: Az elérhetőségi API: Egy programozható felfedezési mechanizmus, amely az összetett dimenziókat, változókat és dátumtartományokat az értékkor bezárva azonosíthatja. A data API: Megtalálja az tényleges megfigyeléseket és a meta-információkat, a névre írt paraméterek segítségével, hogy megakadályozzuk a kód hibáit, ha a dimenziók hozzáadódnak. A Data Commons Platform-nak a magán példáinak építése a Data Commons Platform-nak magán példáit építeni szeretők számára. A Data Commons Platform-nak magán példáit építeni szeretők számára, ez az új, modern architektúra megoldja a régebbi skálázási korlátokat és egyszerűsíti az adatmodell-szabályozást. A fejlesztők egy magán Data Commons Platform-ot létre tudnak, ugyanazt a skálázható technológiát, amely a Google Data Commons-ban is használatba vette. A magán példák esetén az felhasználók teljes kontrollt gyakorolhatnak a saját adataik felett, és lehetővé teszik az hozzáférés kontrollt, miközben lehetővé teszik a természetes nyelvi kérdéseket, hogy a saját adataik és a Google által a Google Data Commons-ban tárolt nyilvános adatok kombináljanak. A nyilvános tudásgrafunk és a magán tudásgraf, amely az Ön adatait tartalmazza, kombinálásával új felhasználási lehetőségeket nyithat, miközben az adatokat is megőrzi, és biztosítja, hogy az adatok nem duplázzák. Például egy kiskereskedelmi vállalkozás kombinálhat nyilvános adatokat, például a nemzeti GDP trendjeit, a regionális demográfiai bontásokat és a foglalkoztatási statisztikákat, valamint saját vállalati adatokat, beleértve a sales előzményeket, a bolt teljesítmény statisztikáit és a supply chain logisztikát. Ez lehetővé teszi a szakértők számára, hogy a nyilvános makro-gazdasági mutatókat a saját cégadatokkal összehasonlítsák, hogy optimalizálják a termékforgalmat, és az új piacokat azonosítsák. Például egy természetes nyelvi kérdés, amely a Directorate General of Commercial Intelligence and Statistics (DGCIS) által tárolt statisztikai adatokat a Data Commons Platform magán példájában a World Bank által tárolt World Development Indicators-t. A felhasználó megkérdezi egy átlagos éves hőmérséklet trendet a országban. A rendszer a Data Commons-ből szerzi elő a információkat, elmondva, hogy a korábbi adatok elérhetők, de előrejelzett hőmérséklet változásokat, klíma-indítókat és CMIP6 klíma-modellt (SSPs), valamint a létrehozott jelentés exportálására. A felhasználó megkérdezi a Worker Population Ratio (WPR) a rural és urban férfiak számára a országban. A Data Commons-ből a WPR-t (a munkavállalók aránya a teljes lakossághoz képest) definiálja, és leírja a megközelíthető demográfiai változókat, hogy mindkét csoportot hasonlítsák.