A beviteli vektor támadások elleni védekezés egy réteges stratégiával
Fordította Adam Gavish, Google GenAI Security Team A gyorsan terjedő generatív AI-val, egy új hullámnyi fenyegetések merül fel az iparágban, melyek célja az AI rendszerek manipulálása. Egy ilyen új támadási vektor az indirekt prompt injekció. A közvetlen prompt injekciókhoz képest, ahol egy támadó közvetlenül a prompt-ba helyezi a rosszindulatú parancsokat, az indirekt prompt injekciók a külső adatok forrásaiból származó rejtett rosszindulatú utasításokat tartalmaznak. Ezek magukban foglalhatnak e-maileket, dokumentumokat vagy naptárkinviteseket, amelyek utasítják az AI-t, hogy exfiltrálja az felhasználói adatokat vagy végrehajtsa egyéb rosszindulatú tevéket. Ahogy egyre több kormány, vállalat és egyén kezdi használni a generatív AI-t, hogy több dolgot csináljon, ez a finom, de potenciálisan erős támadás egyre fontosabb az iparágban, amely azonnali figyelmet és robusztus biztonsági intézkedéseket követel. A Google-nál, a csapataink hosszú távon befektetnek a mélyreható védelem stratégiába, beleértve a robusztus értékelést, a fenyegetés elemzést, az AI biztonsági legjobb gyakorlatokat, az AI red-teaminget, az adversarial traininget és a generatív AI eszközök modeljének szigorítását. Ez a megközelítés lehetővé teszi a Gemini biztonságosabb használatát a Google Workspace-ben és az alkalmazásban (mindkettőt ebben a blogban egyszerűen “Gemini”-ként referáljuk). Alább leírjuk a kiterjedt kutatás, fejlesztés és alkalmazás alapján megtermett biztonsági intézkedéseket alapulévő prompt injekció elleni védelem stratégiánkat. Egy réteges biztonsági megközelítés A Google egy réteges biztonsági megközelítést alkalmaz, amely olyan biztonsági intézkedéseket tartalmaz, amelyek a prompt-ciklus minden szakaszához tervezve vannak. A Gemini 2.5 modeljének szigorításától, a célzott gépi tanulási (ML) modellekig, amelyek rosszindulatú utasításokat észlelik, a rendszer szintű védelemig, a támadók számára könnyebben elérhető, költségesebb és bonyolultabb tevéket eredményezünk. Ez a megközelítés arra kényszeríti a támadók, hogy olyan módszereket alkalmazzanak, amelyek vagy könnyebben azonosíthatók, vagy több erőforrást igénybe vesznek. A modelünkben található adversarial data használata jelentősen javította a védelemünket az indirekt prompt injekció elleni támadások ellen a Gemini 2.5 modeljei esetében (technikai részletek). Ez a natív modell robusztusságát további védelemnek egészíti ki, amelyet közvetlenül a Gemini-be építettünk, beleértve: Prompt injection tartalmakat felismerő osztályozókat Biztonsági gondolatok megerősítését Markdown-szabályzatot és gyanús URL-ek elfedését Felhasználói megerősítési keretrendszert Felhasználói védelemre vonatkozó értesítéseket. Ez a réteges megközelítés a védelemünkhöz, a prompt-ciklushoz és a különböző támadás technikákhoz. 1. Prompt injection tartalmakat felismerő osztályozók A Google-nál, a vezető AI biztonsági kutatók révén a Google’s AI Vulnerability Reward Program (VRP) révén, összeállítottuk az egyik legfejlettebb generatív AI-szabályzatok gyűjteményét. Azt használva, mi építettünk és kiadjuk a saját gépi tanulási (ML) modeljeinket, amelyek rosszindulatú parancsokat és utasításokat észlelik különböző formátumokban, például e-mailekben és fájlokban, a valós világból vett példák alapján. Ezzel a felhasználók, amikor a Gemini-vel a Workspace adatokat kérdőkövezik, a tartalmak osztályozói eltávolítják a káros tartalmat, amely rosszindulatú utasításokat tartalmaz, segítve egy biztonságos, végig tartó felhasználói élményt, a biztonságos tartalom megőrzésével. Például, ha egy felhasználó egy Gmail-ben egy e-mailt kap, amely tartalmaz rosszindulatú utasításokat, a tartalmak osztályozói képesek azonosítani és elhagyni a rosszindulatú utasításokat, majd egy biztonságos választ generálni a felhasználó számára. Ez a Gmail-ben található beépített védelem mellett, amely több mint 99,9% -a a spamot, a phishing támadásokat és a malware-t blokkolja. Egy diagram a Gemini által a tartalom osztályozói által a rosszindulatú utasítások felisztésén alapuló műveleteiről. 2. Biztonsági gondolatok megerősítése Ez a technika célzott biztonsági utasításokat ad a prompt tartalmához, hogy emlérezze a nagy nyelvi modellt (LLM), hogy elvégzze a felhasználó által kért feladatot, és elkerülje a tartalomban jelenlévő bármilyen támadó utasítások. Ez a megközelítés arra irányítja az LLM-et, hogy összpontosszon a feladatra, és elkerülje a támadók által beiktatott káros vagy rosszindulatú kéréseket, amelyek az indirekt prompt injekció támadásokra használhatók. Egy diagram a Gemini által a további védelem által biztosított műveleteiről. 3. Markdown-szabályzat és gyanús URL-ek elfedése A markdown-szabályzatunk külső képi URL-eket azonosít, és nem rendereli, így a “EchoLeak” 0-click képi exfiltrációs hibája nem alkalmazható a Gemini-re. A következő védelem a prompt injekciók és a fájl-exfiltrációs támadások ellen a URL szintjén zajlik. A külső adatok, amelyek dinamikus URL-eket tartalmaznak, felhasználók számára ismeretlen kockázatokat aiheznak, mivel ezek a URL-ek a prompt injekciók és a fájl-exfiltrációs támadásokra használhatók. A felhasználók által végrehajtott rosszindulatú parancsok káros URL-eket generálhatnak. A Gemini-vel a védelemünkhöz a Google Safe Browsing alapján készült gyanús URL-ek detektálják, amely segít megkülönböztetni a biztonságos és a nem biztonságos linkeket, biztosítva egy biztonságos felhasználói élményt, amely megakadályozza a URL-alapú támadásokat. Például, ha egy dokumentum rosszindulatú URL-eket tartalmaz, és egy felhasználó a Gemini-vel a tartalmat összefoglalja, a gyanús URL-eket a Gemini válaszában elfedik, biztosítva egy biztonságos felhasználói élményt. A Gemini a Gmail-ben egy e-mail tréh összefoglalását. A összefoglalóban egy veszélyes URL található. Ezt a URL-t a válaszban elfedik, és a szöveggel helyettesítik: “gyanús link”. 4. Felhasználói megerősítési keret A Gemini-ben egy kontextuális felhasználói megerősítési rendszer található. Ez a rendszer lehetővé teszi a Gemini-t, hogy bizonyos műveleteknél felhasználói megerősítést kérjen, “Human-In-The-Loop” (HITL), amely a biztonság és a felhasználói élmény megkönnyítése érdekében. Például, a potenciálisan kockázatos műveletek, mint például egy naptár eseményének törlése, explicit felhasználói megerősítést kérhet, amely megakadályozza a felfedezést vagy azonnali végrehajtást. A Gemini alkalmazás a naptár eseményének törlésére. A Gemini a naptár eseményeit jeleníti meg és kérdí a felhasználót, hogy megerősítsék. 5. Felhasználói védelemre vonatkozó értesítések A felhasználóink biztonságának megőrzése érdekében, megosztjuk azokat az információkat, amelyekkel meg tudják akadályozni a hasonló támadások. Amikor a beépített védelemeinkkel azokat a támadásokat meg tudjuk akadályozni, a felhasználók kapnak kontextuális információkat, amelyekkel a Help Center cikkeket lehet megtekinteni. Például, ha a Gemini egy fájl összefoglalását készíti, amely tartalmazza a rosszindulatú utasításokat, és az egyik védelem megakadályozza a helyzetet, akkor a felhasználó számára biztonsági értesítést jelenít meg, amely a “Learn more” linket tartalmaz. A felhasználókat ösztönözzük, hogy a prompt injection védelemről olvassák el a Help Center cikkeket. A Gemini a Docs-ban egy fájl összefoglalását készíti. A gyanús tartalom jelenlévő, és a válasz nem jelenik meg. A felhasználó számára megjelenik egy sárga biztonsági értesítési banner, amely azt jelzi, hogy a Gemini válasza eltűnt, és a “Learn more” linket tartalmazza, amely egy kapcsolódó Help Center cikkre mutat. A jövőben A Comprehensive prompt injection biztonsági stratégiunk a Gemini-hez, azáltal, hogy a fenti technikákat alkalmazzuk, valamint a manuális és automatizált red-teamingek, a generatív AI biztonsági BugSWAT események, a szigorú biztonsági szabványok, mint például a Secure AI Framework (SAIF), valamint a Google AI Vulnerability Reward Program (VRP) és a Coalion for Secure AI (CoSAI) partneriéseken is alapul. A bizalomra való elkötelezettségünk magában foglalja a biztonsági közösség közös működését, hogy az AI biztonsági hibákat azonosítsuk, megosszuk a legújabb támadás információkat, amelyekkel a rosszindulatú aktorok az AI-t használják, és megosztjuk a munkánkat, hogy a prompt injection védelemünk is erősödjön. A közös munkák a közösséggel a biztonságosabb védelem érdekében elengedhetetlenek. Ezért megörökülünk a kutatóktól, például Ben Nassi (Confidentiality), Stav Cohen (Technion) és Or Yair (SafeBreach), valamint más AI biztonsági kutatóktól, akik részt veszek a BugSWAT eseményeinkben és az AI VRP programunkban. Azt értékeljük, hogy ezek a kutatók és más közösségi tagok segítik a red-teamingunkat és a védelemünk megerősítését. Folyamatosan dolgozunk a jövőbeli Gemini modeljein, hogy azok is inherentesen robusztusak, és hogy további prompt injection védelem is épül be a Gemini-be. A Google’s progresszív és kutatási eredményeiről, hogy az AI és a biztonság a Generatív AI, a támadás technikák és a gyengeségek, a következő forrásokban találja meg: Beyond Speculation: Data-Driven Insights into AI and Cybersecurity (RSAC 2025 conference keynote) from Google’s Threat Intelligence Group (GTIG) Adversarial Misuse of Generative AI (blog post) from Google’s Threat Intelligence Group (GTIG) Google’s Approach for Secure AI Agents (white paper) from Google’s Secure AI Framework (SAIF) team Advancing Gemini’s security safeguards (blog post) from Google’s DeepMind team Lessons from Defending Gemini Against Indirect Prompt Injections (white paper) from Google’s DeepMind team
Kapcsolódó cikkek
Új dél-korei kampány hamis programozási interjúkat használ a fejlesztők adatai ellopásához
Koreai-ligához tartozó hackerek a SVG zászló képeken rejtették el a rosszindulatú szoftvert, hogy a fejlesztővizsgálatok során a programozási feladatokat is megvizsgálhassák. Egyetlen antivírus-szolgáltató sem talált rá.
Az Abbott két számítógépes incidenset vizsgál meg, miután kártételezési vádak merültek fel.
Az Abbott Laboratories két különálló számítógépes biztonsági incidenset vizsgál, miután megerősítette, hogy a Cancer Diagnostics üzletágában található belső Exact Sciences rendszerekhez történt jogosulatlan hozzáférést. Emellett egy másik vádot is vizsgál, amely szerint támadók megsebeztek a LabCentral portált, és vállalatadatokat elloptak.
A HollowByte-nak talált DDoS-es hibát az OpenSSL szerveren, 11 bájtos payloadokkal.
Egy biztonsági rést, melyet HollowByte-nak neveztek, segítségével hitelesítés nélküli támadók az OpenSSL szervereken elindíthatnak egy szolgáltatási elutasítás (DoS) állapotot, csak 11 bájtnyi kártékony terheléssel.