Bezpečnost dat při implementaci AI: co lze sdílet s modely a co ne
Nejčastější otázka od manažerů: kam půjdou naše data? Analyzujeme možnosti umístění dat, co lze sdílet s externími modely a jak zabránit únikům.
Stručně, když nemáte čas číst vše
- ✓Nejprve klasifikujte data: co je veřejné, co interní, co osobní nebo obchodní tajemství.
- ✓Obchodní API velkých poskytovatelů a veřejný chat podléhají různým podmínkám používání dat.
- ✓Nejcitlivější data lze zpracovávat pomocí místních modelů, aniž by opustila vaše prostředí.
- ✓Práva přístupu, anonymizace a akční protokoly jsou důležitější než volba konkrétního modelu.
„A kam půjdou naše data?“ Tu otázku slyšíme na každé první schůzce. A je to správně. Protože to nejhorší, co můžete udělat, je zkopírovat smlouvu s klientem do veřejného chatbotu „jen aby z ní udělal stručné shrnutí“.
Pojďme si říct, jak se to dělá správně.
1. Začněte klasifikací dat
Ne všechna data jsou stejná. Než cokoli zautomatizujete, rozdělte si je do kategorií:
- Veřejná: katalog, ceny na webu, veřejně dostupné články. Tady je riziko minimální.
- Interní: směrnice, instrukce, komunikace. Pokud uniknou, je to nepříjemné, ale ne katastrofa.
- Osobní údaje: jména, telefony, adresy klientů a zaměstnanců. Tady platí zákon a je potřeba s nimi podle toho zacházet.
- Obchodní tajemství: ceny pro klíčové klienty, finanční výkazy, podmínky smluv. Nejciltivější kategorie.
Pro každou kategorii platí jiná pravidla. A ta pravidla je potřeba nastavit před startem, ne až potom.
2. Tři varianty nasazení
Cloudová API velkých poskytovatelů. Nejsilnější modely, minimum infrastruktury. Důležitá nuance: podmínky využití dat v business API a ve veřejném bezplatném chatu nejsou stejné. Než začnete posílat cokoli citlivého, je potřeba si pečlivě přečíst podmínky konkrétního poskytovatele a zvolit správný tarif.
Lokální modely na vašem serveru. Data vůbec neopouštějí vaše prostředí. Otevřené modely dnes bohatě stačí na řadu úloh: klasifikaci, extrakci polí, vyhledávání v dokumentech. Platíte za to hardwarem a podporou.
Hybrid. Často nejrozumnější varianta. Citlivá data se zpracují lokálně nebo se anonymizují, zatímco složitější úlohy nad necitlivými daty jdou do výkonnějšího cloudového modelu.
3. Praktická pravidla, která fungují
- Anonymizace. Než odešlete text do externího modelu, nahraďte jména, telefony a čísla účtů štítky. Model dostane podstatu, ne osobní údaje.
- Přístupová práva. Firemní asistent ukazuje zaměstnanci jen ty dokumenty, ke kterým už stejně má přístup.
- RAG místo doučování modelu. Vaše dokumenty leží ve vaší databázi a model dostane jen potřebný fragment pro konkrétní odpověď. Podrobněji v článku co je RAG.
- Log akcí. Každý dotaz, odpověď i volání nástroje se zaznamenává. Když se něco pokazí, je vidět co přesně a kdy.
- Klíče jen na serveru. API klíče se nikdy nedostanou do prohlížeče ani do mobilní aplikace.
- NDA. Než se ponoříme do vašich databází, podepisujeme dohodu o mlčenlivosti a testujeme na syntetických nebo anonymizovaných datech.
4. Co rozhodně nedělat
- Nekopírovat citlivé dokumenty do bezplatných veřejných chatů.
- Nedávat AI agentovi širší práva, než jaká skutečně potřebuje pro daný úkol.
- Nepřipojovat model přímo k produkční databázi bez mezivrstvy kontrol.
Bezpečnost není samostatná volba, kterou přidáte nakonec. Musí být součástí architektury od prvního dne. Projdeme vaše data a při auditu business procesů vybereme vhodnou variantu nasazení. Jak to celé funguje ve firemní znalostní bázi, si přečtěte na stránce Firemní znalostní báze a RAG.
- GDPR a příslušné vnitrostátní právní předpisy o ochraně osobních údajů
- Politiky využívání dat v obchodních API předních poskytovatelů jazykových modelů
Podniková znalostní báze a RAG
Zůstaly vám k tématu článku otázky?
Pojďme se podívat, jak tyto přístupy sedí na procesy právě ve vaší firmě.