DI saugumas: kokių duomenų negalima atskleisti dirbtiniam intelektui?

DI saugumas: kokių duomenų negalima atskleisti dirbtiniam intelektui?
Turinys

Atidi įvedamų duomenų kontrolė yra saugaus naudojimosi vartotojams skirtomis kalbos modelių versijomis pagrindas: į atvirus dirbtinio intelekto įrankius įvesta informacija palieka naudotojo vietinę aplinką. Įvedus konfidencialius duomenis, kyla jų nutekėjimo, komercinių paslapčių atskleidimo ir asmens duomenų apsaugos taisyklių pažeidimo rizika. Todėl kiekvieną sąveiką su DI verta vertinti taip, tarsi informaciją skelbtumėte viešai.

Ko negalima įklijuoti į DI įrankį?

Viešai prieinamuose modeliuose griežtai draudžiama tvarkyti šių kategorijų duomenis:

  • asmens duomenis – klientų, darbuotojų ar savo vardus, pavardes, adresus, asmens kodus, telefono numerius ir el. pašto adresus;
  • medicininius dokumentus – ligos istorijas, tyrimų rezultatus ir pacientų diagnozes, kuriems taikomi griežti teisės aktų reikalavimai, pavyzdžiui, BDAR ar HIPAA;
  • konfidencialią įmonės informaciją – nepaskelbtas finansines ataskaitas, rinkodaros strategijas, klientų duomenų bazes, susijungimų, įsigijimų ar darbuotojų atleidimo planus;
  • komercines paslaptis – programinės įrangos pirminį kodą, gamybos receptūras, unikalius algoritmus ar įmonės vidaus techninę dokumentaciją;
  • slaptažodžius ir prieigos duomenis – API raktus, prisijungimo duomenis, prieigos žetonus, mokėjimo kortelių duomenis ir bet kokius šifravimo raktus;
  • autorių teisių saugomą medžiagą – ištisas knygas, mokamus mokslinius straipsnius ar scenarijus, kuriems naudoti neturite reikiamos licencijos;
  • neteisėtą turinį – smurtą ar neapykantą skatinančią medžiagą arba nurodymus, kaip atlikti įstatymams prieštaraujančius veiksmus.

Kas nutinka dirbtiniam intelektui pateiktiems duomenims?

Debesijos paslaugų teikėjams perduoti duomenys apdorojami ir analizuojami keliais etapais. Jų gyvavimo ciklas nesibaigia sugeneravus atsakymą.

Modelių mokymas

Į standartines vartotojams skirtas generatyvinių įrankių versijas įvesti duomenys dažnai naudojami tolesniam modelių mokymui. Tai reiškia, kad pateikta informacija gali paveikti neuroninio tinklo parametrus ir teoriškai ateityje pasirodyti atsakyme kitam naudotojui.

Rankinė peržiūra ir moderavimas

Be automatinio apdorojimo, DI sistemose veikia saugumo filtrai. Jei algoritmas užklausą palaiko įtartina, pavyzdžiui, galimai pažeidžiančia naudojimosi taisykles, pokalbis gali būti pažymėtas ir perduotas peržiūrėti žmogui. Tokiu atveju paslaugos teikėjo darbuotojai ar išoriniai vertintojai gali tiesiogiai susipažinti su įvestu turiniu, kad tobulintų moderavimo mechanizmus.

Duomenų saugojimas ir atsarginės kopijos

DI paslaugų teikėjai saugo pokalbių įrašus savo serveriuose, kad užtikrintų paslaugos tęstinumą, diagnozuotų klaidas ir išsaugotų kontekstą būsimiems pokalbiams. Svarbu tai, kad naudotojui ištrynus pokalbį sąsajoje informacija retai iškart pašalinama iš serverių. Duomenys dar kurį laiką lieka paslaugos teikėjo atsarginėse kopijose, todėl sėkmingos kibernetinės atakos prieš debesijos infrastruktūrą atveju padidėja konfidencialios informacijos atskleidimo rizika.

Asmeninės ir įmonių paskyros: kuo skiriasi apsaugos lygis?

DI duomenų saugumas labai priklauso nuo prenumeratos tipo ir paslaugos diegimo būdo.

Nemokamose ir mokamose standartinėse asmeninėse paskyrose daugelis populiarių paslaugų pagal numatytuosius nustatymus gali naudoti pateiktą informaciją modeliams mokyti. Jei į tokią paskyrą įvedami konfidencialūs duomenys, kyla nekontroliuojamo jų atskleidimo rizika.

Verslui ir organizacijoms skirtose aplinkose, pavyzdžiui, Enterprise paskyrose ar privačiuose debesyse per tokių teikėjų kaip Microsoft Azure, AWS ar Google Cloud API teikiamose paslaugose, taikomi griežtesni apsaugos standartai. Paslaugų teikėjai užtikrina atitiktį saugumo standartams ir reikalavimams (ISO 27001, SOC 2, BDAR), o sutartyse (SLA ir DPA) nurodo, kad klientų duomenys nenaudojami viešai prieinamiems baziniams modeliams mokyti. Tokiose aplinkose įvedamų duomenų apribojimai gali būti švelnesni, tačiau vis tiek būtina taikyti rizikos valdymo ir prieigos kontrolės politiką.

Ką galima saugiai įklijuoti į DI įrankį?

Nepaisant apribojimų, yra daug informacijos, kurią galima pateikti DI įrankiui be reikšmingos konfidencialumo rizikos. Pavyzdžiui:

  • viešai prieinama medžiaga – atvirų šaltinių straipsniai, tinklaraščių įrašai, viešos rinkos ataskaitos, teisės aktai ar interneto svetainių turinys, pavyzdžiui, Vikipedijos tekstai;
  • nekonfidenciali informacija – bendro pobūdžio instrukcijos, klausimai apie teorines sąvokas, gramatikos ir rašybos taisyklės, matematinės lygtys ar žodžių reikšmės;
  • nuasmenintos dokumentų ištraukos – raštų šablonai, sutarčių pavyzdžiai ar programinio kodo fragmentai, iš kurių visiškai pašalinti unikalūs kintamieji, raktai, klientų pavadinimai ir vidinės architektūros detalės;
  • savo sukurti tekstai – el. laiškų juodraščiai, socialinių tinklų įrašai, pristatymų planai ar straipsniai, kuriuose nėra jautrių verslo duomenų;
  • atvirieji duomenų rinkiniai – sintetiniai duomenys ar viešų saugyklų statistika, naudojami analizės ir formatavimo įgūdžiams lavinti.

Kaip veiksmingai nuasmeninti pranešimus ir duomenis prieš siunčiant juos DI?

Prieš siunčiant konfidencialius dokumentus kalbos modeliui, juos būtina paruošti ir pašalinti jautrią informaciją. Taip galima dirbti su tekstu mažinant konfidencialių duomenų atskleidimo riziką.

Identifikatorių šalinimas ir pakeitimas žymenimis

Jautrūs duomenys gali būti pakeičiami dirbtiniais atitikmenimis. Pavyzdžiui, vardą ir pavardę „Jonas Jonaitis“ galima pakeisti žymeniu „[Klientas_1]“, o įmonės pavadinimą „UAB Pavyzdys“ – „[Organizacija_A]“. Taip kalbos modeliui išsaugoma dokumento struktūra, sintaksė ir kontekstas, bet kartu apsunkinamas pirminio subjekto atpažinimas.

Jautrios informacijos maskavimo būdai

Maskuojant kritinės reikšmės simbolių sekos tiesiog paslepiamos, dažniausiai pakeičiant jas specialiaisiais simboliais, pavyzdžiui, kortelės numerį pateikiant kaip 4532 **** **** ****. Veiksmingas būdas yra ir duomenų apibendrinimas: vietoj tikslios sumos, pavyzdžiui, 3 200 EUR atlyginimo, nurodomas intervalas – „3 000–4 000 EUR atlyginimas“. Tai mažina pakartotinio asmens atpažinimo riziką.

Proceso automatizavimas: DLP įrankiai ir RegEx

Ilguose tekstuose šalinant informaciją rankiniu būdu lengva kai ką praleisti. Profesinėje aplinkoje naudojami reguliariosiomis išraiškomis (RegEx) pagrįsti scenarijai arba DLP (duomenų nutekėjimo prevencijos) sistemos. Šie įrankiai gali automatiškai patikrinti užklausą prieš ją išsiunčiant ir aptikti, užblokuoti ar pakeisti asmens kodus, PVM mokėtojo kodus, el. pašto adresus ar banko sąskaitų numerius atitinkančias simbolių sekas.

DI pateikiama informacija: kaip neleisti mokyti modelių naudojant jūsų duomenis?

Riziką, susijusią su informacijos įvedimu į DI įrankį, galima mažinti ir pakeitus paties įrankio nustatymus. Dauguma paslaugų teikėjų leidžia atsisakyti duomenų naudojimo modeliams mokyti.

  • ChatGPT (OpenAI) – paskyros Settings skiltyje Data controls yra parinktis Improve the model for everyone. Ją išjungus, įvesti tekstai nebenaudojami modeliui mokyti. Dabartinėje sąsajos versijoje pokalbiai iš naudotojo rodinio dėl to nedingsta – pokalbių istorija išlieka. Nepriklausomai nuo šio nustatymo, OpenAI saugumo užtikrinimo ir piktnaudžiavimo stebėsenos tikslais dar 30 dienų saugo atitinkamus įrašus savo serveriuose, o vėliau juos visam laikui ištrina.
  • Gemini (Google) – privatumo nustatymuose reikia išjungti Gemini Apps Activity. Tuomet nauji pokalbiai neįrašomi į Google paskyrą ir nenaudojami modeliams mokyti. Vis dėlto įrašai iš paslaugos teikėjo infrastruktūros iškart neištrinami: paslaugos saugumo tikslais Google juos saugo iki 72 valandų.
  • Claude (Anthropic) – nemokamose ir standartinėse vartotojams skirtose versijose šiuo metu pagal numatytuosius nustatymus įvesti duomenys naudojami algoritmams tobulinti. Tai svarbus pokytis nuo ankstesnės Anthropic praktikos, kai bendrovė pabrėždavo nenaudojanti naudotojų pokalbių mokymui. Norint šį naudojimą išjungti, paskyros privatumo nustatymuose reikia išjungti parinktį Help improve Claude.

Svarbu atminti, kad privatumo nustatymų pakeitimai ir atsisakymas leisti naudoti duomenis mokymui galioja tik būsimiems pokalbiams. Anksčiau pateiktos informacijos, kuri jau buvo įtraukta į modelio mokymo procesą, šie pakeitimai iš neuroninio tinklo nepašalina.

Apibendrinimas

  • Kiekvieną sąveiką su vartotojams skirtu DI įrankiu verta vertinti taip, tarsi informaciją skelbtumėte viešai. Todėl jam negalima teikti asmens duomenų, medicininių dokumentų, slaptažodžių ar komercinių paslapčių.
  • Pateikta informacija apdorojama keliais etapais: ji gali būti naudojama modeliams mokyti, moderuojama ir saugoma išorinių serverių atsarginėse kopijose.
  • Saugiau dirbti su modeliu padeda išankstinis nuasmeninimas, jautrių simbolių sekų maskavimas, jų pakeitimas žymenimis ir specializuoti DLP įrankiai.
  • Enterprise paskyrose ar specializuotose verslo debesijos aplinkose taikomi griežtesni apsaugos standartai, o klientų duomenys nenaudojami viešiems modeliams mokyti.
  • Privatumo nustatymų pakeitimas ir atsisakymas leisti naudoti duomenis mokymui galioja tik ateityje: taip nepašalinama informacija, kuri jau buvo panaudota modeliui mokyti.

Parašykite komentarą

El. pašto adresas nebus skelbiamas. Būtini laukeliai pažymėti *

Neseniai tinklaraštyje

29.09.2026 Copywriting
28.09.2026 Copywriting
26.09.2026 Copywriting
25.09.2026 Copywriting
24.09.2026 Copywriting
23.09.2026 Copywriting
19.09.2026 Copywriting
18.09.2026 Turinio rinkodara
17.09.2026 Turinio rinkodara

Profesionalūs verslo tekstai

Nemokama kaina

Tapkite tekstų kūrėju

Karjera

Praktinis
tekstų rašymo
kursas