Synteettinen data ei takaa yksityisyyttä – hyöty on testattava erikseen

|Kirjoittaja: QUASAn toimitus|4 min lukuaika| 1
Synteettinen data ei takaa yksityisyyttä – hyöty on testattava erikseen

Synteettinen aineisto ei muutu automaattisesti anonyymiksi, eikä todellista dataa muistuttava tulos vielä osoita sen sopivan tekoälymallin koulutukseen. Käyttökelpoisuus ja yksityisyys on arvioitava erikseen: NISTin synteettisen datan tietosuojaselitys toteaa, etteivät monet tuottamismenetelmät täytä differentiaalisen yksityisyyden tai muun todistettavan tietosuojaominaisuuden vaatimuksia.

Ratkaisevaa on, mitä lähtöaineistosta voidaan päätellä julkaistun datan avulla ja säilyykö tuotetussa aineistossa aiotun tehtävän vaatima tieto. Ensin on määriteltävä tuottamistapa, suojattavat henkilöt ja luovutuksen vastaanottajat. Sitten laatua on verrattava saman tehtävän kannalta todelliseen, synteesistä erillään pidettyyn aineistoon.

Tuottamistapa määrää, mitä pitää tutkia

Google Cloudin synteettisen datan kuvauksessa täysin synteettiset tietueet tuotetaan ilman alkuperäisten rivien säilyttämistä, kun taas osittain synteettisessä aineistossa vain osa kentistä korvataan; myös täysin tuotetun aineiston tarkkuus vaatii validointia ennen tekoälyn koulutusta. Ero vaikuttaa tietosuojan tarkasteluun: osittain synteettisissä riveissä alkuperäiset arvot ovat suoraan mukana, täysin synteettisissä riveissä huomio kohdistuu siihen, mitä tuottava malli on oppinut lähtöaineistosta.

Yksittäinen keinotekoinen tietue voi muistuttaa oikeaa tietuetta sattumalta tai siksi, että harvinainen yhdistelmä on opittu liian tarkasti. Pelkkä samankaltaisuus ei vielä osoita tietovuotoa, mutta se antaa syyn tutkia, erottuuko alkuperäinen henkilö muista tai voiko hänestä päätellä arkaluonteisen tiedon. Osittaisessa synteesissä esimerkiksi nimen korvaaminen ei ratkaise asiaa, jos jäljelle jäävä tapahtumien ja ominaisuuksien yhdistelmä osoittaa samaan henkilöön.

Kolmas tapaus on aineisto, jonka tuottamiselle on määritelty differentiaalisen yksityisyyden takuu. Takuu koskee tiettyä satunnaistettua menetelmää ja sen ehtoja, ei tiedoston keinotekoista ulkoasua. Siksi toimittajan sana ”synteettinen” ei kerro, onko tarjolla matemaattinen suoja, empiirinen riskimittaus vai vain alkuperäisten kenttien korvaus.

Ensimmäinen tarkistus: yksityisyysväite ja sen näyttö

Kirjaa väite lauseeksi, jonka paikkansapitävyyttä voi tutkia. ”Aineistossa ei ole nimiä” kertoo yhden kentän käsittelystä; väite henkilön osallistumisen päättelyn rajoittamisesta koskee laajempaa riskiä. Sen arviointia varten on määriteltävä vastaanottajan mahdollinen taustatieto, julkaistut kentät ja se, pääseekö hän käsiksi myös aiempiin versioihin.

  1. Selvitä lähtöaineiston suhde tulokseen. Kysy, käytettiinkö oikeiden henkilöiden tietoja mallin sovittamiseen, jäikö riveihin alkuperäisiä arvoja ja esiintyykö sama henkilö monessa tapahtumassa. Täysin simuloitu aineisto, jota ei ole sovitettu henkilötietoihin, on eri tapaus kuin arkaluonteisista rekistereistä opittu synteesi.
  2. Erittele luvattu suoja. Jos väite koskee differentiaalista yksityisyyttä, tarvitaan menetelmä, parametrit ja suojattava yksikkö. Tapahtumakohtainen suoja ei tarkoita samaa kuin yhden henkilön kaikkien tapahtumien suoja. Myös samasta aineistosta tehdyt muut julkaisut kuuluvat kokonaisarvioon.
  3. Mittaa realistiset hyökkäykset. Tutki tuotettujen ja alkuperäisten tietueiden läheisyyttä, harvinaisia yhdistelmiä sekä sitä, voiko hyökkääjä päätellä henkilön kuulumisen lähtöaineistoon. Arvioi erikseen, paljastuuko jo tunnetusta henkilöstä uusi arkaluonteinen ominaisuus.

Empiirinen hyökkäystesti kertoo, onnistuiko tarkasteltu hyökkäys valituissa olosuhteissa. Sen läpäisy ei yksin todista yleistä yksityisyystakuuta: vastaanottajan taustatieto ja poikkeukselliset henkilöt voivat muuttaa riskiä. Tästä syystä avoimeen julkaisuun tehtävä arvio voi edellyttää eri näyttöä kuin rajatussa testiympäristössä tapahtuva käyttö.

Differentiaalinen yksityisyys riippuu koko julkaisuketjusta

NISTin arviointiohjeen mukaan takuun merkitys riippuu yksityisyysparametreista ja suojattavasta yksiköstä: yhden tapahtuman suoja voi olla heikko, jos henkilö tuottaa monta tapahtumaa. Parametreja ei siten voi vertailla irrallaan toisistaan tai suojattavan yksikön määritelmästä. Hyvältä näyttävä luku ei korvaa kuvausta siitä, mitä henkilön tietojen kokonaisuudelle tapahtuu.

Tarkista myös, mihin prosessin vaiheisiin takuu ulottuu. Jos arkaluonteisesta aineistosta lasketaan ensin suojaamattomia tilastoja tai tuotettua dataa jälkikäteen korjataan alkuperäisten rivien avulla, pelkän synteesivaiheen todistus ei kata näitä käsittelyjä. Samasta lähtöaineistosta julkaistut tarkat tilastot voivat lisäksi paljastaa tietoa, vaikka toinen julkaisu olisi tuotettu differentiaalisesti yksityisellä menetelmällä.

Matemaattinen suoja ei poista tarvetta tarkistaa toteutusta. Virhe ohjelmassa tai väärin lasketut tietosuojaparametrit voivat muuttaa käytännössä saadun suojan. Hyökkäystestit ja auditointi täydentävät menetelmän todistusta löytämällä mahdollisia toteutusvirheitä, mutta ne eivät muutu todistukseksi vain siksi, ettei virhettä havaittu.

Toinen tarkistus: hyöty mitataan käyttötarkoituksessa

Aineiston yleinen samankaltaisuus lähtödatan kanssa ei riitä laatukriteeriksi. Ennen vertailua on määriteltävä käyttötarkoitus ja hyväksyttävä virhe: mallin koulutuksessa se voi tarkoittaa ennusteiden osuvuutta ja kalibroitumista, tilastollisessa analyysissä tiettyjen jakaumien ja yhteyksien tarkkuutta. Synteesi voi säilyttää muuttujien yksittäiset jakaumat mutta kadottaa niiden välisen yhteyden, jota varsinainen tehtävä tarvitsee.

Jos aineistolla koulutetaan luokittelumalli, kouluta muuten vertailukelpoiset mallit synteettisellä ja alkuperäisellä datalla ja arvioi ne samalla erillisellä todellisella testiaineistolla. Testijoukkoa ei pidä käyttää synteesin sovittamiseen tai valintaan, jotta sen tulos kertoo yleistymisestä eikä aiemmin nähdyn aineiston toistamisesta. Pelkän keskimääräisen osuvuuden rinnalla kannattaa tarkastella tehtävän kannalta olennaisia alaryhmiä ja harvinaisia tapauksia.

Tilastollisessa käytössä mittaa juuri ne tunnusluvut, joiden perusteella päätös tehdään. Esimerkiksi kokonaiskeskiarvon hyvä vastaavuus ei auta, jos päätös riippuu jakauman ääripäästä. Synteesin tuoma epävarmuus on erotettava alkuperäisen otoksen epävarmuudesta, ja pieniä ryhmiä on tarkasteltava erikseen, koska niiden tarkkuus voi heiketä.

Ohjelmistotestin hyöty määritellään toisin: tuotettujen arvojen on noudatettava kenttien muotoja ja keskinäisiä sääntöjä sekä katettava tarpeelliset virhetilanteet. Väestöjakauman tarkka jäljittely ei silloin välttämättä ole tarpeen. Sama aineisto voi siis toimia ohjelmiston kuormitustestissä ja epäonnistua mallin koulutuksessa ilman, että tuloksissa on ristiriitaa.

Hyväksyntä edellyttää kahta erillistä tulosta

Kirjaa tietosuojan arvio ja tehtäväkohtainen laatutesti erillisinä päätöksinä. Tietosuojan puolella päätös yksilöi suojattavat henkilöt, vastaanottajat, julkaisumuodon ja hyväksytyn riskin. Laadun puolella se yksilöi tehtävän, testiaineiston, mittarit ja hyväksymisrajan. Hyvä mallisuoritus ei korjaa tunnistamisriskiä, eikä vahva yksityisyystakuu tee aineistosta automaattisesti hyödyllistä.

Jos toinen arvio jää vajaaksi, vaihtoehtoja ovat vastaanottajapiirin rajaaminen, tuottamismenetelmän muuttaminen tai käyttötarkoituksen kaventaminen. Muutoksen jälkeen molemmat tulokset on mitattava uudelleen, sillä vahvempi suoja voi muuttaa jakaumia ja alkuperäisten kenttien poistaminen voi heikentää tehtävän kannalta tärkeää tietoa. Hyväksyntä koskee aina juuri arvioitua versiota ja käyttöä.

Jaa:

Tilaa uutiskirjeemme

Saat tuoreimmat Web3-, tekoäly- ja kryptouutiset suoraan sähköpostiisi.

0