GDPR at malaking datos: mga legal na batayan para sa pagsasanay sa AI sa Netherlands

Isang kumikinang na digital padlock sa ibabaw ng circuit-board pattern sa isang open-plan office

Ang GDPR at ang malaking datos ay hindi magkasalungat, ngunit pinipilit nito ang isang pagpipilian na ipinagpapaliban ng maraming organisasyon: bago ka mangolekta o muling gamitin ang isang malaking dataset, dapat mong matukoy ang legal na batayan para sa paggawa nito at ipakita na ang pagproseso ay kinakailangan para sa layuning iyon. Sa pagsasagawa, nangangahulugan ito ng pagdodokumento ng isang batayan sa ilalim ng Artikulo 6 ng Pangkalahatang Regulasyon sa Proteksyon ng Datos, pagsubok kung ang isang paggamit sa hinaharap para sa pagsasanay ng isang algorithm ay tugma sa layunin kung saan orihinal na kinolekta ang datos, at pagtatasa ng panganib bago itayo ang unang modelo. Itinakda ng artikulong ito kung paano nalalapat ang mga patakarang iyon sa malawakang analytics at pagsasanay sa AI sa Netherlands, at kung saan iginuguhit ng Autoriteit Persoonsgegevens ang hangganan.

Ano ang maituturing na personal na datos sa isang malaking hanay ng datos

Isang abstract na imahe na kumakatawan sa intersection ng data, AI, at mga legal na framework, na may mga gear at circuit na magkakaugnay sa isang gavel.

Ang GDPR ay nalalapat sa impormasyong may kaugnayan sa isang natukoy o makikilalang natural na tao. Sa konteksto ng malaking data, ang limitasyong iyon ay mas madalas na nalalampasan kaysa sa inaasahan ng mga organisasyon, dahil ang pagkakakilanlan ay sinusuri sa pamamagitan ng pagtukoy sa lahat ng paraang makatwirang malamang na gamitin, ng controller o ng sinumang iba pa, upang pumili ng isang tao. Samakatuwid, ang isang dataset ng mga device identifier, mga bakas ng lokasyon, mga talaan ng transaksyon o mga clickstream ay halos palaging personal na data, kahit na walang pangalan na lumalabas sa iisang column.

Dalawang konsepto ang madalas na nalilito, at ang pagkakaiba ang nagpapasiya kung ang regulasyon ay naaangkop ba. Ang mga pseudonymised na datos, kung saan ang mga identifier ay napalitan na ngunit ang susi ay umiiral pa rin sa kung saan, ay nananatiling personal na datos at nananatiling ganap na napapailalim sa GDPR. Ang mga anonymised na datos, kung saan ang muling pagkakakilanlan ay hindi na makatwirang posible para sa sinuman, ay wala rito. Mataas ang pamantayan para sa tunay na anonymisation: ang pagsasama-sama, pag-hash o ang pag-alis ng mga direktang identifier ay karaniwang nag-iiwan ng sapat na bakas para sa isang determinadong partido na muling tukuyin ang mga indibidwal, lalo na kapag ang dataset ay mayaman at sumasaklaw sa mahabang panahon.

Mahalaga ito dahil ang pag-aangkin na ang isang dataset ay anonymous ay kadalasang isang palagay na nagdadala ng bigat sa isang buong programa ng AI. Kung ito ay mabigo, ang bawat hakbang sa ibaba, mula sa pagsasanay hanggang sa iskedyul ng pagpapanatili, ay isinagawa nang walang legal na batayan. Ang mas ligtas na pamamaraan ay ang pagtrato sa dataset bilang personal na data maliban kung ang isang dokumentadong pagsusuri ng muling pagkakakilanlan ay nagsasabi ng iba, at muling bisitahin ang pagsusuring iyon kapag ang dataset ay pinayaman o pinagsama sa ibang mapagkukunan. Tinalakay din ng European Data Protection Board kung kailan maaaring ituring na anonymous ang isang modelo ng AI mismo, at ang sagot nito ay hindi ito maaaring ipagpalagay: ang isang modelong sinanay sa personal na data ay maaari pa ring maglaman ng data na iyon sa anyong maaaring kunin at kailangang suriin bawat kaso.

Pagpili ng legal na batayan para sa pagsasanay sa malaking datos at AI

Isang larawan na nagpapakita ng matinding kaibahan sa pagitan ng isang structured, mala-blueprint na grid at isang tuluy-tuloy, makulay na nebula, na sumasagisag sa salungatan sa pagitan ng GDPR at AI.

Ang bawat operasyon sa pagproseso ay nangangailangan ng isa sa anim na batayan sa Artikulo 6, at ang batayan ay kailangang piliin bago magsimula ang pagproseso sa halip na muling buuin pagkatapos. Para sa malawakang analitika, tatlo lamang ang makatotohanang mga kandidato.

Ang pahintulot ang pinakamalinis sa teorya at pinakamarupok sa pagsasagawa. Kailangan itong malayang ibigay, tiyak, may kaalaman, at malinaw, at dapat itong madaling bawiin tulad ng pagbibigay nito noon. Ang pahintulot na pinagsama-sama sa mga pangkalahatang termino, nakuha bilang isang kondisyon ng isang serbisyo na hindi nangangailangan ng datos, o nakabalangkas nang napakalawak na hindi makita ng indibidwal kung ano ang napagkasunduan, ay hindi magiging epektibo. Kung saan binawi ang pahintulot, kailangan mo ng teknikal na sagot sa tanong kung ano ang mangyayari sa isang modelo na sinanay na.

Ang pangangailangan para sa pagganap ng isang kontrata ay mas makitid kaysa sa inaakala. Ang pagsubok ay obhetibong pangangailangan para sa serbisyong talagang hiniling ng indibidwal, hindi komersyal na kapakinabangan. Ang pag-profile ng isang customer upang mapabuti ang isang recommendation engine ay karaniwang hindi kinakailangan para sa paghahatid ng produktong kanilang binili, at paulit-ulit na tinanggihan ng Court of Justice ang mga pagtatangka na palawigin ang batayan na ito upang masakop ang behavioral advertising at personalization.

Nag-iiwan ito ng mga lehitimong interes, na siyang batayan ng karamihan sa malawakang pagproseso. Nangangailangan ito ng tatlong hakbang, na dokumentado sa ganoong pagkakasunud-sunod: pagtukoy sa isang tunay at legal na interes, pagpapakita na ang pagproseso ay kinakailangan dahil walang gaanong mapanghimasok na paraan upang makamit ito, at pagbabalanse ng interes laban sa mga karapatan at makatwirang inaasahan ng mga taong kinauukulan. Sa isang sanggunian mula sa isang korte ng Netherlands tungkol sa pambansang asosasyon ng tennis, kinumpirma ng Court of Justice noong 2024 na ang isang purong komersyal na interes ay maaaring maging kwalipikado bilang isang lehitimong interes, ngunit kung ang mga kinakailangan at pagsubok sa pagbabalanse ay tunay na natutugunan. Samakatuwid, ang halagang pangkomersyo ay isang katanggap-tanggap na interes, hindi isang lisensya.

Mga espesyal na kategorya at mga hinuha na katangian

Ang datos na nagpapakita ng lahi o etnikong pinagmulan, mga opinyon sa politika, mga paniniwalang pangrelihiyon, pagiging miyembro ng unyon ng manggagawa, kalusugan, buhay sekswal o oryentasyong sekswal, kasama ang genetic at biometric na datos na ginamit para sa pagkakakilanlan, ay hindi maaaring iproseso maliban kung isa sa mga makitid na eksepsiyon sa Artikulo 9 ang naaangkop. Ang tahasang pahintulot ang karaniwang paraan; ang iba ay bihirang magkasya sa isang komersyal na dataset.

Ang patibong sa malaking datos ay hindi kailangang sadyang kolektahin ang mga espesyal na datos ng kategorya. Kung saan pinapayagan ng isang dataset na mahinuha ang isang protektadong katangian, halimbawa sa pamamagitan ng mga pattern ng pagbili, kasaysayan ng lokasyon o mga nilalaman ng mga free-text field, ang mas mahigpit na rehimen ay nalalapat sa pagprosesong iyon kahit na walang direktang nagtanong. Ang mga tampok ng modelo na nagsisilbing proxy para sa isang protektadong katangian ay dapat matukoy sa panahon ng pagbuo, hindi pagkatapos ng isang reklamo.

Limitasyon sa layunin: maaari mo bang gamitin muli ang data upang sanayin ang isang modelo

Maaari mo, ngunit hindi awtomatiko. Kinakailangan ng GDPR na ang personal na datos ay kolektahin para sa mga tinukoy, tahasang, at lehitimong layunin at hindi iproseso pa sa paraang hindi tugma sa mga layuning iyon. Ang pagsasanay ng isang algorithm sa datos na nakalap para sa pagtupad ng order, suporta sa customer, o pag-iwas sa pandaraya ay isang karagdagang operasyon sa pagproseso, at ito ay naaayon sa batas lamang kung ito ay pumasa sa pagsubok sa pagiging tugma na itinakda ng regulasyon.

Ang pagsusulit na iyan ay hindi isang pormalidad. Nagtatanong ito tungkol sa ugnayan sa pagitan ng orihinal na layunin at ng bago, ang konteksto kung saan nakalap ang datos at kung ano ang makatwirang inaasahan ng indibidwal batay dito, ang uri ng datos at kung may mga espesyal na kategoryang kasangkot, ang mga posibleng kahihinatnan ng bagong pagproseso, at ang pagkakaroon ng mga pananggalang tulad ng pseudonymization o encryption. Ang isang dataset ng mga medikal o pinansyal na rekord ay babagsak sa pagsusulit kung saan ang isang dataset ng mga hindi nagpapakilalang operational log ay makakapasa dito.

May isang shortcut, at ito ay mas makitid kaysa sa karaniwang ipinapalagay. Ang karagdagang pagproseso para sa pag-archive para sa pampublikong interes, para sa siyentipiko o makasaysayang pananaliksik o para sa mga layuning pang-estadistika ay itinuturing na tugma, basta't may mga pananggalang para sa pagproseso ng pananaliksik. Ang pagbuo ng komersyal na modelo na nakadamit bilang pananaliksik ay hindi kwalipikado; ang eksepsiyon ay naglalayong sa tunay na pananaliksik na napapailalim sa mga pamantayang metodolohikal at etikal, hindi sa pagpapabuti ng produkto. Kung saan hindi natugunan ang pagsubok sa pagiging tugma, kailangan mo ng isang bagong legal na batayan at, sa karamihan ng mga kaso, sariwang impormasyon para sa mga taong kinauukulan.

Ang praktikal na bunga nito ay ang limitasyon sa layunin ay kailangang hawakan sa punto ng pangongolekta. Ang mga pahayag sa privacy na naglalarawan ng mga layunin sa mga terminong sapat ang lawak upang maging walang kahulugan ay hindi makakapagligtas ng susunod na pagsasanay, dahil tinitingnan ng pagsusulit kung ano ang makatwirang inaasahan ng indibidwal, hindi sa kung ano ang teknikal na pinahihintulutan ng pagbalangkas. Ang aming gabay sa pagsulat ng isang patakaran sa privacy sa Netherlands ay nagtatakda kung paano ilarawan ang mga layunin sa paraang tapat at magagamit.

Pagliit, pagpapanatili, at katumpakan kapag gusto ng modelo ang lahat

Ang pagbabawas ng datos ay nangangailangan ng personal na datos na maging sapat, may kaugnayan, at limitado sa kung ano ang kinakailangan. Ang prinsipyong iyan ay tunay na kasalungat ng isang paraan ng pag-develop na ang lohika ay ang mas maraming datos ay lumilikha ng mas mahusay na modelo, at ang tensyon ay hindi maaaring malutas sa pamamagitan ng pagbalewala dito. Ang maaaring malutas nito ay isang dokumentadong argumento: kung aling mga field ang kailangan para sa nakasaad na layunin, ano ang sinubukan nang wala ang mga ito, at kung bakit itinapon ang natitira. Ang isang controller na makapagpapakita na ang pagsusuri ay may maipagtatanggol na posisyon kahit na malaki ang dataset. Ang isang controller na nag-iingat ng lahat dahil mura ang imbakan ay hindi.

Ang limitasyon sa imbakan ay nagtataas ng parehong tanong sa paglipas ng panahon. Ang data ng pagsasanay, mga tindahan ng tampok, mga checkpoint ng modelo at mga inference log ay pawang nasa ilalim ng obligasyon ng pagpapanatili, at bawat isa ay nangangailangan ng sarili nitong panahon na nakatali sa isang layunin. Ang mga inference log ay madalas na nakakalimutan at kadalasang naglalaman ng mas maraming personal na data kaysa sa set ng pagsasanay.

Ang katumpakan ang prinsipyong kadalasang nakaliligtaan sa kontekstong ito, at mayroon itong legal na kalamangan na madaling makaligtaan. Ang personal na datos ay dapat na tumpak at, kung kinakailangan, panatilihing napapanahon, at ang mga indibidwal ay may karapatang itama. Kung ang isang modelo ay lumilikha ng isang output tungkol sa isang makikilalang tao, ang output na iyon mismo ay personal na datos. Ang isang hinuha na ang isang tao ay may mahinang panganib sa kredito, isang malamang na manloloko o isang hindi angkop na kandidato ay datos tungkol sa kanila, maaari itong maging hindi tumpak, at maaari itong hamunin. Ang pagbuo ng isang sistema kung saan ang mga naturang output ay hindi maaaring itama ay lumilikha ng isang problema sa pagsunod na kahit gaano pa karaming dokumentasyon ang maaayos pagkatapos.

Kapag ang pagtatasa ng epekto sa proteksyon ng datos ay sapilitan

Isang mabagsik na gusali ng pamahalaang Dutch na may magnifying glass na nakapatong, na sumisimbolo sa pagsusuri ng regulasyon.

Ang pagtatasa ng epekto sa proteksyon ng datos ay mandatoryo kung saan ang isang uri ng pagproseso ay malamang na magresulta sa mataas na panganib sa mga karapatan at kalayaan ng mga indibidwal, at ang regulasyon ay tumutukoy sa tatlong partikular na kaso: sistematiko at malawak na pagsusuri ng mga personal na aspeto batay sa awtomatikong pagproseso, kabilang ang pag-profile, kung saan nakabatay ang mga desisyon na may legal o katulad na makabuluhang epekto; malawakang pagproseso ng mga espesyal na kategorya ng datos o ng datos ng kriminal na paghatol; at sistematikong pagsubaybay sa isang pampublikong lugar na naa-access sa malawakang saklaw. Karamihan sa mga seryosong proyekto ng malaking datos ay nabibilang sa una o pangalawa.

Naglathala rin ang Autoriteit Persoonsgegevens ng isang listahan ng mga operasyon sa pagproseso kung saan palaging kinakailangan ang isang pagtatasa sa Netherlands, na sumasaklaw sa mga lugar tulad ng malawakang pag-profile, ang sistematikong pagsusuri ng mga empleyado, mga platform ng datos sa kalusugan at ang paggamit ng mga sistema ng kamera. Ang listahang iyon ang dapat na unang dokumentong kinonsulta sa simula ng isang proyekto, dahil inaalis nito ang argumento tungkol sa kung kinakailangan ba ang isang pagtatasa.

Dalawang punto tungkol sa tiyempo ang mahalaga. Ang pagtatasa ay kailangang isagawa bago magsimula ang pagproseso, na sa isang proyekto ng AI ay nangangahulugang bago tipunin ang datos ng pagsasanay, hindi bago i-deploy. At kung saan ang pagtatasa ay nagpapakita ng mataas na natitirang panganib na hindi mo maaaring mabawasan, dapat kang kumonsulta sa awtoridad na nangangasiwa bago magpatuloy. Ang paglaktaw sa konsultasyong iyon ay isang paglabag mismo, anuman ang maging legal ang pagproseso o hindi.

Ang isang kapaki-pakinabang na pagtatasa para sa isang sistemang algoritmo ay higit pa sa karaniwang template. Itinatala nito kung aling mga mapagkukunan ng datos ang nagpapakain sa modelo at sa anong batayan, kung ano ang pinapayagang magdesisyon ng modelo nang mag-isa at kung ano ang desisyon ng isang tao, kung paano ipinapaliwanag ang output sa taong apektado, kung paano sinubukan ang datos ng pagsasanay para sa bias laban sa mga protektadong grupo, at kung ano ang mangyayari kung mali ang modelo. Iyan ang mga tanong na unang itinatanong ng isang regulator.

Paano ito ipinapatupad ng Autoriteit Personsgegevens

Isang larawang nagpapakita ng basag na digital shield na may mga stream ng data na lumalabas, na kumakatawan sa isang data breach sa isang AI-driven na system.

Ang awtoridad na nangangasiwa sa Netherlands ay ang Autoriteit Persoonsgegevens, na siyang nagpapatupad ng GDPR kasama ang batas na nagpapatupad sa Netherlands, ang Uitvoeringswet AVG. Ang mga kapangyarihan nito ay mula sa isang babala at isang pagsaway hanggang sa isang utos na may kaakibat na multa, isang pansamantala o tiyak na pagbabawal sa pagproseso at isang administratibong multa. Itinatakda ng regulasyon ang mga limitasyon: hanggang sampung milyong euro o dalawang porsyento ng kabuuang taunang kita sa buong mundo para sa mas mababang antas, at hanggang dalawampung milyong euro o apat na porsyento para sa mga paglabag sa mga pangunahing prinsipyo, mga legal na batayan, mga karapatan ng mga paksa ng datos at mga patakaran sa mga internasyonal na paglilipat, alinman ang halagang mas mataas.

Dalawang tema ng pagpapatupad ang makikita sa kasanayang Dutch at parehong direktang may kinalaman sa malaking datos. Ang una ay ang transparency: isang malaking bahagi ng mga kamakailang aksyon ay may kinalaman sa mga pahayag sa privacy na hindi nagpapaliwanag sa madaling maunawaang wika kung aling datos ang ginagamit, para sa anong layunin at kung gaano katagal. Ang mga malabong paglalarawan ng layunin ay itinuturing na isang paglabag sa kanilang sariling karapatan, hindi bilang isang depekto sa pagbalangkas. Ang pangalawa ay ang pangangasiwa ng algorithm. Ang awtoridad ay may nakalaang yunit para sa pangangasiwa ng mga algorithm at naglalathala ng mga pana-panahong ulat sa mga panganib ng algorithm, na sulit basahin bilang isang pahayag ng inaasahan nito bago ito maging paksa ng isang imbestigasyon.

Kasabay ng pagpapatupad ay ang tungkulin sa pag-abiso ng paglabag. Ang isang paglabag sa personal na data ay dapat iulat sa awtoridad nang walang labis na pagkaantala at, kung saan magagawa, sa loob ng pitumpu't dalawang oras mula sa pagkaalam nito, maliban kung ang paglabag ay malamang na hindi magreresulta sa panganib sa mga indibidwal; kung saan mataas ang panganib sa mga indibidwal, dapat din silang ipaalam. Sa isang kapaligiran ng AI, ang pagtatasa ay mas mahirap kaysa dati, dahil ang isang nakompromisong training set o feature store ay nakakaapekto sa lahat ng naglalaman ng data nito at ang mga kahihinatnan ay umaabot sa bawat desisyon na ginawa ng modelo. Tandaan na ito ay isang hiwalay na obligasyon mula sa mga tungkulin sa pag-uulat ng insidente sa ilalim ng Cyberbeveiligingswet, ang pagpapatupad ng NIS2 sa Netherlands, na inilapat mula noong Agosto 15, 2026 at nagpapataw ng sarili nitong mga deadline ng abiso na dalawampu't apat at pitumpu't dalawang oras sa mga entity na nasa loob ng saklaw nito. Ang aming pangkalahatang-ideya ng NIS2 at ng Dutch Cybersecurity Act ay nagpapaliwanag kung paano magkatabi ang dalawang rehimen.

Hindi pinapalitan ng AI Act ang GDPR

Kinokontrol ng EU Artificial Intelligence Act ang mga sistema ng AI bilang mga produkto: inuuri nito ang mga ito ayon sa panganib at nagpapataw ng mga obligasyon sa mga provider at deployer. Hindi ito nagbibigay ng legal na batayan para sa pagproseso ng personal na data, at ang pagsunod dito ay walang sinasabi tungkol sa pagsunod sa GDPR. Kung saan pinoproseso ng isang sistema ng AI ang personal na data, ang parehong rehimen ay nalalapat nang buo at magkasabay.

Mahalaga ang talaorasan para sa pagpaplano. Ang mga pagbabawal sa mga hindi katanggap-tanggap na kasanayan, ang mga obligasyon para sa mga pangkalahatang layunin ng AI model at ang mga tungkulin sa transparency para sa mga sistemang nakikipag-ugnayan sa mga tao o bumubuo ng sintetikong nilalaman ay ipinapatupad na. Ang high-risk regime ay ipinagpaliban ng digital omnibus package: ang mga obligasyon para sa mga high-risk system na nakalista sa Annex III ay nalalapat na ngayon mula Disyembre 2, 2027, at ang mga obligasyon para sa mga sistemang bahagi ng kaligtasan ng mga regulated na produkto sa ilalim ng Annex I mula Agosto 2, 2028. Ang hiwalay na panukala para sa isang AI Liability Directive ay binawi na, kaya ang pananagutan para sa pinsalang dulot ng isang AI system ay patuloy na pinamamahalaan ng mga ordinaryong patakaran ng Dutch sa kontrata at tort at ng European product liability regime.

Para sa isang organisasyong nakabatay sa datos, ang praktikal na bunga nito ay ang pagsusuri ng GDPR ang nananatiling umiiral na limitasyon ngayon, habang ang AI Act ang nagtatakda kung anong dokumentasyon, pagsubok, at pangangasiwa ng tao ang kakailanganin ng iisang sistema bago matapos ang dekada. Ang pagbuo ng dalawang pagsasanay nang magkahiwalay ay gumagana nang magkapareho; ang pagbuo ng mga ito nang magkasama ay hindi. Ang aming mga gabay sa EU AI Act at sa mga high-risk AI system ay naglalahad ng klasipikasyon at mga obligasyon nang detalyado.

Mga paghahabol at danyos ng grupo: ang sibil na panig ng panganib

Hindi lamang ang mga multa sa regulasyon ang tanging pagkakalantad, at sa Netherlands ay maaaring hindi ang mga ito ang pinakamalaki. Ang Wet afwikkeling massaschade in collectieve actie (WAMCA) ay nagpapahintulot sa isang pundasyon o asosasyon na nakakatugon sa mahigpit na mga kinakailangan sa pamamahala at pagpopondo na magsampa ng isang kolektibong aksyon para sa mga danyos sa ngalan ng isang tinukoy na grupo, na may isang rehimen ng pag-opt-out para sa mga taong naninirahan sa Netherlands. Ang pagproseso na batay sa data ay isang malinaw na target: ang isang desisyon sa disenyo ay nakakaapekto sa bawat gumagamit sa parehong paraan, na siyang tiyak na homogeneity na kailangan ng isang kolektibong aksyon.

Pinatitibay ito ng GDPR mula sa sarili nitong panig. Binibigyan nito ang sinumang nakaranas ng materyal o di-materyal na pinsala bilang resulta ng isang paglabag ng karapatan sa kabayaran mula sa controller o processor, at pinapayagan nito ang isang non-profit na organisasyon na aktibo sa larangan ng proteksyon ng datos na magsampa ng mga kaso sa ngalan ng mga data subject, sa ilang mga kaso nang walang mandato mula sa kanila. Kinumpirma ng Court of Justice na maaaring kumilos ang isang asosasyon ng proteksyon ng mamimili batay dito.

May limitasyon, at ito ay kapaki-pakinabang para sa mga nasasakdal. Ipinahayag ng Hukuman ng Hustisya na ang paglabag sa GDPR ay hindi sa ganang sarili nito ay nagbibigay ng karapatan sa kabayaran: dapat ipakita ng nagsasakdal ang aktwal na pinsala at isang sanhing ugnayan, bagama't walang hangganan ng kalubhaan ang nalalapat sa di-materyal na pinsala kapag ito ay napatunayan na. Samakatuwid, ang mga indibidwal na parusa sa pagsasagawa ng Dutch ay katamtaman lamang, ngunit ang aritmetika ng isang klase ng daan-daang libo ay lubos na nagbabago sa larawan. Inilalarawan ng aming artikulo tungkol sa mga kolektibong paghahabol sa kaso ng malawakang pinsala kung paano tumatakbo ang mga paglilitis na ito.

Sino ang tagakontrol kung ang datos ay nagmumula sa lahat ng dako

Bihirang manatili sa loob ng iisang organisasyon ang mga proyektong may malaking datos. Ang datos ay pinayayaman ng isang broker, na hino-host ng isang cloud provider, nililinis ng isang analytics agency at ipinapasok sa isang modelong ibinibigay ng isang vendor, at ang bawat isa sa mga ugnayang iyon ay kailangang mailarawan nang tama, dahil ang alokasyon ng mga tungkulin ang tumutukoy kung sino ang may hawak ng aling obligasyon at kung sino ang mananagot sa regulator.

Ang isang controller ang nagtatakda ng mga layunin at paraan ng pagproseso; ang isang processor ay kumikilos lamang batay sa mga dokumentadong tagubilin ng controller. Kung saan ang dalawa o higit pang partido ay magkasamang nagtatakda ng mga layunin at paraan, sila ay mga joint controller at dapat itakda ang kani-kanilang mga responsibilidad sa isang kaayusan, lalo na para sa pagbibigay ng impormasyon at para sa paghawak ng mga kahilingan mula sa mga indibidwal, na maaaring gamitin ang kanilang mga karapatan laban sa alinman sa kanila. Ang label na ginamit sa kontrata ay hindi nagpapasiya: ang mahalaga ay kung sino talaga ang magpapasya kung bakit at paano pinoproseso ang data. Ang isang supplier na may karapatang gamitin ang iyong data upang mapabuti ang sarili nitong produkto ay, sa ganoong lawak, ay naging isang controller para sa sarili nitong mga layunin, anuman ang tawag dito sa kasunduan.

Dalawang sugnay sa mga kontrata ng supplier ang nararapat bigyan ng partikular na atensyon sa konteksto ng AI. Ang una ay ang nagpapahintulot sa provider na gamitin ang nilalaman ng customer para sa pagsasanay o para sa pagpapabuti ng serbisyo; kung mayroon man, isinisiwalat mo ang personal na data sa ibang controller at kailangan mo ng batayan at abiso para sa pagsisiwalat na iyon. Ang pangalawa ay ang sugnay na sub-processor, dahil ang mga model provider ay madalas na umaasa sa mga karagdagang supplier at sa imprastraktura sa labas ng European Economic Area, na siyang nagsasagawa ng mga patakaran sa paglilipat. Ang isang kasunduan sa pagproseso na sumasaklaw sa kinakailangang paksa ngunit hindi naglalarawan kung ano talaga ang nangyayari sa data ay walang gaanong silbi sa isang imbestigasyon.

Panghuli, tandaan na ang prinsipyo ng pananagutan ay naglalagay ng pasanin ng patunay sa tagakontrol. Hindi sapat ang pagsunod lamang; dapat mong maipakita ito, gamit ang mga rekord, pagtatasa, at kasunduan na tumutugma sa mga sistema kung paano talaga ito binuo.

Ano ang dapat ihanda bago magsimula ang susunod na proyekto

Ang pagsunod sa mga regulasyon para sa malaking datos ay itinatayo sa yugto ng disenyo, dahil ang regulasyon ay nangangailangan ng proteksyon ng datos sa pamamagitan ng disenyo at bilang default: ang mga naaangkop na teknikal at organisasyonal na hakbang ay kailangang isama sa pagproseso mismo, at tanging ang personal na datos na kinakailangan para sa bawat partikular na layunin ang maaaring iproseso bilang default. Ang pagsasaayos ay magastos at kadalasang hindi kumpleto.

Limang bagay ang nakakagawa ng pagkakaiba sa pagsasagawa. Magtago ng talaan ng mga aktibidad sa pagproseso na aktwal na naglalarawan sa daloy ng datos sa likod ng bawat modelo sa halip na ang mga departamentong nagmamay-ari ng mga ito. Magpasya at isulat ang legal na batayan para sa bawat operasyon sa pagproseso, kabilang ang karagdagang pagproseso na kasangkot sa pagsasanay, at itago ang pagtatasa ng mga lehitimong interes kasama nito. Isagawa ang pagtatasa ng epekto bago tipunin ang datos, at kumonsulta sa awtoridad na nangangasiwa kung saan nananatiling mataas ang natitirang panganib. Maglagay ng kasunduan sa pagproseso ng datos sa bawat supplier na humahawak sa datos, kabilang ang mga provider ng modelo o platform, at suriin kung ano ang pinahihintulutan nilang gawin sa iyong datos para sa kanilang sariling mga layunin; ang mga kinakailangan ay nakasaad sa aming gabay sa kasunduan sa pagproseso ng datos . At suriin kung saan napupunta ang datos: ang mga paglilipat sa labas ng European Economic Area ay nangangailangan ng mekanismo ng paglilipat sa ilalim ng Kabanata V ng regulasyon at isang pagtatasa ng epekto ng paglilipat, at ang posisyon ng mga indibidwal na ikatlong bansa ay maaaring magbago.

Higit sa lahat, pagtrabahuhan ang mga taong bumubuo ng mga modelo at ang mga taong sumusuri sa panganib sa iisang dokumento. Ang mga pundasyon ng regulasyon mismo ay nakabuod sa aming pangkalahatang-ideya ng Pangkalahatang Regulasyon sa Proteksyon ng Datos , at ang mga partikular na tanong na itinataas ng paglalagay ng personal na datos sa isang sistema ng AI, mula sa awtomatikong paggawa ng desisyon hanggang sa mga karapatan ng mga taong apektado, ay tinatalakay sa aming kasamang artikulo tungkol sa GDPR at AI sa Netherlands.

Ilang karaniwang tanong

Aling legal na batayan ang dapat nating gamitin para sa pagsasanay ng isang modelo ng AI

Sa karamihan ng mga komersyal na setting, ang sagot ay mga lehitimong interes, na sinusuportahan ng isang nakasulat na pagtatasa na sumasaklaw sa interes, pangangailangan, at pagsasanay sa pagbabalanse. Mas mainam ang pahintulot kung sensitibo ang datos o kung hindi ay ikagugulat ng mga taong kinauukulan ang paggamit nito, ngunit dapat itong tunay na libre at maaaring bawiin, na mahirap isaayos para sa isang training set. Ang pangangailangan para sa isang kontrata ay halos hindi kailanman sumasaklaw sa pagbuo ng modelo, dahil ang pagsasanay ay hindi ang hinihiling ng customer. Alinmang batayan ang piliin mo, itala ito bago magsimula ang pagproseso: ang pagpili ng batayan nang retrospektibo ay itinuturing na walang batayan.

Nalalapat pa rin ba ang GDPR kung gagawin muna nating anonymous ang data?

Kung tunay na gumagana ang anonymisation. Anonymous ang datos kapag ang muling pagkakakilanlan ay hindi na makatwirang posible para sa sinuman, isinasaalang-alang ang lahat ng paraan na malamang na gamitin at ng iba pang mga dataset na maaaring pagsamahin dito. Ang pag-aalis ng mga pangalan, pagpapalit ng mga identifier ng mga hash o pagsasama-sama sa maliliit na grupo ay karaniwang hindi umaabot sa pamantayang iyon, at ang resulta ay datos na ginawang pseudonym, na nananatiling napapailalim sa regulasyon nang buo. Kung saan ang anonymisation ang batayan para ituring ang isang proyekto bilang wala sa saklaw, ang konklusyong iyon ay kailangang subukan at idokumento, at muling suriin tuwing magbabago ang dataset.

Maaari ba tayong umasa sa exception ng pananaliksik upang muling gamitin ang data ng customer

Bihirang mangyari. Ang karagdagang pagproseso para sa mga layuning siyentipiko o istatistikal ay itinuturing na tugma sa orihinal na layunin, ngunit ang eksepsiyon ay naglalayong sa pananaliksik na isinasagawa ayon sa kinikilalang mga pamantayang metodolohikal at napapailalim sa mga pananggalang tulad ng paggamit ng sagisag-panulat at mga paghihigpit sa pag-access. Ang pagbuo ng produkto o pagpapabuti ng modelo na isinasagawa ng isang komersyal na partido para sa sarili nitong kapakinabangan ay hindi nagiging pananaliksik dahil kinabibilangan ito ng agham ng datos. Kung ang pagsubok sa pagiging tugma ay hindi natutugunan sa sarili nitong merito, kailangan mo ng isang bagong legal na batayan at, sa karamihan ng mga kaso, bagong impormasyon sa mga indibidwal na nababahala.

Ano ang mangyayari kung bawiin ng isang tao ang kanyang pahintulot pagkatapos na masanay ang isang modelo

Ang pag-atras ay magkakabisa sa hinaharap at hindi naman ginagawang labag sa batas ang naunang pagproseso, ngunit nangangahulugan ito na ang datos ay hindi na maaaring gamitin batay dito. Sa praktikal na paraan, kinakailangan nito ang kakayahang alisin ang indibidwal mula sa training set at mula sa mga feature store at log, at muling sanayin o kung hindi man ay tiyakin na hindi na ipinapakita ng modelo ang datos ng taong iyon kung saan maipapakita nitong ginagawa ito. Ito ang isa sa mga dahilan kung bakit ang pahintulot ay isang mahirap na batayan para sa pagsasanay ng modelo, at ito ay isang tanong na sulit sagutin sa yugto ng disenyo sa halip na pagkatapos dumating ang unang kahilingan.

Gaano Law and More ay maaaring makatulong sa

Law and More nagpapayo sa mga organisasyong Dutch at internasyonal sa panig ng proteksyon ng datos ng analytics at AI: pagpili at pagdodokumento ng isang legal na batayan, pagsasagawa ng mga lehitimong pagtatasa ng interes at mga pagtatasa ng epekto, pagbalangkas ng mga pahayag sa privacy at pagproseso ng mga kasunduan na nakaligtas sa masusing pagsusuri, pagtugon sa Autoriteit Persoonsgegevens, at pagtatanggol sa mga paghahabol na isinampa ng mga indibidwal o ng mga kinatawan na pundasyon. Kung nagpaplano ka ng isang proyektong nakabase sa datos o may regulator na nakipag-ugnayan na sa iyo, ikalulugod naming tingnan ang file kasama ka.

Kailangan mo ba ng Tulong Legal?

Makipag-ugnayan Law & More para sa gabay ng eksperto sa iyong mga legal na usapin. Ang aming multilingual na pangkat ay handang tumulong.

Mga kaugnay na artikulo

Ang mga tungkulin sa pag-uulat ng insidente sa cybersecurity sa Netherlands ay pinamamahalaan ng Cybersecurity Act (Cyberbeveiligingswet, Cbw),

Ang isang startup term sheet ay nagtatakda ng mga iminungkahing termino ng isang pamumuhunan bago ang tiyak na

Pinapayagan ang pamamahala ng algorithm, ang paggamit ng mga sistema ng AI upang subaybayan, bigyan ng puntos, at gabayan ang mga empleyado.

Tuklasin kung paano mapalakas ng napapanahong legal na suporta ang iyong depensa laban sa mga singil sa pag-atake at karahasan.

Ang pagsalungat ay ang lunas laban sa isang hatol na hindi natupad: isang hatol na ibinigay laban sa isang nasasakdal na

Ang isang elektronikong lagda ay may parehong legal na epekto gaya ng isang sulat-kamay sa ilalim ng artikulo 3:15a

Manatiling Updated sa Batas ng Olandes

Mag-subscribe sa aming newsletter para sa mga pinakabagong legal na pananaw, mga update sa regulasyon, at praktikal na payo.