Nařízení (EU) 2024/1689 (AI Act) · Kapitola III · Vysoce rizikové systémy AI
Čl. 10 · Data a správa dat
Znění
-
Vysoce rizikové systémy AI, které využívají techniky zahrnující trénování modelů AI obsahujících data, jsou vyvíjeny na základě souborů trénovacích, validačních a testovacích dat, které splňují kritéria kvality uvedená v odstavcích 2 až 5, a to kdykoli se tyto datové soubory používají.
-
Soubory trénovacích, validačních a testovacích dat podléhají příslušným postupům v oblasti správy a řízení dat, jež jsou pro zamýšlený účel vysoce rizikového systému AI vhodné. Tyto postupy se týkají zejména:
a) příslušných možností návrhu;
b) postupů při sběru dat a původu dat a v případě osobních údajů původního účelu jejich sběru;
c) příslušných operací zpracování přípravy dat, jako jsou anotace, označování, čištění, aktualizace, obohacování a agregace;
d) formulace předpokladů, zejména s ohledem na informace, které mají daná data měřit a představovat;
e) posouzení dostupnosti, množství a vhodnosti potřebných souborů dat;
f) přezkoumání s ohledem na potenciální zkreslení, která by mohla ovlivnit zdraví a bezpečnost osob, mít nepříznivý dopad na základní práva nebo vést k diskriminaci, která je podle práva Unie zakázána, zejména pokud výstupy dat ovlivňují vstupy pro budoucí operace;
g) vhodná opatření k odhalení, prevenci a zmírnění případných zkreslení zjištěných podle písmene f);
h) identifikace relevantních nedostatků nebo chyb v datech, které brání dodržování tohoto nařízení, a způsobu, jak tyto nedostatky a chyby vyřešit.
-
Soubory trénovacích, validačních a testovacích dat jsou s ohledem na svůj zamýšlený účel relevantní, dostatečně reprezentativní a v maximální možné míře bez chyb a úplné. Mají náležité statistické vlastnosti, a to i případně rovněž s ohledem na osoby nebo skupiny osob, v souvislosti s nimiž má být daný vysoce rizikový systém AI používán. Tyto vlastnosti souborů dat lze splnit na úrovni jednotlivých souborů dat nebo na úrovni jejich kombinací.
-
Soubory trénovacích, validačních a testovacích dat zohledňují v rozsahu nezbytném pro jejich zamýšlený účel vlastnosti nebo prvky, které jsou specifické pro konkrétní zeměpisné, kontextuální, behaviorální nebo funkční prostředí, ve kterém má být daný vysoce rizikový systém AI používán.
-
Pokud je to nezbytně nutné pro zajištění detekce a oprav zkreslení ve vztahu k vysoce rizikovým systémům AI v souladu s odst. 2 písm. f) a g) tohoto článku, mohou poskytovatelé těchto systémů výjimečně zpracovávat zvláštní kategorie osobních údajů s výhradou vhodných záruk týkajících se základních práv a svobod fyzických osob. Kromě ustanovení nařízení (EU) 2016/679 a (EU) 2018/1725 a směrnice (EU) 2016/680musí být ve vztahu k takovému zpracování naplněny všechny tyto podmínky:
a) detekce a opravy zkreslení nelze účinně provést zpracováním jiných údajů, včetně syntetických nebo anonymizovaných údajů;
b) zvláštní kategorie osobních údajů podléhají technickým omezením opakovaného použití osobních údajů, jakož i nejmodernějším bezpečnostním opatřením a opatřením v oblasti ochrany soukromí, včetně pseudonymizace;
c) zvláštní kategorie osobních údajů podléhají opatřením, která zajistí, aby zpracovávané osobní údaje byly zabezpečeny a chráněny a aby se na ně vztahovaly vhodné záruky, včetně přísných kontrol a dokumentace přístupu, s cílem zabránit zneužití a zajistit, aby k těmto osobním údajům měly přístup pouze oprávněné osoby s odpovídajícími povinnostmi zachování důvěrnosti;
d) zvláštních kategorie osobních údajů nejsou přenášeny, převáděny nebo jinak zpřístupněny jiným stranám;
e) zvláštních kategorie osobních údajů se vymažou, jakmile je zkreslení opraveno nebo jakmile u těchto údajů uplyne doba uchovávání, podle toho, co nastane dříve;
f) záznamy o činnostech zpracování podle nařízení (EU) 2016/679 a (EU) 2018/1725 a směrnice (EU) 2016/680 obsahují důvody vedoucí k tomu, že bylo zpracování zvláštních kategorií osobních údajů nezbytně nutné k odhalení a nápravě zkreslení a že tohoto cíle nemohlo být dosaženo zpracováním jiných údajů.
- Pro vývoj vysoce rizikových systémů AI, které nevyužívají techniky zahrnující trénování modelů AI, se odstavce 2 až 5 použijí pouze na soubory testovacích dat.
Znění: Úřední věstník EU z 12. 7. 2024. Konsolidované znění po novele nařízením (EU) 2026/1744 zatím vydané není.
Změněno nařízením (EU) 2026/1744 Přepsán odst. 1 s odkazem na nový čl. 4a a zrušen odst. 5, který zvláštní kategorie údajů upravoval dosud.
Komentář
Trénovací, validační a testovací sady musí být relevantní, dostatečně reprezentativní a v maximální možné míře bez chyb, s postupy správy dat od sběru přes labeling po detekci a mitigaci zkreslení. Zpracování zvláštních kategorií osobních údajů pro odhalování zkreslení jen za přísných kumulativních podmínek. Pro praxi nejdražší článek nařízení.
Vzhledem k rozsahu se úplné znění nereprodukuje. Klíčové pasáže jsou citovány u příslušných bodů výkladu.
Související ustanovení: čl. 3 body 29 až 33 (trénovací, validační a testovací data a vstupní data), čl. 9 (řízení rizik), čl. 15 (přesnost a smyčky zpětné vazby), čl. 13 (informace o použitých datech v návodu), čl. 2 odst. 7 (nedotčenost ochrany osobních údajů)
Související předpisy EU: GDPR, tedy obecné nařízení o ochraně osobních údajů (nařízení (EU) 2016/679); nařízení (EU) 2018/1725; směrnice (EU) 2016/680 (o ochraně údajů v trestních věcech)
Obsah výkladu
I.Rozsah povinnosti a datová triáda (odst. 1, 6)1 II.Postupy správy a řízení dat (odst. 2)4 III.Kvalita dat: reprezentativnost, správnost, kontext (odst. 3, 4)6 IV.Zvláštní kategorie údajů pro odstraňování zkreslení (odst. 5)8I. Rozsah povinnosti a datová triáda (odst. 1, 6)
1 Čl. 10 váže požadavky na jakost dat na soubory trénovacích, validačních a testovacích dat (čl. 3 body 29 až 32). Odstavec 1 se vztahuje na vysoce rizikové systémy, které využívají techniky zahrnující trénování modelů AI obsahujících data; kritéria kvality podle odstavců 2 až 5 se uplatní kdykoli se tyto datové soubory používají.
2 Odstavec 6 doplňuje pravidlo pro systémy, které trénování modelů nevyužívají (například čistě pravidlové systémy): u nich se odstavce 2 až 5 použijí pouze na soubory testovacích dat. Tím se působnost článku rozumně přizpůsobuje technické povaze systému.
3 Zdůrazňuji, že jakost dat je v architektuře nařízení jedním z klíčových nástrojů proti diskriminaci. Zkreslení obsažené v datech se totiž propisuje do výstupů systému, a proto se řízení dat prolíná jak s řízením rizik podle čl. 9, tak s přesností podle čl. 15.
II. Postupy správy a řízení dat (odst. 2)
4 Odstavec 2 podřizuje datové soubory postupům v oblasti správy a řízení dat vhodným pro zamýšlený účel. Jejich předmět vypočítává v písmenech a) až h): - možnosti návrhu; - sběr a původ dat, u osobních údajů i původní účel sběru; - operace přípravy dat, tedy anotace, označování, čištění, aktualizace, obohacování a agregace; - formulace předpokladů a posouzení dostupnosti a vhodnosti dat; - přezkoumání s ohledem na potenciální zkreslení (písm. f); - opatření k odhalení, prevenci a zmírnění zkreslení (písm. g). Poslední dvě položky jsou klíčové.
5 Mám za to, že těžištěm odstavce 2 jsou právě písmena f) a g). Nařízení výslovně cílí na zkreslení, která mohou vést k diskriminaci zakázané právem Unie, a to zejména tam, kde výstupy dat ovlivňují vstupy pro budoucí operace (nebezpečí sebeposilujícího zkreslení). Písmeno h) uzavírá výčet povinností identifikovat relevantní nedostatky a chyby v datech a určit způsob jejich řešení. Bod 67 odůvodnění tuto orientaci na zkreslení potvrzuje. Žádá odpovídající statistické vlastnosti dat se zvláštním zaměřením na zmírnění zkreslení. Míří na zkreslení, která by mohla ovlivnit zdraví a bezpečnost, negativně dopadnout na základní práva nebo vést k diskriminaci zakázané právem Unie. Zvlášť tam, kde výstupy dat ovlivňují vstupy pro budoucí operace, tedy ve smyčkách zpětné vazby. Upozorňuje též, že zkreslení bývají inherentní zejména u historických dat generovaných v reálném provozu.
III. Kvalita dat: reprezentativnost, správnost, kontext (odst. 3, 4)
6 Odstavec 3 stanoví jádrové kritérium jakosti: datové soubory jsou s ohledem na zamýšlený účel relevantní, dostatečně reprezentativní a v maximální možné míře bez chyb a úplné, s náležitými statistickými vlastnostmi, případně i s ohledem na osoby nebo skupiny, na nichž má být systém používán. Zdůrazňuji opatrnost zákonodárce ve formulaci: nežádá se dokonalost (data zcela bez chyb a zcela úplná), nýbrž maximální možná míra. Standard je tedy relativní k účelu a dosažitelnosti, což odpovídá měřítku stavu techniky podle čl. 8. Tentýž relativní standard nese bod 67 odůvodnění, podle něhož mají být data relevantní, dostatečně reprezentativní a v nejvyšší možné míře bez chyb a úplná. Dodává, že požadavek úplnosti a bezchybnosti nemá bránit používání technik ochrany soukromí při vývoji a testování systémů.
7 Odstavec 4 doplňuje kontextovou dimenzi: datové soubory zohledňují vlastnosti specifické pro zeměpisné, kontextuální, behaviorální nebo funkční prostředí, v němž má být systém používán. Prakticky to znamená, že soubor vhodný pro jedno prostředí nemusí obstát v jiném. Poskytovatel nese odpovědnost za to, aby data odpovídala reálnému kontextu nasazení.
IV. Zvláštní kategorie údajů pro odstraňování zkreslení (odst. 5)
8 Odstavec 5 zakotvuje zvláštní a citlivý právní titul. Je-li to nezbytně nutné pro zajištění detekce a oprav zkreslení podle odst. 2 písm. f) a g), mohou poskytovatelé výjimečně zpracovávat zvláštní kategorie osobních údajů (čl. 3 bod 37, tedy tzv. citlivé údaje), a to s výhradou vhodných záruk. Jde o jeden z mála případů, kdy AI Act sám zakládá vlastní titul ke zpracování nad rámec obecné nedotčenosti ochrany osobních údajů podle čl. 2 odst. 7. Bod 70 odůvodnění tento titul charakterizuje jako zpracování zvláštních kategorií osobních údajů jako záležitost významného veřejného zájmu ve smyslu čl. 9 odst. 2 písm. g) nařízení (EU) 2016/679 a čl. 10 odst. 2 písm. g) nařízení (EU) 2018/1725, a to výhradně v rozsahu nezbytně nutném k odhalování a nápravě zkreslení a s výhradou vhodných záruk. Bod odůvodnění tak sám umisťuje tento titul do soustavy práva o ochraně osobních údajů, nikoli mimo ni.
9 Titul je však úzký a je nutné jej vykládat restriktivně. Podmínky v písmenech a) až f) musí být splněné současně: - zpracování jiných údajů, například syntetických nebo anonymizovaných, nesmí postačovat; - citlivé údaje podléhají technickým omezením opakovaného použití a nejmodernějším bezpečnostním opatřením včetně pseudonymizace; - nesmějí být předávány třetím stranám; - vymažou se po opravě zkreslení nebo po uplynutí doby uchovávání; - důvody nezbytnosti se dokumentují v záznamech o činnostech zpracování. Zdůrazňuji, že tento titul se uplatní kromě GDPR, nařízení (EU) 2018/1725 a směrnice (EU) 2016/680, nikoli místo nich; splnění jeho podmínek nezbavuje ostatních povinností podle práva o ochraně osobních údajů.
Pozor na umístění pravidla. Odstavec 5 čl. 10 zrušilo nařízení (EU) 2026/1744 (čl. 1 bod 9 písm. b) a jeho obsah přesunulo do nového čl. 4a, kde navíc rozšířilo okruh adresátů. Starší materiály odkazují na čl. 10 odst. 5; ten od 27. července 2026 neexistuje. Souběžně bod 69 odůvodnění připomíná, že po celý životní cyklus systému se při zpracování osobních údajů uplatní zásady minimalizace údajů a záměrné a standardní ochrany údajů podle práva Unie o ochraně údajů.
Příklady
Případy jsou konstruované, ne rozhodnuté věci.
1. Reprezentativnost datového souboru (odst. 3). Model pro hodnocení úvěruschopnosti natrénovaný výhradně na datech z Prahy a použitý celostátně reprezentativní není. Ne proto, že je málo dat, ale proto, že složení dat neodpovídá skupině, na které se systém používá. Tentýž model natrénovaný na datech ze všech krajů požadavek plní.
2. Zpětnovazební smyčka (odst. 2 písm. f, g). Systém doporučuje, koho pozvat na pohovor. Jeho výstupy se ukládají a slouží jako trénovací data pro další verzi. Původní zkreslení se tím zesiluje. Bod 67 odůvodnění na tuto smyčku zpětné vazby výslovně míří a přezkoumání zkreslení ji musí zachytit.
3. Citlivé údaje pro odhalení zkreslení (odst. 5). Poskytovatel chce ověřit, jestli model nediskriminuje podle etnického původu, a k tomu potřebuje etnické údaje. Podle odstavce 5 to jde, ale všech šest podmínek písmen a) až f) musí být splněných současně. Nestačí zpracovat je „pro účely testování”, pokud by k témuž cíli stačila syntetická nebo anonymizovaná data.
Co z toho plyne v praxi
„Bez chyb a úplné” čtěte s výhradou. Odstavec 3 žádá tuto vlastnost v maximální možné míře, ne absolutně. Absolutní čtení by požadavek udělalo nesplnitelným.
Zkreslení se hledá aktivně. Písmena f) a g) odstavce 2 nejsou o tom, že zkreslení nesmí být. Jsou o tom, že ho musíte hledat a doložit, co jste s nalezeným udělali.
Původ dat dokumentujte hned. U osobních údajů včetně původního účelu sběru. Zpětné dohledání původu datového souboru po několika letech je zpravidla nemožné.
Z judikatury
Zatím žádná.
Otevřené otázky
1. Jak se měří „dostatečná reprezentativnost”. Nařízení nedává statistické měřítko ani metodu. Poskytovatel nese riziko vlastní volby.
2. Souběh odstavce 5 s právním základem podle GDPR. Čl. 10 odst. 5 dovoluje zpracovat zvláštní kategorie údajů k odhalení zkreslení, ale sám o sobě právní základ podle čl. 9 GDPR nenahrazuje. Jak se obojí potká, není postavené najisto.
3. Data, která poskytovatel nemá. U modelů natrénovaných třetí stranou nebo u obecných modelů poskytovatel navazujícího systému původ trénovacích dat často nezná. Jak má za těchto okolností splnit odstavec 2, text neřeší.