aifeed.skAI Feed
AI výskum4 min čítania

Apple skúma lacnejší unlearning: nie každý tréningový bod potrebuje rovnaký zásah

Výskumníci z Apple a Harvardu navrhujú pred unlearningom odfiltrovať tréningové body so zanedbateľným vplyvom na výstupy modelu. Na skúmaných jazykových a obrazových úlohách uvádzajú úsporu výpočtov až približne 50 %, nízky nameraný vplyv však sám osebe nedokazuje právne ani technicky úplné zabudnutie údajov.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Výskumná práca
Zdroj / autorita
Apple Machine Learning Research

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI výskum a opiera sa o 3 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Najprv zistiť, čo model skutočne ovplyvnilo

Výskumníci Udi Wieder, Vitaly Feldman, Robert Fisher a Anat Kleiman, spojení s Apple a Harvardom, navrhujú zmeniť poradie krokov pri strojovom odnaučení, označovanom ako machine unlearning. Namiesto toho, aby systém automaticky spracoval každý príklad v množine určenej na zabudnutie, má najprv odhadnúť vplyv jednotlivých bodov na výstupy modelu. Položky s prakticky zanedbateľným účinkom potom možno vyradiť ešte pred spustením drahšieho unlearningového algoritmu. Apple uvádza, že takýto rámec priniesol na skúmaných reálnych empirických príkladoch úsporu výpočtov až približne 50 %. Nejde však o garantovanú úsporu pre ľubovoľný model alebo dataset.

Práca porovnáva vplyvové funkcie pri jazykových aj obrazových úlohách. Ich úlohou je približne určiť, ako by sa predikcia modelu zmenila, keby konkrétny tréningový príklad dostal menšiu váhu alebo bol odstránený. Ak je odhadovaná zmena zanedbateľná, autori taký bod považujú za kandidáta na vynechanie z následného odnaučenia. Dôležité spresnenie oproti stručnému opisu výsledku je, že návrh nenahrádza existujúce metódy unlearningu. Funguje skôr ako predspracovanie, ktoré zmenší ich vstupnú množinu a náročnejší zásah ponechá iba pre body s merateľným vplyvom.

Tým sa mení základná optimalizačná otázka. Organizácia už nehľadá iba rýchlejší spôsob, ako odnaučiť celú množinu požiadaviek, ale zisťuje, ktoré položky si vôbec vyžadujú zmenu parametrov. Tréningové dáta bývajú redundantné a viaceré veľmi podobné príklady môžu podporovať rovnaký vzor. Odstránenie jedného z nich preto nemusí viditeľne zmeniť správanie modelu. Úspora však závisí od toho, koľko nízko-vplyvových bodov sa v konkrétnej dávke nachádza a koľko stojí samotný výpočet ich vplyvu.

Prečo nestačí vymazať riadok z databázy

Počas tréningu sa informácia z dát premieta do parametrov a rozhodovacích hraníc modelu. Neskoršie odstránenie pôvodného súboru preto automaticky nevráti model do stavu, v akom by bol bez daného príkladu. Najsilnejšou praktickou referenciou zostáva nové natrénovanie na očistenej množine, pri veľkých systémoch je však časovo, energeticky a finančne náročné. Unlearning sa snaží dosiahnuť rovnaký alebo dostatočne podobný výsledok lacnejšie, pričom musí obmedziť vplyv odstránených dát bez neprijateľného poškodenia užitočnosti modelu.

Nezávislá práca Machine Unlearning od tímu okolo Nicolasa Papernota ukázala inú cestu k znižovaniu nákladov. Rámec SISA už počas tréningu rozdeľuje dáta tak, aby požiadavka na odstránenie bodu nevyžadovala opakovanie celého procesu. Autori pri jednoduchších úlohách uviedli násobné zrýchlenie oproti tréningu od začiatku, pri klasifikácii ImageNetu bolo zrýchlenie menšie a sprevádzané miernym poklesom presnosti. Porovnanie ukazuje dva doplnkové prístupy: SISA pripravuje model na budúce mazanie vopred, zatiaľ čo návrh Apple a Harvardu sa pokúša zmenšiť množstvo práce podľa dodatočne odhadnutého vplyvu bodov.

Praktický test pre firemné dátové pipeline

Pre prevádzkovateľa modelu by navrhovaný postup znamenal zaviesť viacstupňový proces. Najprv musí spoľahlivo identifikovať, v ktorých tréningových verziách sa sporný záznam nachádzal. Potom vypočíta jeho vplyv voči vopred určeným výstupom, použije konzervatívny prah a náročný unlearning spustí na zostávajúcich bodoch. Nakoniec potrebuje overiť výsledok proti referenčnému modelu alebo proti súboru testov zameraných na zabudnutie. Úspora akcelerátorového času je užitočná iba vtedy, ak náklady na evidenciu pôvodu dát, odhad vplyvu a záverečné overenie nezmažú získaný rozdiel.

Priemer celkovej presnosti na takúto kontrolu nestačí. Citlivý alebo neobvyklý záznam môže mať malý vplyv na agregovanú metriku, no stále sa môže prejaviť pri úzkej skupine vstupov alebo pri cielenom zisťovaní členstva v tréningovej množine. Audit by preto mal zahŕňať testy memorovania, extrakcie konkrétnych sekvencií, membership-inference útokov a správania modelu na relevantných podskupinách. Zaznamenať treba aj verziu modelu, použitú vplyvovú funkciu, prah vyradenia a dôvod, prečo systém označil bod za zanedbateľný. Bez takejto stopy sa rozhodnutie neskôr ťažko obhajuje alebo reprodukuje.

Metóda môže byť najzaujímavejšia pri dávkovom spracovaní väčšieho počtu požiadaviek, napríklad po zistení chybnej licencie, kontaminovaného zdroja alebo nesprávneho označenia dát. Organizácia môže prípady zoradiť podľa odhadovaného dopadu a presnejšie metódy vyhradiť pre body, ktoré skutočne menia model. Pri modeloch priebežne dolaďovaných na nových dátach však treba vplyv opakovane prepočítať. Bod nevýznamný pre jednu verziu nemusí zostať nevýznamný po ďalšom tréningu, zmene úlohy alebo nasadení modelu v inom kontexte.

Európske právo neurčuje technický algoritmus

Pre slovenské a európske organizácie je prirodzeným kontextom článok 17 GDPR, ktorý za stanovených podmienok priznáva dotknutej osobe právo na vymazanie osobných údajov a zároveň obsahuje výnimky. Nariadenie však nepredpisuje konkrétny unlearningový algoritmus ani nehovorí, že nízky vplyv na vybrané predikcie automaticky splní požiadavku na vymazanie. Právne posúdenie závisí od toho, či model alebo súvisiace artefakty ďalej predstavujú spracúvanie osobných údajov, od účelu spracúvania, použitého právneho základu a technickej možnosti identifikovať účinok konkrétnej osoby. Výsledok výskumného testu preto nemožno zamieňať s potvrdením súladu s GDPR.

Slovenská firma využívajúca externý model navyše často nemá prístup k tréningovým bodom, checkpointom ani nástrojom potrebným na odnaučenie. Praktickou podmienkou je preto zmluvná a technická spolupráca medzi prevádzkovateľom dát, poskytovateľom modelu a prípadnými sprostredkovateľmi. Už pri obstarávaní systému má zmysel žiadať dokumentáciu pôvodu dát, politiku vybavovania žiadostí, verziovanie modelov a dôkazy o vykonaných zásahoch. Lacnejší algoritmus nepomôže, ak organizácia nevie zistiť, kde boli údaje použité.

Najväčšou otvorenou neistotou zostáva spoľahlivosť vplyvových odhadov pri veľkých hlbokých a generatívnych modeloch. Ide o aproximácie, ktoré môžu byť citlivé na architektúru, zvolenú metriku a oblasť vstupov. Verejný opis Apple potvrdzuje jazykové a obrazové úlohy a úsporu približne do 50 % na skúmaných príkladoch, neposkytuje však univerzálny benchmark pre dnešné najväčšie modely ani dôkaz úplného odstránenia všetkých prejavov konkrétneho záznamu. Návrh je preto užitočným smerom pre efektívnejšie riadenie životného cyklu dát, nie hotovou skratkou k preukázateľnému zabudnutiu.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie
Ročná stopa Chutes má ukázať, ako sa v čase mení prevádzka LLM
Výskum5 min čítania4 zdroje

Ročná stopa Chutes má ukázať, ako sa v čase mení prevádzka LLM

Výskumníci opisujú celoročnú produkčnú stopu platformy Chutes naprieč používateľmi, populárnymi aj menej využívanými modelmi. Sľubovaný súbor môže zlepšiť testovanie cache, plánovania kapacity a rozdeľovania záťaže, jeho verejné sprístupnenie a anonymizáciu však zatiaľ nemožno overiť.

Robot môže nejasný pokyn vyriešiť novým pohľadom, nielen otázkou
Výskum5 min čítania3 zdroje

Robot môže nejasný pokyn vyriešiť novým pohľadom, nielen otázkou

Experiment s reálnym robotom ukazuje, že nejednoznačný pokyn nemusí vždy vyžadovať otázku človeku. Systém v 36 pokusoch striedal nové pozorovanie, spresnenie zámeru a výber objektu; výsledky sú sľubné, no zatiaľ pochádzajú iba z deviatich stolových scenárov.