aifeed.skAI Feed
AI výskum3 min čítania

Apple ukazuje, čo sa dá vyčítať z grafu, ktorý UMAP zvyčajne skrýva

Výskumníci Apple navrhujú analyzovať interný graf najbližších susedov UMAP ešte pred jeho skreslením do dvoch rozmerov. PageRank, k-core a koeficient zhlukovania môžu pomôcť nájsť reprezentatívne vzorky, husté jadrá aj neobvyklé okraje dát.

Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.

Typ zdroja
Kurátorovaný súhrn
Zdroj / autorita
Apple Machine Learning Research

Redakčný kontext

Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov a zodpovednú kontrolu pravidiel robí Marek Považský.

Článok je zaradený v sekcii AI výskum a opiera sa o 2 zdroje.

UMAP sa v dátovej vede často používa ako rýchly spôsob, ako premeniť tisíce rozmerov na dvojrozmernú mapu. Farebné ostrovy na nej potom slúžia na prvú orientáciu v embeddingoch obrázkov, textov alebo biologických meraní. Nová práca výskumníkov Apple však upozorňuje, že pri tomto postupe sa väčšina pozornosti sústreďuje na výsledný obrázok, hoci algoritmus si ešte pred projekciou vytvára bohatý graf najbližších susedov. Práve tento graf môže obsahovať spoľahlivejšiu informáciu o pôvodnej štruktúre dát.

Interný kNN graf spája každý bod s jeho najbližšími susedmi vo vysokorozmernom priestore. Na rozdiel od plochého zobrazenia ešte neprešiel kompresiou, ktorá musí meniť vzdialenosti, prekrývať niektoré oblasti a oddeľovať iné. Autori preto navrhujú pristupovať k nemu ako ku klasickej sieti a použiť naň zavedené grafové algoritmy. Nejde o nový náhradný vizualizačný model, ale o spôsob, ako z už vypočítaného medzivýsledku získať ďalšie vysvetlenia.

Prvým nástrojom je PageRank, známy najmä z hodnotenia dôležitosti webových stránok. V tomto prípade pomáha označiť dátové body, ktoré sú dobre prepojené s významnou časťou svojho okolia. Takéto body môžu fungovať ako reprezentatívne príklady triedy alebo lokálnej oblasti. Pre človeka, ktorý kontroluje veľký dataset, to znamená možnosť začať pri niekoľkých typických vzorkách namiesto náhodného prezerania tisícov položiek.

Druhým pohľadom je rozklad k-core. Ten postupne oddeľuje husté jadro siete od redšej periférie podľa toho, koľko spojení majú uzly vo svojom okolí. V praxi môže ukázať stabilné, často sa opakujúce štruktúry a zároveň body, ktoré ležia na okraji distribúcie. Periféria nemusí automaticky znamenať chybu: môže ísť o vzácny, ale platný prípad, prechod medzi triedami alebo podreprezentovanú skupinu, ktorú by priemerné metriky zakryli.

Tretí použitý ukazovateľ, koeficient zhlukovania, meria, do akej miery sú susedia konkrétneho bodu prepojení aj medzi sebou. Vysoká hodnota poukazuje na tesné lokálne spoločenstvo podobných vzoriek, nízka môže signalizovať most medzi skupinami alebo nejednoznačný príklad. Takýto pohľad je užitočný pri kontrole embeddingov, pretože samotná vzdialenosť v dvojrozmernom grafe nie vždy prezradí, či ide o pevný klaster alebo len vizuálny dôsledok projekcie.

Autori metódu hodnotili na datasetoch MNIST a Fashion-MNIST. Podľa práce sú grafové analýzy praktické a vo vybraných úlohách konkurencieschopné alebo doplnkové k účelovo navrhnutým metódam, napríklad k-medoids pri výbere exemplárov a HDBSCAN pri hustotnom zhlukovaní. To je dôležité najmä preto, že nejde o tvrdenie, že tri jednoduché metriky vyriešia všetky problémy interpretácie. Prínos spočíva v kombinácii viacerých pohľadov nad tou istou susedskou štruktúrou.

Pre tímy pripravujúce tréningové dáta môže byť tento postup praktickým auditným krokom. Reprezentatívne body pomôžu pri manuálnej kontrole kvality, husté jadrá odhalia dominantné vzory a periféria upozorní na prípady, ktoré si zaslúžia osobitné overenie. V systémoch vyhľadávania alebo odporúčania sa podobná analýza dá použiť na zisťovanie, či embeddingový priestor nevytvára izolované skupiny alebo či malé segmenty neostávajú bez vhodných susedov.

Výsledky však treba čítať opatrne. kNN graf stále závisí od zvolenej metriky vzdialenosti, počtu susedov a kvality vstupných reprezentácií. Ak embedding ignoruje dôležitú vlastnosť alebo nesie systematické skreslenie, grafová analýza ho sama neopraví. Rovnako PageRank neurčuje spoločenskú či doménovú dôležitosť vzorky; vyjadruje iba jej štrukturálne postavenie v konkrétnej sieti.

Najzaujímavejší odkaz práce je metodický: dvojrozmerná mapa nemá byť jediným zdrojom pravdy o vysokorozmerných dátach. UMAP už počas výpočtu vytvára objekt, ktorý sa dá skúmať samostatne, kvantitatívne a bez úplnej závislosti od ľudského pohľadu na vizualizáciu. Pre praktickú dátovú vedu to znamená lacný spôsob, ako k atraktívnemu obrázku pridať kontrolovateľné sieťové ukazovatele a presnejšie rozhodovať, ktoré vzorky preveriť.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie
AgentGUI dáva človeku dohľad nad dlhými behmi AI agentov
Výskum

AgentGUI dáva človeku dohľad nad dlhými behmi AI agentov

Otvorený lokálny nástroj AgentGUI vizualizuje trajektórie viacerých agentov a umožňuje ich ručne aj automaticky usmerňovať. V používateľskej štúdii skrátil hľadanie dôležitých udalostí v logoch o 38 percent; predbežné testy naznačili aj lepšiu úspešnosť malých lokálnych modelov.