aifeed.skAI Feed
AI produkty3 min čítania

Yahoo nasadilo Bedrock na rozširovanie reklamných tém, výsledky filtruje cez podobnosť

Yahoo nahradilo v časti reklamnej platformy starší postup Word2Vec a LSH generatívnou AI cez Amazon Bedrock. Produkčný systém kombinuje Claude 3.5 Sonnet v2 s kontrolou významovej podobnosti a filtrami citlivých výrazov.

Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.

Typ zdroja
Kurátorovaný súhrn
Zdroj / autorita
AWS Machine Learning Blog

Redakčný kontext

Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov a zodpovednú kontrolu pravidiel robí Marek Považský.

Článok je zaradený v sekcii AI produkty a opiera sa o 3 zdroje.

Yahoo zmodernizovalo rozširovanie kľúčových slov vo svojej reklamnej platforme DSP pomocou veľkého jazykového modelu prevádzkovaného cez Amazon Bedrock. Nejde iba o výmenu jedného modelu za druhý. Firma prebudovala časť produkčného postupu tak, aby generatívna AI navrhovala nové výrazy, no o ich zaradení rozhodovala aj samostatná kontrola významovej podobnosti a pravidlá pre citlivý obsah. Prípadová štúdia AWS tak ukazuje praktický vzor nasadenia: model tvorí kandidátov, ale nie je jediným arbitrom ich kvality.

Search Retargeting v Yahoo DSP spája vyhľadávací zámer používateľa s reklamou v zobrazovacích, video a natívnych formátoch. Inzerent najprv definuje segment pomocou východiskových kľúčových slov a systém ich rozšíri o príbuzné výrazy, aby dokázal zachytiť väčšiu skupinu relevantných vyhľadávaní. Výsledné množiny sa ukladajú do Amazon OpenSearch Service a ďalší dávkový proces ich porovnáva s históriou vyhľadávania. Ide teda o súčasť dátovej a rozhodovacej infraštruktúry, nie o chatovú funkciu pre koncového používateľa.

Staršie riešenie používalo reprezentácie Word2Vec a vyhľadávanie pomocou lokalitne citlivého hašovania, označovaného LSH. Takýto postup vedel nájsť podobné frázy, no Yahoo podľa zverejneného opisu narážalo na zastaranú slovnú zásobu, slabšie rozpoznávanie konkrétnych entít a prílišný dôraz na povrchovú podobnosť. Pri niektorých vstupoch nevzniklo žiadne použiteľné rozšírenie. To je podstatný problém v reklame, kde sa slovník produktov, udalostí a používateľských záujmov mení rýchlo.

Tím preto cez SageMaker Studio porovnal viacero modelov vrátane Amazon Titan, Meta Llama a Anthropic Claude. Ako najvhodnejší pre danú úlohu vybral Claude 3.5 Sonnet v2, pričom hodnotil pomer medzi počtom navrhnutých rozšírení a ich významovou blízkosťou k pôvodným výrazom. Bedrock poskytol spoločnú serverovú vrstvu pre experimentovanie aj nasadenie bez toho, aby Yahoo muselo samostatne prevádzkovať každý model a riešiť jeho škálovanie či aktualizácie.

Samotný jazykový model však pri testoch vytváral aj nesúvisiace alebo príliš široké návrhy. Yahoo preto každý nový výraz opäť prevedie na vektorovú reprezentáciu a porovná ho s pôvodným kľúčovým slovom. Kandidáty pod nastaveným prahom podobnosti odstráni. Tento krok je dôležitý najmä pri zriedkavých alebo nejednoznačných výrazoch, pri ktorých môže model rozvinúť nesprávny význam a rozšíriť segment mimo zámeru inzerenta.

Druhou vrstvou sú ochranné pravidlá. Citlivé výrazy sa kontrolujú pred odoslaním požiadavky modelu aj po vygenerovaní výsledkov; systém zároveň rešpektuje zoznamy zakázaných segmentov, pravidlá platformy a nastavenia súkromia používateľov. Zverejnený návrh je preto bližší riadenému spracovateľskému potrubiu než voľnému generovaniu textu. Pre regulované alebo reputačne citlivé použitia je práve oddelenie tvorby, overenia a presadzovania pravidiel dôležitejšie než samotná voľba modelu.

Podľa údajov Yahoo a AWS dosiahol nový postup pri širokom rozširovaní päťnásobne vyšší medián pomeru rozšírenia a dvojnásobné maximum aj pri prísnych prahoch podobnosti. V niektorých prípadoch model vytvoril stovky až tisíce návrhov tam, kde starší LSH postup nevytvoril žiadny. Firma uvádza až 600-násobný rast miery rozširovania kľúčových slov a až päťnásobné zväčšenie adresovateľného publika. Tieto čísla pochádzajú od dodávateľov riešenia a bez nezávislého auditu ich treba chápať ako výsledky konkrétneho systému, nie ako všeobecnú garanciu pre každý reklamný scenár.

Produkčná funkcia bola podľa AWS spustená už v prvom štvrťroku 2025, kým aktuálny technický článok zverejňuje architektúru a výsledky až teraz. Novinkou teda nie je čerstvé zapnutie služby, ale detailnejší pohľad na to, ako Yahoo prešlo od klasického rozširovania slovníka ku kombinácii LLM, embeddingov, OpenSearch a dávkového vyhodnocovania. Tento časový rozdiel je dôležitý: opisuje systém, ktorý mal prejsť reálnou prevádzkou, nie iba laboratórny prototyp.

Pre ďalšie podniky je najprenosnejším poznatkom spôsob kontroly. Generatívny model môže pokryť nový slovník a významové súvislosti, no kvalitu výstupu chráni merateľný filter, samostatné pravidlá a možnosť spätne sledovať jednotlivé kroky. Rovnaký vzor sa dá použiť pri vyhľadávaní, odporúčaniach, klasifikácii dokumentov či tvorbe metadát. Organizácia by však mala prahy a metriky kalibrovať na vlastných dátach a sledovať nielen počet nových kandidátov, ale aj falošné zhody, diskriminačné dopady a zmeny správania po aktualizácii modelu.

Prípad Yahoo zároveň ukazuje, že modernizácia nemusí znamenať zahodenie klasických metód. Vektorové reprezentácie a kosínusová podobnosť zostali v architektúre ako kontrolná vrstva, zatiaľ čo LLM prevzal tvorivú časť rozšírenia. Praktický prínos vzniká z kombinácie techník: generatívna AI zväčšuje priestor možností, tradičné meranie ho zužuje a pravidlá určujú hranice použitia. Práve takáto viacvrstvová architektúra je realistickejšia cesta k spoľahlivému nasadeniu než očakávanie, že jeden model vyrieši tvorbu aj overenie sám.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie