DeepAmbigQA odhaľuje slabinu LLM: správna odpoveď ešte nemusí byť úplná
Benchmark DeepAmbigQA skúša, či vyhľadávacie LLM dokážu rozlíšiť nejednoznačné názvy a zostaviť úplný zoznam odpovedí. Výsledky autorov ukazujú vysokú presnosť jednotlivých položiek, ale slabé pokrytie celej požadovanej množiny.