Benchmark odhalil, že väčšina testovaných LLM nezvládla logiku slov ako „možno“ a „musí“
Test so 14 320 úlohami a 29 modelmi skúma logické vyvodzovanie z prirodzených vyjadrení neistoty. Iba deväť modelov prekročilo náhodnú úroveň podľa prísnej metriky kompetencie.