Stanford preveril 56 AI benchmarkov: rovnaké schopnosti často merajú rozdielne
Dve štúdie zo Stanfordu upozorňujú, že populárne AI benchmarky nemusia merať deklarovanú schopnosť. Problém sa týka aj testov zaujatosti a viacjazyčnej bezpečnosti, podľa ktorých sa rozhoduje o nákupe či regulácii modelov.