LLM kritiky zlepšili triedenie testových otázok, problémy s férovosťou však spoľahlivo nezachytili
Experiment s 52 759 testovými položkami ukázal, že kritiky vytvorené modelom Qwen3 môžu zlepšiť automatické triedenie otázok. Pri zaujatosti, citlivosti, férovosti a prístupnosti však systém zostal nespoľahlivý.