Cielené bezpečnostné ladenie LLM znižuje škodlivé odpovede, no môže spustiť masové odmietanie
Nová metóda učí model odmietať iba škodlivú časť témy. Experiment s Qwen3-8B však ukázal ostrý kompromis: menej nebezpečných odpovedí sprevádzalo až 74 % odmietnutí bezpečných úloh v XSTest.