Apple ukazuje, že jednoduchá self-distillation vie zlepšiť generovanie kódu
Výskumný tím Apple opisuje Simple Self-Distillation: model sa zlepšuje na vlastných vzorkách bez učiteľa, verifikátora alebo reinforcement learningu.
Tag
Všetky publikované články, v ktorých sa téma post-training objavuje ako dôležitý kontext. Aktuálne 3 textov v archíve.
Výskumný tím Apple opisuje Simple Self-Distillation: model sa zlepšuje na vlastných vzorkách bez učiteľa, verifikátora alebo reinforcement learningu.
OpenAI opísalo, ako sa z drobnej odchýlky v odmeňovaní pri ladení osobnosti stala viditeľná črta modelu. Príbeh je zaujímavý najmä tým, že nejde o jeden veľký bug, ale o pomalé šírenie malých preferencií naprieč generáciami modelu.
Nová práca Self-Distillation Zero tvrdí, že model si vie z binárnej odmeny vytvoriť hustejší tréningový signál aj bez externého učiteľa. Ak sa výsledky potvrdia, mohlo by to zlacniť časť post-trainingu pre matematické a kódové reasoning úlohy.