Direct Preference Optimization

method for training language models directly on preference data without a separate reward model; replaces reinforcement learning from human feedback with a classification-style objective on preferred vs dispreferred outputs

Discussed in 2 episodes Wikidata (Q139833558) →

Episodes