nemo_rl.data.hf_datasets.dpo
nemo_rl.data.hf_datasets.dpo
Contenu du Module
Classes
Fonctions
API
Classe de jeu de données pour l’entraînement d’Optimisation Directe de Préférence (DPO).
Cette classe est obsolète et sera supprimée dans une version future. Utilisez PreferenceDataset à la place.
Cette classe gère le chargement des données de préférence pour l’entraînement DPO. Les fichiers JSON d’entrée doivent contenir des exemples avec la structure suivante : { “prompt”: str, # L’invite/contexte d’entrée “chosen_response”: str, # La réponse préférée/gagnante “rejected_response”: str # La réponse non préférée/perdante }
Arguments : train_data_path (str) : Chemin du fichier JSON contenant les données d’entraînement val_data_path (str) : Chemin du fichier JSON contenant les données de validation