Passer à la navigation

nemo_rl.data.hf_datasets.dpo

Afficher en Markdown

Contenu du Module

Classes

NomDescription
DPODatasetClasse de jeu de données pour l’entraînement d’Optimisation Directe de Préférence (DPO).

Fonctions

NomDescription
to_preference_data_formatAucun

API

nemo_rl.data.hf_datasets.dpo.to_preference_data_format(data: dict[str, typing.Any]) -> dict[str, list[dict[str, typing.Any]]]
class nemo_rl.data.hf_datasets.dpo.DPODataset(train_data_path: str, val_data_path: str)

Classe de jeu de données pour l’entraînement d’Optimisation Directe de Préférence (DPO).

Cette classe est obsolète et sera supprimée dans une version future. Utilisez PreferenceDataset à la place.

Cette classe gère le chargement des données de préférence pour l’entraînement DPO. Les fichiers JSON d’entrée doivent contenir des exemples avec la structure suivante : { “prompt”: str, # L’invite/contexte d’entrée “chosen_response”: str, # La réponse préférée/gagnante “rejected_response”: str # La réponse non préférée/perdante }

Arguments : train_data_path (str) : Chemin du fichier JSON contenant les données d’entraînement val_data_path (str) : Chemin du fichier JSON contenant les données de validation