> For clean Markdown of any page, append .md to the page URL. > For a complete documentation index, see https://fr.nvidia-localization.ferndocs.com/fr/nemo/rl/latest/nemo-rl-data-hf-datasets-dpo/llms.txt. > For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://fr.nvidia-localization.ferndocs.com/_mcp/server. # nemo\_rl.data.hf\_datasets.dpo ## Contenu du Module ### Classes | Nom | Description | | -------------------------------------------------- | ---------------------------------------------------------------------------------------- | | [`DPODataset`](#nemorldatahfdatasetsdpodpodataset) | Classe de jeu de données pour l'entraînement d'Optimisation Directe de Préférence (DPO). | ### Fonctions | Nom | Description | | ----------------------------------------------------------------------------- | ----------- | | [`to_preference_data_format`](#nemorldatahfdatasetsdpotopreferencedataformat) | Aucun | ### API ```python nemo_rl.data.hf_datasets.dpo.to_preference_data_format(data: dict[str, typing.Any]) -> dict[str, list[dict[str, typing.Any]]] ``` ```python class nemo_rl.data.hf_datasets.dpo.DPODataset(train_data_path: str, val_data_path: str) ``` Classe de jeu de données pour l'entraînement d'Optimisation Directe de Préférence (DPO). Cette classe est obsolète et sera supprimée dans une version future. Utilisez PreferenceDataset à la place. Cette classe gère le chargement des données de préférence pour l'entraînement DPO. Les fichiers JSON d'entrée doivent contenir des exemples avec la structure suivante : \{ "prompt": str, # L'invite/contexte d'entrée "chosen\_response": str, # La réponse préférée/gagnante "rejected\_response": str # La réponse non préférée/perdante } Arguments : train\_data\_path (str) : Chemin du fichier JSON contenant les données d'entraînement val\_data\_path (str) : Chemin du fichier JSON contenant les données de validation