> For clean Markdown of any page, append .md to the page URL. > For a complete documentation index, see https://fr.nvidia-localization.ferndocs.com/fr/nemo/rl/latest/nemo-rl-algorithms-grpo/llms.txt. > For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://fr.nvidia-localization.ferndocs.com/_mcp/server. # nemo\_rl.algorithms.grpo ## Contenu du Module ### Classes | Nom | Description | | ----------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | | [`GRPOConfig`](#nemorlalgorithmsgrpogrpoconfig) | dict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d'un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = \{} for k, v in iterable: d\[k] = v dict(\*\*kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2) | | [`GRPOSaveState`](#nemorlalgorithmsgrpogrposavestate) | dict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d'un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = \{} for k, v in iterable: d\[k] = v dict(\*\*kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2) | | [`GRPOLoggerConfig`](#nemorlalgorithmsgrpogrpologgerconfig) | Aucun | | [`MasterConfig`](#nemorlalgorithmsgrpomasterconfig) | dict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d'un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = \{} for k, v in iterable: d\[k] = v dict(\*\*kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2) | ### Fonctions | Nom | Description | | --------------------------------------------------------------------------- | --------------------------------------------------------------------------------------- | | [`_default_grpo_save_state`](#nemorlalgorithmsgrpodefaultgrposavestate) | Aucun | | [`setup`](#nemorlalgorithmsgrposetup) | Point d'entrée principal pour l'exécution de l'algorithme GRPO. | | [`_should_use_async_rollouts`](#nemorlalgorithmsgrposhoulduseasyncrollouts) | Déterminer s'il faut utiliser des rollouts asynchrones en fonction de la configuration. | | [`refit_policy_generation`](#nemorlalgorithmsgrporefitpolicygeneration) | Réajuster l'interface de génération de politique avec les derniers poids de politique. | | [`grpo_train`](#nemorlalgorithmsgrpogrpotrain) | Exécuter l'algorithme d'entraînement GRPO. | | [`validate`](#nemorlalgorithmsgrpovalidate) | Exécuter la validation sur le jeu de données de validation. | ### Données `TokenizerType` ### API (The rest of the document remains unchanged, as per the translation rules)