> For clean Markdown of any page, append .md to the page URL.
> For a complete documentation index, see https://fr.nvidia-localization.ferndocs.com/fr/llms.txt.
> For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://fr.nvidia-localization.ferndocs.com/fr/_mcp/server.

# nemo\_rl.algorithms.grpo

## Contenu du Module

### Classes

| Nom                                                         | Description                                                                                                                                                                                                                                                                                                                                                                                             |
| ----------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| [`GRPOConfig`](#nemorlalgorithmsgrpogrpoconfig)             | dict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d'un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = \{} for k, v in iterable: d\[k] = v dict(\*\*kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2) |
| [`GRPOSaveState`](#nemorlalgorithmsgrpogrposavestate)       | dict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d'un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = \{} for k, v in iterable: d\[k] = v dict(\*\*kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2) |
| [`GRPOLoggerConfig`](#nemorlalgorithmsgrpogrpologgerconfig) | Aucun                                                                                                                                                                                                                                                                                                                                                                                                   |
| [`MasterConfig`](#nemorlalgorithmsgrpomasterconfig)         | dict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d'un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = \{} for k, v in iterable: d\[k] = v dict(\*\*kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2) |

### Fonctions

| Nom                                                                         | Description                                                                             |
| --------------------------------------------------------------------------- | --------------------------------------------------------------------------------------- |
| [`_default_grpo_save_state`](#nemorlalgorithmsgrpodefaultgrposavestate)     | Aucun                                                                                   |
| [`setup`](#nemorlalgorithmsgrposetup)                                       | Point d'entrée principal pour l'exécution de l'algorithme GRPO.                         |
| [`_should_use_async_rollouts`](#nemorlalgorithmsgrposhoulduseasyncrollouts) | Déterminer s'il faut utiliser des rollouts asynchrones en fonction de la configuration. |
| [`refit_policy_generation`](#nemorlalgorithmsgrporefitpolicygeneration)     | Réajuster l'interface de génération de politique avec les derniers poids de politique.  |
| [`grpo_train`](#nemorlalgorithmsgrpogrpotrain)                              | Exécuter l'algorithme d'entraînement GRPO.                                              |
| [`validate`](#nemorlalgorithmsgrpovalidate)                                 | Exécuter la validation sur le jeu de données de validation.                             |

### Données

`TokenizerType`

### API

(The rest of the document remains unchanged, as per the translation rules)