Contenu du Module
Classes
| Nom | Description |
|---|---|
GRPOConfig | dict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d’un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = {} for k, v in iterable: d[k] = v dict(**kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2) |
GRPOSaveState | dict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d’un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = {} for k, v in iterable: d[k] = v dict(**kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2) |
GRPOLoggerConfig | Aucun |
MasterConfig | dict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d’un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = {} for k, v in iterable: d[k] = v dict(**kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2) |
Fonctions
| Nom | Description |
|---|---|
_default_grpo_save_state | Aucun |
setup | Point d’entrée principal pour l’exécution de l’algorithme GRPO. |
_should_use_async_rollouts | Déterminer s’il faut utiliser des rollouts asynchrones en fonction de la configuration. |
refit_policy_generation | Réajuster l’interface de génération de politique avec les derniers poids de politique. |
grpo_train | Exécuter l’algorithme d’entraînement GRPO. |
validate | Exécuter la validation sur le jeu de données de validation. |
Données
TokenizerType
API
(The rest of the document remains unchanged, as per the translation rules)