Passer à la navigation

nemo_rl.algorithms.grpo

Afficher en Markdown

Contenu du Module

Classes

NomDescription
GRPOConfigdict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d’un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = {} for k, v in iterable: d[k] = v dict(**kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2)
GRPOSaveStatedict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d’un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = {} for k, v in iterable: d[k] = v dict(**kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2)
GRPOLoggerConfigAucun
MasterConfigdict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d’un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme : d = {} for k, v in iterable: d[k] = v dict(**kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments par mot-clé. Par exemple : dict(one=1, two=2)

Fonctions

NomDescription
_default_grpo_save_stateAucun
setupPoint d’entrée principal pour l’exécution de l’algorithme GRPO.
_should_use_async_rolloutsDéterminer s’il faut utiliser des rollouts asynchrones en fonction de la configuration.
refit_policy_generationRéajuster l’interface de génération de politique avec les derniers poids de politique.
grpo_trainExécuter l’algorithme d’entraînement GRPO.
validateExécuter la validation sur le jeu de données de validation.

Données

TokenizerType

API

(The rest of the document remains unchanged, as per the translation rules)