nemo_rl.environments.rewards
nemo_rl.environments.rewards
Contenu du module
Fonctions
Données
math_verify_func
boxed
API
Valeur: math_metric(...)
Valeur: None
Récompenser l’agent lorsque la réponse dans les balises <{tag}> est la même expression que la vérité terrain.
Le tag est personnalisable et doit être spécifié dans le fichier de texte de l’invite COT de l’utilisateur.
Récompenser l’agent lorsque la réponse suit le format : (.) <think> (.) </think> <answer> (.*) </answer>.
Les think_tag et answer_tag sont personnalisables et doivent être spécifiés dans le fichier de texte de l’invite COT de l’utilisateur.
Récompenser l’agent lorsque la réponse dans les balises <{answer_tag}> est identique à la vérité terrain (insensible à la casse).
Le answer_tag est personnalisable et doit être spécifié dans le fichier de texte de l’invite COT de l’utilisateur.
Étant donné les coordonnées de boîte englobante normalisées [x1, y1, x2, y2] dans les balises <{answer_tag}>, calculer le GIoU entre la vérité terrain et la réponse.
Le answer_tag est personnalisable et doit être spécifié dans le fichier de texte de l’invite COT de l’utilisateur.
Renvoie une fonction appelable qui prend (ground_truth, response) et collecte plusieurs fonctions de récompense en séquence.
Les fonctions de récompense sont pondérées par le deuxième élément du tuple. Ces informations peuvent être fournies dans le fichier de configuration YAML et résolues dans la classe VLMEnvironment.
Args: reward_functions: list[tuple[Callable[[str, str], tuple[float, bool]], float]]. Une liste de fonctions de récompense et leurs poids.
Returns: Callable[[str, str], tuple[float, bool]]: Une fonction appelable qui prend (ground_truth, response) et collecte plusieurs fonctions de récompense en séquence