Passer à la navigation

nemo_rl.environments.rewards

Afficher en Markdown

Contenu du module

Fonctions

NomDescription
math_expression_rewardRécompenser l’agent lorsque la réponse dans les balises <{tag}> est la même expression que la vérité terrain.
format_rewardRécompenser l’agent lorsque la réponse suit le format : (.) <think> (.) </think> <answer> (.*) </answer>.
exact_answer_alphanumeric_rewardRécompenser l’agent lorsque la réponse dans les balises <{answer_tag}> est identique à la vérité terrain (insensible à la casse).
bbox_giou_rewardÉtant donné les coordonnées de boîte englobante normalisées [x1, y1, x2, y2] dans les balises <{answer_tag}>, calculer le GIoU entre la vérité terrain et la réponse.
combine_reward_functionsRenvoie une fonction appelable qui prend (ground_truth, response) et collecte plusieurs fonctions de récompense en séquence.

Données

math_verify_func boxed

API

nemo_rl.environments.rewards.math_verify_func

Valeur: math_metric(...)

nemo_rl.environments.rewards.boxed

Valeur: None

nemo_rl.environments.rewards.math_expression_reward(
ground_truth: str,
response: str,
tag: str = 'answer'
) -> tuple[float, bool]

Récompenser l’agent lorsque la réponse dans les balises <{tag}> est la même expression que la vérité terrain.

Le tag est personnalisable et doit être spécifié dans le fichier de texte de l’invite COT de l’utilisateur.

nemo_rl.environments.rewards.format_reward(
ground_truth: str,
response: str,
think_tag: str = 'think',
answer_tag: str = 'answer'
) -> tuple[float, typing.Optional[bool]]

Récompenser l’agent lorsque la réponse suit le format : (.) <think> (.) </think> <answer> (.*) </answer>.

Les think_tag et answer_tag sont personnalisables et doivent être spécifiés dans le fichier de texte de l’invite COT de l’utilisateur.

nemo_rl.environments.rewards.exact_answer_alphanumeric_reward(
ground_truth: str,
response: str,
answer_tag: str = 'answer'
) -> tuple[float, bool]

Récompenser l’agent lorsque la réponse dans les balises <{answer_tag}> est identique à la vérité terrain (insensible à la casse).

Le answer_tag est personnalisable et doit être spécifié dans le fichier de texte de l’invite COT de l’utilisateur.

nemo_rl.environments.rewards.bbox_giou_reward(
ground_truth: str,
response: str,
giou_penalty_thres: float = 10.0,
answer_tag: str = 'answer'
) -> tuple[float, bool]

Étant donné les coordonnées de boîte englobante normalisées [x1, y1, x2, y2] dans les balises <{answer_tag}>, calculer le GIoU entre la vérité terrain et la réponse.

Le answer_tag est personnalisable et doit être spécifié dans le fichier de texte de l’invite COT de l’utilisateur.

nemo_rl.environments.rewards.combine_reward_functions(reward_functions: list[tuple[typing.Callable[[str, str], tuple[float, bool]], float]]) -> typing.Callable[[str, str], tuple[float, bool]]

Renvoie une fonction appelable qui prend (ground_truth, response) et collecte plusieurs fonctions de récompense en séquence.

Les fonctions de récompense sont pondérées par le deuxième élément du tuple. Ces informations peuvent être fournies dans le fichier de configuration YAML et résolues dans la classe VLMEnvironment.

Args: reward_functions: list[tuple[Callable[[str, str], tuple[float, bool]], float]]. Une liste de fonctions de récompense et leurs poids.

Returns: Callable[[str, str], tuple[float, bool]]: Une fonction appelable qui prend (ground_truth, response) et collecte plusieurs fonctions de récompense en séquence