> For clean Markdown of any page, append .md to the page URL.
> For a complete documentation index, see https://fr.nvidia-localization.ferndocs.com/fr/llms.txt.
> For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://fr.nvidia-localization.ferndocs.com/fr/_mcp/server.

# nemo\_rl.environments.rewards

## Contenu du module

### Fonctions

| Nom                                                                                           | Description                                                                                                                                                               |
| --------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| [`math_expression_reward`](#nemorlenvironmentsrewardsmathexpressionreward)                    | Récompenser l'agent lorsque la réponse dans les balises \<\{tag}> est la même expression que la vérité terrain.                                                           |
| [`format_reward`](#nemorlenvironmentsrewardsformatreward)                                     | Récompenser l'agent lorsque la réponse suit le format : (.*) \<think> (.*) \</think> \<answer> (.\*) \</answer>.                                                          |
| [`exact_answer_alphanumeric_reward`](#nemorlenvironmentsrewardsexactansweralphanumericreward) | Récompenser l'agent lorsque la réponse dans les balises \<\{answer\_tag}> est identique à la vérité terrain (insensible à la casse).                                      |
| [`bbox_giou_reward`](#nemorlenvironmentsrewardsbboxgioureward)                                | Étant donné les coordonnées de boîte englobante normalisées \[x1, y1, x2, y2] dans les balises \<\{answer\_tag}>, calculer le GIoU entre la vérité terrain et la réponse. |
| [`combine_reward_functions`](#nemorlenvironmentsrewardscombinerewardfunctions)                | Renvoie une fonction appelable qui prend (ground\_truth, response) et collecte plusieurs fonctions de récompense en séquence.                                             |

### Données

`math_verify_func`
`boxed`

### API

```python
nemo_rl.environments.rewards.math_verify_func
```

**Valeur**: `math_metric(...)`

```python
nemo_rl.environments.rewards.boxed
```

**Valeur**: `None`

```python
nemo_rl.environments.rewards.math_expression_reward(
    ground_truth: str,
    response: str,
    tag: str = 'answer'
) -> tuple[float, bool]
```

Récompenser l'agent lorsque la réponse dans les balises \<\{tag}> est la même expression que la vérité terrain.

Le `tag` est personnalisable et doit être spécifié dans le fichier de texte de l'invite COT de l'utilisateur.

```python
nemo_rl.environments.rewards.format_reward(
    ground_truth: str,
    response: str,
    think_tag: str = 'think',
    answer_tag: str = 'answer'
) -> tuple[float, typing.Optional[bool]]
```

Récompenser l'agent lorsque la réponse suit le format : (.*) \<think> (.*) \</think> \<answer> (.\*) \</answer>.

Les `think_tag` et `answer_tag` sont personnalisables et doivent être spécifiés dans le fichier de texte de l'invite COT de l'utilisateur.

```python
nemo_rl.environments.rewards.exact_answer_alphanumeric_reward(
    ground_truth: str,
    response: str,
    answer_tag: str = 'answer'
) -> tuple[float, bool]
```

Récompenser l'agent lorsque la réponse dans les balises \<\{answer\_tag}> est identique à la vérité terrain (insensible à la casse).

Le `answer_tag` est personnalisable et doit être spécifié dans le fichier de texte de l'invite COT de l'utilisateur.

```python
nemo_rl.environments.rewards.bbox_giou_reward(
    ground_truth: str,
    response: str,
    giou_penalty_thres: float = 10.0,
    answer_tag: str = 'answer'
) -> tuple[float, bool]
```

Étant donné les coordonnées de boîte englobante normalisées \[x1, y1, x2, y2] dans les balises \<\{answer\_tag}>, calculer le GIoU entre la vérité terrain et la réponse.

Le `answer_tag` est personnalisable et doit être spécifié dans le fichier de texte de l'invite COT de l'utilisateur.

```python
nemo_rl.environments.rewards.combine_reward_functions(reward_functions: list[tuple[typing.Callable[[str, str], tuple[float, bool]], float]]) -> typing.Callable[[str, str], tuple[float, bool]]
```

Renvoie une fonction appelable qui prend (ground\_truth, response) et collecte plusieurs fonctions de récompense en séquence.

Les fonctions de récompense sont pondérées par le deuxième élément du tuple.
Ces informations peuvent être fournies dans le fichier de configuration YAML et résolues dans la classe VLMEnvironment.

Args:
reward\_functions: list\[tuple\[Callable\[\[str, str], tuple\[float, bool]], float]]. Une liste de fonctions de récompense et leurs poids.

Returns:
Callable\[\[str, str], tuple\[float, bool]]: Une fonction appelable qui prend (ground\_truth, response) et collecte plusieurs fonctions de récompense en séquence