nemo_rl.environments.math_environment
nemo_rl.environments.math_environment
Contenu du Module
Classes
Fonctions
API
Bases: typing.TypedDict
Valeur: None
Valeur: None
Valeur: None
Vérifier l’exactitude des réponses prédites par rapport à la vérité terrain.
Args : pred_responses : list[str]. Les réponses prédites par le LLM. ground_truths : list[str]. Les réponses de vérité terrain.
Returns : Union[list[float], tuple[list[float], list[str | None]]]. Si return_extracted_answer est False, renvoie uniquement les scores. Si return_extracted_answer est True, renvoie (scores, extracted_answers).
Vérifier l’exactitude des réponses prédites par rapport à la vérité terrain.
Args : pred_responses : list[str]. Les réponses prédites par le LLM. ground_truths : list[str]. Les réponses de vérité terrain.
Returns : Union[list[float], tuple[list[float], list[str | None]]]. Si return_extracted_answer est False, renvoie uniquement les scores. Si return_extracted_answer est True, renvoie (scores, extracted_answers).
Vérifier l’exactitude des réponses prédites par rapport à la vérité terrain.
Args : pred_responses : list[str]. Les réponses prédites par le LLM. ground_truths : list[str]. Les réponses de vérité terrain.
Returns : Union[list[float], tuple[list[float], list[str | None]]]. Si return_extracted_answer est False, renvoie uniquement les scores. Si return_extracted_answer est True, renvoie (scores, extracted_answers).
Bases: typing.TypedDict
Valeur: None
Valeur: None
Bases: nemo_rl.environments.interfaces.EnvironmentInterface[nemo_rl.environments.math_environment.MathEnvironmentMetadata]
Exécute une étape dans l’environnement mathématique.
Args : message_log : list[list[dict[str, str]]]. Un lot de journaux de messages de type API OpenAI représentant des interactions avec le LLM. metadata : list[MathEnvironmentMetadata]. Le classificateur utilisera la clé ‘ground_truth’ pour évaluer la précision. La réponse extraite sera stockée pour calculer cons@k.
Returns : EnvironmentReturn : Un tuple contenant :
- list[dict[str, str]] : Lot d’observations/réponses
- list[dict] : Métadonnées mises à jour
- list[str] : Prochaines chaînes d’arrêt pour le prochain tour
- Tensor : Tenseur de récompenses
- Tensor : Tenseur de drapeaux de fin
Calcule les métriques de cet environnement à partir d’un lot global de rollout.
Chaque rang exécutera cette fonction, vous pouvez donc utiliser des calculs distribués si vous préférez pour les métriques lourdes.