nemo_rl.environments.vlm_environment
nemo_rl.environments.vlm_environment
Contenu du module
Classes
Fonctions
API
Bases : typing.TypedDict
Valeur : None
Valeur : None
Valeur : None
Vérifie la correction des réponses prédites par rapport à la vérité terrain.
Args : pred_responses : list[str]. Les réponses prédites par le LLM. ground_truths : list[str]. Les réponses de vérité terrain.
Returns : list[float]. Les récompenses pour chaque réponse prédite.
Bases : typing.TypedDict
Valeur : None
Bases : nemo_rl.environments.interfaces.EnvironmentInterface
Exécute une étape dans l’environnement VLM.
Args : message_log : list[list[dict[str, str]]]. Un lot de journaux de messages de type API OpenAI qui représentent des interactions avec le VLM. metadata : list[VLMEnvironmentMetadata]. L’évaluateur utilisera la clé ‘ground_truth’ pour évaluer la correction.
Returns : EnvironmentReturn : Un tuple contenant :
- list[dict[str, str]] : Lot d’observations/réponses
- list[dict] : Métadonnées mises à jour
- list[str] : Chaînes d’arrêt suivantes pour le prochain tour
- Tensor : Tenseur de récompenses
- Tensor : Indicateurs de fin
Calcule les métriques pour cet environnement à partir d’un lot global de déploiement.
Chaque rang exécutera cette fonction, vous pouvez donc utiliser des calculs distribués si vous le préférez pour des métriques lourdes.