Passer à la navigation

nemo_rl.environments.vlm_environment

Afficher en Markdown

Contenu du module

Classes

NomDescription
VLMEnvConfigdict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d’un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme suit : d = {} for k, v in iterable: d[k] = v dict(**kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments de mot-clé. Par exemple : dict(one=1, two=2)
VLMVerifyWorkerAucun
VLMEnvironmentMetadatadict() -> nouveau dictionnaire vide dict(mapping) -> nouveau dictionnaire initialisé à partir des paires (clé, valeur) d’un objet de mappage dict(iterable) -> nouveau dictionnaire initialisé comme suit : d = {} for k, v in iterable: d[k] = v dict(**kwargs) -> nouveau dictionnaire initialisé avec les paires nom=valeur dans la liste des arguments de mot-clé. Par exemple : dict(one=1, two=2)
VLMEnvironmentClasse d’aide qui fournit un moyen standard de créer un ABC par héritage.

Fonctions

NomDescription
_mute_outputAucun

API

class nemo_rl.environments.vlm_environment.VLMEnvConfig

Bases : typing.TypedDict

num_workers: int

Valeur : None

stop_strings: typing.Optional[list[str]]

Valeur : None

reward_functions: typing.List[dict[str, typing.Any]]

Valeur : None

nemo_rl.environments.vlm_environment._mute_output()
class nemo_rl.environments.vlm_environment.VLMVerifyWorker(cfg: nemo_rl.environments.vlm_environment.VLMEnvConfig)
pred_responses: list[str], ground_truths: list[str]
) -> list[float]

Vérifie la correction des réponses prédites par rapport à la vérité terrain.

Args : pred_responses : list[str]. Les réponses prédites par le LLM. ground_truths : list[str]. Les réponses de vérité terrain.

Returns : list[float]. Les récompenses pour chaque réponse prédite.

class nemo_rl.environments.vlm_environment.VLMEnvironmentMetadata

Bases : typing.TypedDict

ground_truth: str

Valeur : None

class nemo_rl.environments.vlm_environment.VLMEnvironment(cfg: nemo_rl.environments.vlm_environment.VLMEnvConfig)

Bases : nemo_rl.environments.interfaces.EnvironmentInterface

shutdown() -> None
message_log_batch: list[list[dict[str, str]]],
metadata: list[nemo_rl.environments.vlm_environment.VLMEnvironmentMetadata]
) -> nemo_rl.environments.interfaces.EnvironmentReturn

Exécute une étape dans l’environnement VLM.

Args : message_log : list[list[dict[str, str]]]. Un lot de journaux de messages de type API OpenAI qui représentent des interactions avec le VLM. metadata : list[VLMEnvironmentMetadata]. L’évaluateur utilisera la clé ‘ground_truth’ pour évaluer la correction.

Returns : EnvironmentReturn : Un tuple contenant :

  • list[dict[str, str]] : Lot d’observations/réponses
  • list[dict] : Métadonnées mises à jour
  • list[str] : Chaînes d’arrêt suivantes pour le prochain tour
  • Tensor : Tenseur de récompenses
  • Tensor : Indicateurs de fin
global_post_process_and_metrics(batch: nemo_rl.distributed.batched_data_dict.BatchedDataDict[typing.Any]) -> tuple[nemo_rl.distributed.batched_data_dict.BatchedDataDict[typing.Any], dict[str, float | int]]

Calcule les métriques pour cet environnement à partir d’un lot global de déploiement.

Chaque rang exécutera cette fonction, vous pouvez donc utiliser des calculs distribués si vous le préférez pour des métriques lourdes.