nemo_rl.models.generation.vllm.vllm_worker
nemo_rl.models.generation.vllm.vllm_worker
Module Contents
Classes
API
Personnalise le préfixe de l’acteur dans les journaux de Ray.
Cela facilite l’identification du worker qui produit des messages de journal spécifiques.
Fournit la configuration complète du worker pour le parallélisme tensoriel et par pipeline de vLLM.
Cette méthode configure le worker en fonction de son rôle dans le parallélisme tensoriel et par pipeline, qui est déterminé directement à partir du paramètre bundle_indices.
Args: num_gpus : Allocation GPU originale pour ce worker basée sur le groupe de placement bundle_indices : Tuple de (node_idx, local_bundle_indices) pour le parallélisme (le cas échéant)
Returns: tuple avec la configuration complète du worker :
- ‘resources’ : Allocation de ressources (par exemple, num_gpus)
- ‘env_vars’ : Variables d’environnement pour ce worker
- ‘init_kwargs’ : Paramètres à passer à init du worker
Vérifier si le worker est actif.
Démarrer le profilage GPU.
Arrêter le profilage GPU.
Bases : nemo_rl.models.generation.vllm.vllm_worker.BaseVllmGenerationWorker
Générer un lot de données à l’aide de la génération vLLM.
Args: data: BatchedDataDict contenant les tenseurs input_ids et input_lengths greedy: Indique s’il faut utiliser le décodage gourmand au lieu de l’échantillonnage
Returns: BatchedDataDict conforme à GenerationOutputSpec :
- output_ids : ID de tokens d’entrée + générés avec un remplissage approprié
- logprobs : Logarithmes des probabilités des tokens
- generation_lengths : Longueurs de chaque réponse
- unpadded_sequence_lengths : Longueurs de chaque séquence d’entrée + générée
Générer des réponses textuelles à l’aide de la génération vLLM.
Args: data: BatchedDataDict contenant des invites avec des chaînes de texte greedy: Indique s’il faut utiliser le décodage gourmand au lieu de l’échantillonnage
Returns: BatchedDataDict contenant :
- texts : Liste de réponses textuelles générées