nemo_rl.models.generation.vllm.vllm_worker_async
nemo_rl.models.generation.vllm.vllm_worker_async
Contenu du module
Classes
API
Bases : nemo_rl.models.generation.vllm.vllm_worker.BaseVllmGenerationWorker
Générer un lot de données à l’aide du moteur AsyncLLM de vLLM, en renvoyant les résultats dès qu’ils sont prêts.
Args : data : BatchedDataDict avec input_ids et input_lengths greedy : Indique s’il faut utiliser le décodage glouton au lieu de l’échantillonnage
Renvoie : Tuple de (indice_original, BatchedDataDict conforme à GenerationOutputSpec pour la séquence unique)
Générer de façon asynchrone des réponses textuelles, en renvoyant les résultats dès qu’ils sont prêts.
Args : data : BatchedDataDict contenant des invites avec des chaînes de texte greedy : Indique s’il faut utiliser le décodage glouton au lieu de l’échantillonnage
Renvoie : Tuple de (indice_original, BatchedDataDict contenant une seule réponse textuelle)
Version asynchrone de report_device_id.
Version asynchrone de prepare_refit_info.
Version asynchrone de update_weights_from_ipc_handles.
Args : ipc_handles (dict) : Dictionnaire mappant les UUID de périphériques (str) aux handles IPC de paramètres.
Renvoie : bool : True si les poids ont été mis à jour avec succès, False sinon.
Version asynchrone de update_weights_from_collective.
Version asynchrone de reset_prefix_cache.
Version asynchrone de sleep.
Version asynchrone de wake_up.
Nettoyer les ressources vLLM.