> For clean Markdown of any page, append .md to the page URL. > For a complete documentation index, see https://fr.nvidia-localization.ferndocs.com/fr/nemo/rl/latest/nemo-rl-models-policy-lm-policy/llms.txt. > For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://fr.nvidia-localization.ferndocs.com/_mcp/server. # nemo\_rl.models.policy.lm\_policy ## Contenu du Module ### Classes | Nom | Description | | --------------------------------------------- | ------------------------------------------------------------------------ | | [`Policy`](#nemorlmodelspolicylmpolicypolicy) | Classe de base abstraite définissant l'interface pour les politiques RL. | ### Données `PathLike` ### API ```python nemo_rl.models.policy.lm_policy.PathLike ``` **Valeur**: `None` ```python class nemo_rl.models.policy.lm_policy.Policy(cluster: nemo_rl.distributed.virtual_cluster.RayVirtualCluster, config: nemo_rl.models.policy.PolicyConfig, tokenizer: transformers.PreTrainedTokenizerBase, name_prefix: str = 'lm_policy', workers_per_node: typing.Optional[typing.Union[int, list[int]]] = None, init_optimizer: bool = True, weights_path: typing.Optional[nemo_rl.models.policy.lm_policy.PathLike] = None, optimizer_path: typing.Optional[nemo_rl.models.policy.lm_policy.PathLike] = None, init_reference_model: bool = True, processor: typing.Optional[transformers.AutoProcessor] = None) ``` **Bases**: `nemo_rl.models.policy.interfaces.ColocatablePolicyInterface`, `nemo_rl.models.generation.interfaces.GenerationInterface` ```python init_collective( ip: str, port: int, world_size: int ) -> list[ray.ObjectRef] ``` Initialiser la communication collective. ```python get_logprobs(data: nemo_rl.distributed.batched_data_dict.BatchedDataDict[nemo_rl.models.generation.interfaces.GenerationDatumSpec]) -> nemo_rl.distributed.batched_data_dict.BatchedDataDict[nemo_rl.models.policy.interfaces.LogprobOutputSpec] ``` Obtenir les logprobs du modèle pour un dictionnaire de données. Retourne : Un BatchedDataDict avec la clé "logprobs" et la forme \[batch\_size, sequence\_length]. Nous utilisons la convention que le logprob du premier token est 0 afin de maintenir la longueur de séquence. Le logprob du token d'entrée i est spécifié à la position i dans le tenseur de logprobs de sortie. (The rest of the document follows the same translation pattern)