> For clean Markdown of any page, append .md to the page URL.
> For a complete documentation index, see https://fr.nvidia-localization.ferndocs.com/fr/llms.txt.
> For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://fr.nvidia-localization.ferndocs.com/fr/_mcp/server.

# Conception et Philosophie

Cette section présente les API NeMo RL, les modèles de configuration avec TypedDicts, et aborde les défis de l'Apprentissage par Renforcement (RL) en ligne. La coordination de divers composants logiciels, appelés Acteurs RL, nécessite une allocation efficace des ressources, une isolation, une coordination et une communication. Notre philosophie de conception se concentre sur la création d'abstractions modulaires pour ces tâches, garantissant l'évolutivité d'un GPU à des milliers, quelle que soit l'implémentation de l'Acteur RL.

## Motivation

Le RL en ligne exige la coordination de nombreux composants logiciels et modèles, par exemple :

* Modèle de Politique/Framework d'Entraînement
* Framework d'Inférence Rapide (vLLM, SGLANG, TRT-LLM)
* Environnements de Récompense, Critiques, etc.

Nous appelons chacune de ces parties logicielles un **Acteur RL**.

Fondamentalement, la gestion de ces Acteurs RL requiert quatre capacités essentielles :

* Les doter de ressources (fournir des GPU/CPU).
* Les isoler : Les Acteurs RL nécessitent des environnements de processus isolés avec des dépendances configurables pour éviter les conflits de variables globales ou de dépendances.
* Les coordonner (contrôler).
* Communiquer entre eux (données).

## Conception

Nous créons des abstractions composables et personnalisables pour chaque couche des tâches mentionnées

* Ressources : `RayVirtualCluster`
* Isolation : `RayWorkerGroup`
* Coordination : Un Contrôleur Mono-Processus utilisant Ray
* Communication : Les données transitent via l'un des moyens suivants :
  * le contrôleur unique
  * un schéma de communication mis en place par le contrôleur tel que
    * Collections NCCL
    * Files d'Attente Multi-Processus

En créant une interface commune pour ces quatre tâches, le code de l'algorithme RL peut évoluer sans problème de 1 à 1000 GPU et rester indépendant de l'Acteur RL spécifique (comme Megatron, Hugging Face, ou des composants abstraits comme un étudiant diplômé avec un stylo et du papier).

![actor-wg-worker-vc](/fr/_fern-img/4cb6e3479fe0e9b0d55bfcd5e9f2b4c2115fd3ef1f0a96964d93b4550f6c0036.webp)

(Reste du document traduit de la même manière, en respectant strictement les règles de traduction données)