> For clean Markdown of any page, append .md to the page URL. > For a complete documentation index, see https://fr.nvidia-localization.ferndocs.com/fr/nemo/rl/latest/an-in-depth-walkthrough-of-grpo-in-ne-mo-rl/llms.txt. > For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://fr.nvidia-localization.ferndocs.com/_mcp/server. # Un guide approfondi de GRPO dans NeMo RL Ce guide détaille l'implémentation de Group Relative Policy Optimization (GRPO) dans NeMo RL. Nous allons parcourir les aspects essentiels, notamment la gestion des données, l'entraînement du modèle de politique, la génération rapide, et les spécificités de la fonction de perte GRPO et ses améliorations. ## Démarrage rapide : Lancer une exécution GRPO Pour démarrer rapidement, utilisez le script [examples/run\_grpo\_math.py](../../examples/run_grpo_math.py), qui démontre comment entraîner un modèle sur des problèmes mathématiques en utilisant GRPO. Vous pouvez lancer ce script localement ou via Slurm. Pour des instructions détaillées sur la configuration de Ray et le lancement d'un travail avec Slurm, reportez-vous à la [documentation du cluster](/fr/nemo/rl/0-2-1/set-up-clusters). Nous recommandons de lancer le travail en utilisant `uv` : ```bash uv run examples/run_grpo_math.py --config {remplacements} ``` Si non spécifié, `config` par défaut sera [examples/configs/grpo.yaml](../../examples/configs/grpo_math_1B.yaml). **Rappel** : N'oubliez pas de définir HF\_HOME, WANDB\_API\_KEY, et HF\_DATASETS\_CACHE (si nécessaire). Vous devrez également effectuer un `huggingface-cli login` pour les modèles Llama. Dans ce guide, nous allons examiner comment nous gérons : * Les données * L'entraînement du modèle * La génération rapide * Le flux de ressources global * La perte \[Le reste du document reste identique, seul le texte visible est traduit]