Un guide approfondi de GRPO dans NeMo RL
Ce guide détaille l’implémentation de Group Relative Policy Optimization (GRPO) dans NeMo RL. Nous allons parcourir les aspects essentiels, notamment la gestion des données, l’entraînement du modèle de politique, la génération rapide, et les spécificités de la fonction de perte GRPO et ses améliorations.
Démarrage rapide : Lancer une exécution GRPO
Pour démarrer rapidement, utilisez le script examples/run_grpo_math.py, qui démontre comment entraîner un modèle sur des problèmes mathématiques en utilisant GRPO. Vous pouvez lancer ce script localement ou via Slurm. Pour des instructions détaillées sur la configuration de Ray et le lancement d’un travail avec Slurm, reportez-vous à la documentation du cluster.
Nous recommandons de lancer le travail en utilisant uv :
Si non spécifié, config par défaut sera examples/configs/grpo.yaml.
Rappel : N’oubliez pas de définir HF_HOME, WANDB_API_KEY, et HF_DATASETS_CACHE (si nécessaire). Vous devrez également effectuer un huggingface-cli login pour les modèles Llama.
Dans ce guide, nous allons examiner comment nous gérons :
- Les données
- L’entraînement du modèle
- La génération rapide
- Le flux de ressources global
- La perte
[Le reste du document reste identique, seul le texte visible est traduit]