> For clean Markdown of any page, append .md to the page URL. > For a complete documentation index, see https://fr.nvidia-localization.ferndocs.com/fr/nemo/rl/latest/llms.txt. > For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://fr.nvidia-localization.ferndocs.com/_mcp/server. # Nemo RL : Une bibliothèque de post-entraînement évolutive et efficace **Nemo RL** est une bibliothèque de post-entraînement évolutive et efficace conçue pour des modèles allant de 1 GPU à des milliers, et de petits à plus de 100 milliards de paramètres. Ce que vous pouvez attendre : * **Intégration transparente avec Hugging Face** pour facilité d'utilisation, permettant aux utilisateurs de tirer parti d'un large éventail de modèles pré-entraînés et d'outils. * **Implémentation haute performance avec Megatron Core**, prenant en charge diverses techniques de parallélisme pour les grands modèles (>100B) et les grandes longueurs de contexte. * **Gestion efficace des ressources avec Ray**, permettant un déploiement évolutif et flexible sur différentes configurations matérielles. * **Flexibilité** avec une conception modulaire qui permet une intégration et une personnalisation faciles. * **Documentation complète** à la fois détaillée et conviviale, avec des exemples pratiques. ## Fonctionnalités ✅ *Disponible maintenant* | 🔜 *À venir dans la v0.4* * ✅ **Génération rapide** - Backend vLLM pour une inférence optimisée. * ✅ **Intégration HuggingFace** - Fonctionne avec des modèles de 1-70B (Qwen, Llama). * ✅ **Entraînement distribué** - Support FSDP2 (Fully Sharded Data Parallel) et infrastructure Ray. * ✅ **Support d'environnement** - Support pour l'entraînement multi-environnement. * ✅ **Algorithmes d'apprentissage** - GRPO (Group Relative Policy Optimization), SFT (Supervised Fine-Tuning), et DPO (Direct Preference Optimization). * ✅ **RL Multi-Tours** - Génération et entraînement multi-tours pour RL avec utilisation d'outils, jeux, etc. * ✅ **Support de grands modèles** - Support natif PyTorch pour des modèles jusqu'à 70B de paramètres. * ✅ **Parallélisme avancé** - FSDP2, TP, CP, et SP natifs PyTorch pour un entraînement efficace. * ✅ **Support de modèles (encore) plus grands avec des séquences plus longues** - Parallélismes avancés avec Megatron Core (TP/PP/CP/SP/EP). * ✅ **Isolation des workers** - Isolation de processus entre les acteurs RL (pas de problèmes d'état global). * ✅ **Isolation d'environnement** - Isolation des dépendances entre les composants. * ✅ **Inférence Megatron** - Inférence Megatron (statique) pour le support immédiat de nouveaux modèles megatron. * ✅ **Modèles MoE** - Support des modèles MoE DeepseekV3 et Qwen-3 * ✅ **Empaquetage de séquences** - Empaquetage de séquences dans DTensor et MCore pour d'énormes gains de performance d'entraînement * 🔜 **Performances natives améliorées** - Améliorer le temps d'entraînement pour les modèles PyTorch natifs. * 🔜 **Inférence Megatron** - Inférence Megatron (dynamique) pour un support immédiat de nouveaux modèles megatron. \[The rest of the document remains the same, only the title and description were translated]