Nemo RL : Une bibliothèque de post-entraînement évolutive et efficace
Nemo RL est une bibliothèque de post-entraînement évolutive et efficace conçue pour des modèles allant de 1 GPU à des milliers, et de petits à plus de 100 milliards de paramètres.
Ce que vous pouvez attendre :
- Intégration transparente avec Hugging Face pour facilité d’utilisation, permettant aux utilisateurs de tirer parti d’un large éventail de modèles pré-entraînés et d’outils.
- Implémentation haute performance avec Megatron Core, prenant en charge diverses techniques de parallélisme pour les grands modèles (>100B) et les grandes longueurs de contexte.
- Gestion efficace des ressources avec Ray, permettant un déploiement évolutif et flexible sur différentes configurations matérielles.
- Flexibilité avec une conception modulaire qui permet une intégration et une personnalisation faciles.
- Documentation complète à la fois détaillée et conviviale, avec des exemples pratiques.
Fonctionnalités
✅ Disponible maintenant | 🔜 À venir dans la v0.4
-
✅ Génération rapide - Backend vLLM pour une inférence optimisée.
-
✅ Intégration HuggingFace - Fonctionne avec des modèles de 1-70B (Qwen, Llama).
-
✅ Entraînement distribué - Support FSDP2 (Fully Sharded Data Parallel) et infrastructure Ray.
-
✅ Support d’environnement - Support pour l’entraînement multi-environnement.
-
✅ Algorithmes d’apprentissage - GRPO (Group Relative Policy Optimization), SFT (Supervised Fine-Tuning), et DPO (Direct Preference Optimization).
-
✅ RL Multi-Tours - Génération et entraînement multi-tours pour RL avec utilisation d’outils, jeux, etc.
-
✅ Support de grands modèles - Support natif PyTorch pour des modèles jusqu’à 70B de paramètres.
-
✅ Parallélisme avancé - FSDP2, TP, CP, et SP natifs PyTorch pour un entraînement efficace.
-
✅ Support de modèles (encore) plus grands avec des séquences plus longues - Parallélismes avancés avec Megatron Core (TP/PP/CP/SP/EP).
-
✅ Isolation des workers - Isolation de processus entre les acteurs RL (pas de problèmes d’état global).
-
✅ Isolation d’environnement - Isolation des dépendances entre les composants.
-
✅ Inférence Megatron - Inférence Megatron (statique) pour le support immédiat de nouveaux modèles megatron.
-
✅ Modèles MoE - Support des modèles MoE DeepseekV3 et Qwen-3
-
✅ Empaquetage de séquences - Empaquetage de séquences dans DTensor et MCore pour d’énormes gains de performance d’entraînement
-
🔜 Performances natives améliorées - Améliorer le temps d’entraînement pour les modèles PyTorch natifs.
-
🔜 Inférence Megatron - Inférence Megatron (dynamique) pour un support immédiat de nouveaux modèles megatron.
[The rest of the document remains the same, only the title and description were translated]