Passer à la navigation

Nemo RL : Une bibliothèque de post-entraînement évolutive et efficace

Afficher en Markdown

Nemo RL est une bibliothèque de post-entraînement évolutive et efficace conçue pour des modèles allant de 1 GPU à des milliers, et de petits à plus de 100 milliards de paramètres.

Ce que vous pouvez attendre :

  • Intégration transparente avec Hugging Face pour facilité d’utilisation, permettant aux utilisateurs de tirer parti d’un large éventail de modèles pré-entraînés et d’outils.
  • Implémentation haute performance avec Megatron Core, prenant en charge diverses techniques de parallélisme pour les grands modèles (>100B) et les grandes longueurs de contexte.
  • Gestion efficace des ressources avec Ray, permettant un déploiement évolutif et flexible sur différentes configurations matérielles.
  • Flexibilité avec une conception modulaire qui permet une intégration et une personnalisation faciles.
  • Documentation complète à la fois détaillée et conviviale, avec des exemples pratiques.

Fonctionnalités

✅ Disponible maintenant | 🔜 À venir dans la v0.4

  • ✅ Génération rapide - Backend vLLM pour une inférence optimisée.

  • ✅ Intégration HuggingFace - Fonctionne avec des modèles de 1-70B (Qwen, Llama).

  • ✅ Entraînement distribué - Support FSDP2 (Fully Sharded Data Parallel) et infrastructure Ray.

  • ✅ Support d’environnement - Support pour l’entraînement multi-environnement.

  • ✅ Algorithmes d’apprentissage - GRPO (Group Relative Policy Optimization), SFT (Supervised Fine-Tuning), et DPO (Direct Preference Optimization).

  • ✅ RL Multi-Tours - Génération et entraînement multi-tours pour RL avec utilisation d’outils, jeux, etc.

  • ✅ Support de grands modèles - Support natif PyTorch pour des modèles jusqu’à 70B de paramètres.

  • ✅ Parallélisme avancé - FSDP2, TP, CP, et SP natifs PyTorch pour un entraînement efficace.

  • ✅ Support de modèles (encore) plus grands avec des séquences plus longues - Parallélismes avancés avec Megatron Core (TP/PP/CP/SP/EP).

  • ✅ Isolation des workers - Isolation de processus entre les acteurs RL (pas de problèmes d’état global).

  • ✅ Isolation d’environnement - Isolation des dépendances entre les composants.

  • ✅ Inférence Megatron - Inférence Megatron (statique) pour le support immédiat de nouveaux modèles megatron.

  • ✅ Modèles MoE - Support des modèles MoE DeepseekV3 et Qwen-3

  • ✅ Empaquetage de séquences - Empaquetage de séquences dans DTensor et MCore pour d’énormes gains de performance d’entraînement

  • 🔜 Performances natives améliorées - Améliorer le temps d’entraînement pour les modèles PyTorch natifs.

  • 🔜 Inférence Megatron - Inférence Megatron (dynamique) pour un support immédiat de nouveaux modèles megatron.

[The rest of the document remains the same, only the title and description were translated]