
#
Ai2 a publié un compte rendu expliquant comment elle a modifié la planification de ses clusters GPU pour la recherche en IA. L'équipe indique gérer des milliers de GPU NVIDIA H100, B200 et B300. Ces GPU sont répartis dans des clusters allant de 88 à 1 024 unités. Le système sert environ 150 chercheurs internes.
La source indique que la demande dépasse souvent l'offre d'un facteur de deux à trois. Cette pression a créé plusieurs problèmes. Ai2 décrit une inflation des priorités, une capacité réservée inutilisée et des négociations manuelles avant la maintenance. L'équipe affirme que l'ancienne approche ne gérait pas bien ces problèmes.
Ai2 a remplacé un planificateur basé sur les priorités par un autre modèle. La nouvelle conception utilise des budgets de temps GPU, une allocation équitable hiérarchique et un contrat de time-slicing. Les responsables attribuent à chaque programme de recherche une part du temps GPU. Le planificateur suit ensuite l'utilisation sur une fenêtre de rétrospective de sept jours.
Le système privilégie les allocations les moins utilisées. Les tâches non allouées peuvent occuper la capacité inactive. Elles peuvent aussi être préemptées. Les charges de travail doivent déclarer un temps d'exécution minimal afin de progresser avant que le planificateur ne fasse tourner les ressources.
Il s'agit d'un choix de conception pratique. Il vise à équilibrer l'équité, l'utilisation et la progression vers l'avant. Il réduit aussi le besoin de négociations manuelles lorsque la demande est forte.
Ai2 a d'abord testé la politique dans un simulateur. Le simulateur utilisait des soumissions historiques et construisait des scénarios. Cette étape a fourni à l'équipe des éléments de conception. Elle les a aidés à comparer le comportement de la politique avant de modifier les clusters en production.
L'équipe a ensuite commencé un déploiement progressif cluster par cluster à la fin du mois de juillet. Ai2 considère ces mesures ultérieures comme des preuves opérationnelles. Cette distinction est importante, car la simulation et l'exploitation réelle répondent à des questions différentes. La simulation montre comment une politique peut se comporter. Les données de déploiement montrent comment elle fonctionne en pratique.
Ai2 indique qu'au cours d'une période de test de 30 jours, le système a délivré 98 % des heures GPU dues. Elle affirme également que l'occupation est restée à 98 %. L'article rapporte des réductions substantielles des temps d'attente des tâches de débogage. Il fait aussi état de moins de réparations nécessitant une intervention humaine.
Ces chiffres correspondent aux mesures internes d'Ai2 sur ses clusters. Ils ne constituent pas une promesse générale pour d'autres opérateurs. La source mentionne aussi une courbe d'apprentissage. Elle indique qu'il reste du travail sur les sessions de développement restaurables.
La source suggère quelques compromis opérationnels. Un système d'allocation équitable peut améliorer l'accès, mais il nécessite aussi une comptabilité claire. La fenêtre de rétrospective de sept jours fait partie de cette comptabilité. Les déclarations de temps d'exécution minimal constituent un autre contrôle. Elles aident les tâches à progresser avant la préemption ou la rotation.
Le déploiement montre aussi que les changements de politique de planification ne sont pas seulement techniques. Ils influencent la manière dont les équipes demandent des ressources et dont les responsables les attribuent. Le compte rendu d'Ai2 suggère que la conception de la politique, la simulation et le déploiement réel comptent tous. Chaque étape soutient une partie différente de la décision.
La source ne rapporte aucun fait spécifique au Maroc, aucun déploiement ni aucun effet local mesuré. Pour les lecteurs, la leçon globale est conditionnelle : si une équipe exploite des clusters GPU très sollicités, la politique de planification peut influencer l'équité et l'utilisation.
L'article d'Ai2 se concentre sur les opérations internes des clusters, et non sur une affirmation de marché plus large. Son message principal est que les règles de planification peuvent modifier la manière dont le temps GPU rare est partagé. Les gains rapportés proviennent d'un déploiement progressif, cluster par cluster, sur l’infrastructure propre à Ai2. Tout autre opérateur devrait procéder à ses propres tests et mesures avant de tirer des conclusions.
Ajoutez Intelligence Artificielle Maroc à vos sources préférées pour retrouver davantage de nos actualités pertinentes dans la recherche Google.
Nous construisons des plateformes IA sur mesure, des produits SaaS, des applications métier intelligentes et des systèmes d’automatisation.
Ce formulaire est réservé aux demandes de projets, et non aux questions générales sur l’intelligence artificielle.