News

MIT et Sakana AI : SIFT réduit les coûts d'évaluation des agents de codage

SIFT, développé par MIT et Sakana AI, ajoute un juge à faible coût avant les benchmarks complets, afin d'aider à prioriser les changements d'agents de codage sans remplacer les tests approfondis.
Oct 4, 2026·3 min read
MIT et Sakana AI : SIFT réduit les coûts d'évaluation des agents de codage

#

Points clés

  • SIFT est un cadre de recherche de MIT et Sakana AI.
  • Il ajoute une étape de jugement moins coûteuse avant les tests de benchmark à grande échelle.
  • Le système utilise toujours des tests de benchmark après le classement des candidats.
  • Les résultats rapportés proviennent de configurations expérimentales spécifiques.
  • L'article ne revendique aucun déploiement ni aucune utilisation spécifique au Maroc.

Ce que SIFT cherche à résoudre

VentureBeat a rapporté le 2 octobre 2026 que MIT et Sakana AI avaient présenté SIFT. Le cadre vise un problème pratique dans l'amélioration des agents de codage : l'évaluation peut être coûteuse. Un correctif proposé peut sembler prometteur, mais les équipes doivent tout de même vérifier s'il améliore réellement les performances.

La source décrit une boucle dans laquelle un agent propose un correctif, une version révisée exécute des tâches de codage, et les résultats orientent les changements ultérieurs. SIFT ajoute une étape de jugement plus précoce avant les tests de benchmark à grande échelle. Cette étape est censée réduire le travail d'évaluation inutile.

Comment le cadre fonctionne

Après une modification, le nouvel agent est d'abord exécuté sur quatre tâches de codage. Cela vise à détecter rapidement les défaillances évidentes. La source présente cela comme un filtre rapide, et non comme un verdict final.

Ensuite, un juge basé sur un modèle de langage compare le code du candidat avec jusqu'à dix agents performants issus d'une archive. Le juge le fait sans voir les tâches de benchmark ni leurs résultats. Un classement Bradley-Terry combine ensuite ces préférences par paires.

Ce classement aide à prioriser les évaluations plus coûteuses. Il ne les remplace pas. Le système peut aussi générer des correctifs, les juger et exécuter des benchmarks en parallèle.

Ce que les expériences rapportées ont montré

VentureBeat cite des expériences sur Polyglot, TerminalBench 2.1 et un sous-ensemble de SWE-bench Verified. Dans une configuration Polyglot rapportée utilisant o3-mini, SIFT a atteint 35,1 % de précision. La référence Darwin Godel Machine a atteint 30,7 % dans le même rapport.

L'article indique aussi qu'une exécution de SIFT sans le juge a atteint 29,8 %. Cela suggère que le juge peut compter dans la configuration rapportée. Néanmoins, il s'agit de résultats de benchmark dans des conditions expérimentales spécifiques.

La source rapporte également que tester un candidat sur cinquante tâches Polyglot coûte environ six dollars et 2,6 heures CPU dans la décomposition du papier. Ce chiffre aide à cadrer la charge d'évaluation que le cadre cherche à gérer.

Pourquoi l'étape de coût est importante

L'idée principale de SIFT n'est pas d'éviter l'évaluation. C'est de rendre l'évaluation moins coûteuse et mieux ordonnée. Le juge fournit un signal précoce qui peut aider à décider quels candidats méritent des tests plus approfondis.

Cela compte parce que les exécutions de benchmark à grande échelle peuvent consommer du temps et des ressources de calcul. Une étape de classement à moindre coût peut réduire le travail inutile. La source ne prétend pas que cette approche améliore toujours tous les environnements de codage.

Limites et considérations de gouvernance

L'article reste prudent quant au périmètre. Les chiffres rapportés proviennent d'expériences de benchmark, et non d'une affirmation d'amélioration universelle. Le juge ne voit pas non plus les tâches de benchmark ni leurs résultats, ce qui maintient l'étape de classement séparée des tests finaux.

Cette séparation est importante. Elle réduit le risque que le juge se contente de reproduire les réponses des benchmarks. Elle signifie aussi que le classement n'est qu'un outil de priorisation, et non un substitut à une véritable évaluation.

Pertinence pour le Maroc

La source ne rapporte aucune utilisation spécifique au Maroc. Une leçon globale conditionnelle est que les équipes, partout, devraient considérer le classement à faible coût comme un filtre, et non comme un remplacement des tests de benchmark.

En résumé

SIFT est un cadre de recherche pour les agents de codage qui cherche à réduire les coûts d'évaluation. Il le fait en ajoutant une étape de jugement basée sur un LLM avant des exécutions de benchmark plus larges. Les résultats rapportés sont prometteurs dans les configurations citées, mais ils restent expérimentaux.

Pour les lecteurs qui suivent l'évaluation des agents, l'idée clé est simple. SIFT vise à consacrer les tests coûteux uniquement aux candidats les plus prometteurs. Cela rend le pipeline d'évaluation plus sélectif, tout en conservant les benchmarks finaux.

Suivez-nous sur Google

Ajoutez Intelligence Artificielle Maroc à vos sources préférées pour retrouver davantage de nos actualités pertinentes dans la recherche Google.

Nous ajouter comme source préférée
Développement de plateformes IA

Que souhaitez-vous construire ?

Nous construisons des plateformes IA sur mesure, des produits SaaS, des applications métier intelligentes et des systèmes d’automatisation.

Ce formulaire est réservé aux demandes de projets, et non aux questions générales sur l’intelligence artificielle.

Nom *
E-mail professionnel *
Organisation (facultatif)
Solution *
Courte description du projet *

Related Articles

featured
J
Jawad
·Oct 4, 2026

Recherche Web sécurisée dans Claude Desktop avec Amazon Bedrock AgentCore

featured
J
Jawad
·Oct 4, 2026

Muse Gadgets : matériel open source pour votre Muse

featured
J
Jawad
·Oct 4, 2026

NVIDIA DGX Spark 64 Go élargit les options d'IA locale

featured
J
Jawad
·Oct 4, 2026

Parcourir des milliers de baux avec Amazon Quick et Adjudicated Query