
#
VentureBeat a rapporté le 2 octobre 2026 que MIT et Sakana AI avaient présenté SIFT. Le cadre vise un problème pratique dans l'amélioration des agents de codage : l'évaluation peut être coûteuse. Un correctif proposé peut sembler prometteur, mais les équipes doivent tout de même vérifier s'il améliore réellement les performances.
La source décrit une boucle dans laquelle un agent propose un correctif, une version révisée exécute des tâches de codage, et les résultats orientent les changements ultérieurs. SIFT ajoute une étape de jugement plus précoce avant les tests de benchmark à grande échelle. Cette étape est censée réduire le travail d'évaluation inutile.
Après une modification, le nouvel agent est d'abord exécuté sur quatre tâches de codage. Cela vise à détecter rapidement les défaillances évidentes. La source présente cela comme un filtre rapide, et non comme un verdict final.
Ensuite, un juge basé sur un modèle de langage compare le code du candidat avec jusqu'à dix agents performants issus d'une archive. Le juge le fait sans voir les tâches de benchmark ni leurs résultats. Un classement Bradley-Terry combine ensuite ces préférences par paires.
Ce classement aide à prioriser les évaluations plus coûteuses. Il ne les remplace pas. Le système peut aussi générer des correctifs, les juger et exécuter des benchmarks en parallèle.
VentureBeat cite des expériences sur Polyglot, TerminalBench 2.1 et un sous-ensemble de SWE-bench Verified. Dans une configuration Polyglot rapportée utilisant o3-mini, SIFT a atteint 35,1 % de précision. La référence Darwin Godel Machine a atteint 30,7 % dans le même rapport.
L'article indique aussi qu'une exécution de SIFT sans le juge a atteint 29,8 %. Cela suggère que le juge peut compter dans la configuration rapportée. Néanmoins, il s'agit de résultats de benchmark dans des conditions expérimentales spécifiques.
La source rapporte également que tester un candidat sur cinquante tâches Polyglot coûte environ six dollars et 2,6 heures CPU dans la décomposition du papier. Ce chiffre aide à cadrer la charge d'évaluation que le cadre cherche à gérer.
L'idée principale de SIFT n'est pas d'éviter l'évaluation. C'est de rendre l'évaluation moins coûteuse et mieux ordonnée. Le juge fournit un signal précoce qui peut aider à décider quels candidats méritent des tests plus approfondis.
Cela compte parce que les exécutions de benchmark à grande échelle peuvent consommer du temps et des ressources de calcul. Une étape de classement à moindre coût peut réduire le travail inutile. La source ne prétend pas que cette approche améliore toujours tous les environnements de codage.
L'article reste prudent quant au périmètre. Les chiffres rapportés proviennent d'expériences de benchmark, et non d'une affirmation d'amélioration universelle. Le juge ne voit pas non plus les tâches de benchmark ni leurs résultats, ce qui maintient l'étape de classement séparée des tests finaux.
Cette séparation est importante. Elle réduit le risque que le juge se contente de reproduire les réponses des benchmarks. Elle signifie aussi que le classement n'est qu'un outil de priorisation, et non un substitut à une véritable évaluation.
La source ne rapporte aucune utilisation spécifique au Maroc. Une leçon globale conditionnelle est que les équipes, partout, devraient considérer le classement à faible coût comme un filtre, et non comme un remplacement des tests de benchmark.
SIFT est un cadre de recherche pour les agents de codage qui cherche à réduire les coûts d'évaluation. Il le fait en ajoutant une étape de jugement basée sur un LLM avant des exécutions de benchmark plus larges. Les résultats rapportés sont prometteurs dans les configurations citées, mais ils restent expérimentaux.
Pour les lecteurs qui suivent l'évaluation des agents, l'idée clé est simple. SIFT vise à consacrer les tests coûteux uniquement aux candidats les plus prometteurs. Cela rend le pipeline d'évaluation plus sélectif, tout en conservant les benchmarks finaux.
Ajoutez Intelligence Artificielle Maroc à vos sources préférées pour retrouver davantage de nos actualités pertinentes dans la recherche Google.
Nous construisons des plateformes IA sur mesure, des produits SaaS, des applications métier intelligentes et des systèmes d’automatisation.
Ce formulaire est réservé aux demandes de projets, et non aux questions générales sur l’intelligence artificielle.