News

MIT وSakana AI: إطار SIFT يخفض تكاليف تقييم وكلاء البرمجة

يضيف SIFT من MIT وSakana AI حكماً منخفض التكلفة قبل الاختبارات المعيارية الكاملة، مما يساعد على ترتيب أولويات تغييرات وكلاء البرمجة دون استبدال الاختبار الأعمق.
Oct 4, 2026·3 min read
MIT وSakana AI: إطار SIFT يخفض تكاليف تقييم وكلاء البرمجة

#

النقاط الرئيسية

  • SIFT هو إطار بحثي من MIT وSakana AI.
  • يضيف خطوة حكم أقل تكلفة قبل اختبار المعايير على نطاق واسع.
  • لا يزال النظام يستخدم اختبارات المعايير بعد ترتيب المرشحين.
  • النتائج المعلنة تأتي من إعدادات تجريبية محددة.
  • لا يدّعي المقال أي نشر أو استخدام خاص بالمغرب.

ما الذي يحاول SIFT حله

ذكرت VentureBeat في 2 أكتوبر 2026 أن MIT وSakana AI قدّما SIFT. يستهدف الإطار مشكلة عملية في تحسين وكلاء البرمجة: فالتقييم قد يكون مكلفاً. قد يبدو التصحيح المقترح واعداً، لكن على الفرق أن تتحقق أيضاً مما إذا كان يحسن الأداء فعلاً.

يصف المصدر حلقةً يقترح فيها وكيلٌ تصحيحاً، ثم تشغّل نسخة معدلة مهام برمجية، وتوجّه النتائج التغييرات اللاحقة. يضيف SIFT خطوة حكم مبكرة قبل اختبار المعايير على نطاق واسع. والمقصود من هذه الخطوة تقليل العمل الضائع في التقييم.

كيف يعمل الإطار

بعد أي تعديل، يُشغَّل الوكيل الجديد أولاً على أربع مهام برمجية. والهدف من ذلك هو التقاط الأعطال الواضحة مبكراً. ويعرض المصدر هذا كمرشح سريع، لا كحكم نهائي.

بعد ذلك، يقارن حكمٌ قائم على نموذج لغوي بين كود المرشح وما يصل إلى عشرة وكلاء أقوياء من أرشيف. ويقوم الحكم بذلك من دون رؤية مهام المعايير أو نتائجها. ثم يجمع ترتيب Bradley-Terry تلك التفضيلات الثنائية.

يساعد هذا الترتيب في تحديد أولويات التقييمات الأكثر تكلفة. لكنه لا يستبدلها. ويمكن للنظام أيضاً أن يولد التصحيحات، ويحكم عليها، ويشغّل المعايير بالتوازي.

ما الذي أظهرته التجارب المعلنة

تستشهد VentureBeat بتجارب على Polyglot وTerminalBench 2.1 ومجموعة فرعية من SWE-bench Verified. وفي إعداد Polyglot واحد مذكور باستخدام o3-mini، وصل SIFT إلى دقة 35.1%. بينما وصل خط الأساس Darwin Godel Machine إلى 30.7% في التقرير نفسه.

ويذكر المقال أيضاً أن تشغيل SIFT من دون الحكم وصل إلى 29.8%. وهذا يشير إلى أن الحكم قد يكون مهماً في الإعداد المعلن. ومع ذلك، فهذه نتائج معايير ضمن ظروف تجريبية محددة.

كما يذكر المصدر أن اختبار مرشح على خمسين مهمة Polyglot يكلف نحو ستة دولارات و2.6 ساعة CPU في تفصيل الورقة. ويساعد هذا الرقم في توضيح عبء التقييم الذي يحاول الإطار إدارته.

لماذا تهم خطوة التكلفة

الفكرة الأساسية في SIFT ليست إلغاء التقييم، بل جعله أقل تكلفة وأكثر ترتيباً. فالحكم يعطي إشارة مبكرة يمكن أن تساعد في تحديد المرشحين الذين يستحقون اختباراً أعمق.

وهذا مهم لأن تشغيل المعايير على نطاق واسع قد يستهلك الوقت والقدرة الحاسوبية. ويمكن لخطوة ترتيب منخفضة التكلفة أن تقلل العمل غير الضروري. ولا يدّعي المصدر أن هذا النهج يحسن دائماً كل بيئة برمجة.

القيود واعتبارات الحوكمة

يتعامل المقال بحذر مع النطاق. فالأرقام المعلنة تأتي من تجارب معيارية، لا من ادعاء بتحسن عالمي. كما أن الحكم لا يرى مهام المعايير أو نتائجها، ما يبقي خطوة الترتيب منفصلة عن الاختبارات النهائية.

وهذا الفصل مهم. فهو يقلل احتمال أن يعكس الحكم إجابات المعايير ببساطة. كما يعني أن الترتيب ليس سوى أداة لتحديد الأولويات، وليس بديلاً عن التقييم الحقيقي.

الصلة بالمغرب

لا يذكر المصدر أي استخدام خاص بالمغرب. والدرس العالمي المشروط هو أن على الفرق في أي مكان أن تتعامل مع الترتيب منخفض التكلفة كمرشح، لا كبديل عن اختبار المعايير.

الخلاصة

SIFT هو إطار بحثي لوكلاء البرمجة يهدف إلى خفض تكاليف التقييم. ويفعل ذلك بإضافة خطوة حكم قائمة على نموذج لغوي قبل تشغيل معايير أوسع. والنتائج المعلنة واعدة في الإعدادات المذكورة، لكنها لا تزال تجريبية.

وللقراء الذين يتابعون تقييم الوكلاء، فالفكرة الأساسية بسيطة. يهدف SIFT إلى إنفاق الاختبار المكلف فقط على المرشحين الأكثر وعداً. وهذا يجعل خط أنابيب التقييم أكثر انتقائية، مع الإبقاء على المعايير النهائية.

تابعونا على Google

أضفوا Intelligence Artificielle Maroc إلى مصادركم المفضلة لرؤية المزيد من أخبارنا ذات الصلة في بحث Google.

إضافتنا كمصدر مفضّل
تطوير منصات الذكاء الاصطناعي

ما الذي ترغب في بنائه؟

نحن نبني منصات ذكاء اصطناعي مخصصة ومنتجات SaaS وتطبيقات أعمال ذكية وأنظمة أتمتة.

هذا النموذج مخصص لطلبات المشاريع وليس للأسئلة العامة حول الذكاء الاصطناعي.

الاسم *
البريد الإلكتروني المهني *
المؤسسة (اختياري)
الحل *
وصف مختصر للمشروع *

Related Articles

featured
J
Jawad
·Oct 4, 2026

بحث ويب آمن في Claude Desktop مع Amazon Bedrock AgentCore

featured
J
Jawad
·Oct 4, 2026

Muse Gadgets: عتاد مفتوح المصدر لمساعد Muse

featured
J
Jawad
·Oct 4, 2026

NVIDIA DGX Spark بسعة 64 جيجابايت يوسّع خيارات الذكاء الاصطناعي المحلي

featured
J
Jawad
·Oct 4, 2026

فحص آلاف عقود الإيجار باستخدام Amazon Quick وAdjudicated Query