
#
تبحث ورقة بقلم Kaiser Sun وزملائه فيما إذا كانت وكلاء الذكاء الاصطناعي يلاحظون عدم اليقين ويبلّغون عنه عندما تتعارض الأدلة مع ما يبدو أن النموذج الأساسي يعرفه. ويعرّف المؤلفون التواضع المعرفي عبر ثلاثة أبعاد سلوكية: التعرّف، الحل، والتصعيد.
تتناول الدراسة تعارضات مضبوطة وتعارضات تظهر طبيعيًا أثناء مهام الوكيل متعددة الخطوات. كما تستخدم أيضًا حالات ضبط مطابقة من دون تعارض. ويمكن أن تظهر التعارضات بين معرفة النموذج والأدلة المسترجعة، أو بين مصدرين سياقيين.
تقيّم الورقة أربعة وكلاء. والنتيجة الرئيسية بسيطة: الدقة الأعلى في المهمة لا تعني بالضرورة تواصلًا أفضل بشأن عدم اليقين. فقد تعرّفت بعض التهيئات على التعارضات خلال الخطوات الوسيطة، لكنها مع ذلك لم تذكر عدم اليقين غير المحسوم في الإجابات النهائية الخاطئة.
ويضيف تحليل المسارات تفصيلًا مهمًا. يمكن للوكيل أن يكتشف مشكلة مبكرًا ثم يفقد تلك الإشارة لاحقًا أثناء المهمة. كما يمكنه أن يفشل في حل المشكلة قبل إنتاج الرد النهائي.
ويذكر المؤلفون أيضًا أن التدخلات على مستوى النموذج يمكن أن تحسّن مقياس التواضع. وفي بعض الحالات، يأتي هذا التحسن على حساب دقة المهمة. وتتعامل الورقة مع ذلك بوصفه تفاعلًا بين النموذج الأساسي، وإطار الوكيل، وبيئة التقييم.
هذه نتيجة بحثية محدودة بأربعة وكلاء. وليست دليلًا على أن كل وكيل منشور يملك معدل الفشل نفسه. تُظهر الورقة نمطًا محددًا في إعداد تقييم محدد.
وهذا التمييز مهم. فقد تخفي الإجابة النهائية القوية ضعفًا في التعامل مع عدم اليقين. كما قد تُظهر الإجابة الأضعف وعيًا أفضل بالتعارض. وتشير الدراسة إلى أن الدقة وحدها لا تكفي للحكم على ما إذا كان الوكيل يتعامل بحذر مع عدم اليقين.
لا يثبت المصدر وجود طرح أوسع أو أثرًا على العملاء أو تحققًا خارجيًا. كما لا يدعم ادعاءات حول كيفية تصرف جميع الوكلاء في الإنتاج. وأأمن قراءة هي أن النتيجة تنطبق على الإعداد المختبَر والتقييم المبلّغ عنه فقط.
تم تقديم نسخة arXiv في 8 أكتوبر وموسومة بأنها نسخة جاهزة للنشر في EMNLP 2026. ويجب فهم تاريخ المصدر على أنه تاريخ النشر أو التقديم الأولي، لا كدليل على نشر لاحق.
لا يورد المصدر أي حقيقة خاصة بالمغرب. وبالنسبة للقراء، فإن الدرس العالمي المشروط هو أن التعامل مع عدم اليقين ينبغي تقييمه بشكل منفصل عن الدقة عند مقارنة وكلاء الذكاء الاصطناعي.
تعزز الورقة نقطة عملية في تقييم الوكلاء. فقد يبدو النظام صحيحًا بينما لا يزال يفوّت عدم اليقين أو يخفيه. وهذا يعني أن على المقيمين ربما فحص الخطوات الوسيطة، لا المخرجات النهائية فقط.
وتشير الدراسة أيضًا إلى أن التحسينات قد تنطوي على مقايضات. فإذا حسّن تغييرٌ ما التواضع، فقد يقلل دقة المهمة في بعض الإعدادات. وهذا يجعل تصميم التقييم مهمًا، خاصة عند مقارنة تهيئات مختلفة للوكلاء.
تجادل هذه الورقة بأن التواضع المعرفي قابل للقياس، لكنه غير مضمون بالدقة. وفي إعداد الأربعة وكلاء المختبَر، اكتشف بعض الوكلاء التعارضات من دون أن ينقلوا هذا عدم اليقين بالكامل إلى الإجابة النهائية. والنتيجة ضيقة النطاق، لكنها تقدّم تحذيرًا واضحًا: نجاح المهمة والتواصل بشأن عدم اليقين مرتبطان، لكنهما ليسا الشيء نفسه.
أضفوا Intelligence Artificielle Maroc إلى مصادركم المفضلة لرؤية المزيد من أخبارنا ذات الصلة في بحث Google.
نحن نبني منصات ذكاء اصطناعي مخصصة ومنتجات SaaS وتطبيقات أعمال ذكية وأنظمة أتمتة.
هذا النموذج مخصص لطلبات المشاريع وليس للأسئلة العامة حول الذكاء الاصطناعي.