
#
تصف Anthropic مشروع Project Swap بأنه تجربة مقايضة مضبوطة. أحضر المشاركون كتابًا واحدًا كانوا مستعدين لتبادله. ثم ساعدتهم وكلاء مدعومون بـ Claude في البحث عن كتاب آخر.
شملت الدراسة 201 موظفًا. وكانوا موزعين على ست مجموعات مرتبطة بمكاتب Anthropic في سان فرانسيسكو، ونيويورك، ولندن، وسياتل، وواشنطن العاصمة، ودبلن. وتقول Anthropic إن دبلن استُبعدت من معظم التحليلات.
تحدث المشاركون أولًا عن أذواقهم مع Claude. ثم قدّر النموذج ترتيبًا للكتب في كل مجموعة محلية. وتفاوض الوكلاء في سوق رقمية. كما رتّب المشاركون عشرة كتب بشكل منفصل حتى يتمكن الباحثون من مقارنة تلك الترتيبات بتقديرات النموذج. ولم يرَ الوكلاء تلك الترتيبات المرجعية.
تذكر Anthropic أن الترتيب الثنائي لتفضيلات الكتب الذي قدمه Claude وافق ترتيبات المشاركين في 61 بالمئة من الحالات. وكان ذلك أفضل من التخمين العشوائي عند 50 بالمئة. كما تفوق على التخمين القائم على الشعبية عند 53 بالمئة وعلى خط أساس للترشيح التعاوني بنحو 55 بالمئة.
سجل متوسط النتيجة في السوق اللامركزية 0.55 على مقياس تفضيل مُطبّع. وسجل أفضل تخصيص ممكن باستخدام ترتيبات المشاركين أنفسهم 0.89. وتقول Anthropic إن معظم هذه الفجوة جاء من تقديرات النموذج غير الدقيقة لما يريده الناس، وليس من تصميم السوق نفسه.
في عمليات الإعادة، حققت النماذج الأقوى أداءً أفضل وفقًا لترتيبات Claude. وتقول Anthropic إن ذلك لم يزل مشكلة تقدير التفضيلات. لذلك تشير الدراسة إلى حدٍّ في مدى قدرة الوكلاء على استنتاج التفضيلات البشرية من الإعداد المتاح.
قارنَت Anthropic أيضًا بين وكلاء طُلب منهم التصرف بقسوة ووكلاء أُضيف إليهم هدف prosocial إضافي. وتذكر فروقًا طفيفة في النتائج. كما تقول إن الوكلاء prosocial قدموا أحيانًا تضحيات.
لا تقدم المصدر تفاصيل كافية للقول إن أي تعليم كان أفضل في كل الحالات. وهو يوضح فقط أن تغيير هدف الوكيل غيّر السلوك بطرق محدودة. وهذا يجعل المقارنة مفيدة كإشارة مبكرة، لا كإجابة نهائية.
تقدم Anthropic مشروع Project Swap بوصفه تحقيقًا مبكرًا في سلوك الوكلاء وقواعد السوق وإشراف المشاركين. إنها دراسة صغيرة في مكان عمل تستخدم الكتب. وليست سوقًا مطبقة على أرض الواقع.
ويقول المصدر أيضًا إنها ليست دليلًا على أن الوكلاء يمكنهم التفاوض بأمان على المعاملات الطبية أو الوظيفية أو المالية. وهذا التمييز مهم. فمقايضة الكتب اختبار ضيق لمطابقة التفضيلات والتفاوض. ولا يثبت السلامة في البيئات الأعلى مخاطرة.
أكبر مشكلة في التقرير هي الفجوة بين تقديرات النموذج وترتيبات المشاركين. وتنسب Anthropic معظم خسارة الأداء إلى مشكلة التقدير هذه. وبعبارة أخرى، كان الوكلاء قادرين على التفاوض، لكنهم ما زالوا يواجهون صعوبة في فهم ما يريده الناس فعلًا.
تشير هذه النتيجة إلى حد عملي لأنظمة الوكلاء التي تعتمد على استنتاج التفضيلات. فإذا أساء النموذج فهم المستخدم، فقد يستمر السوق في العمل لكنه ينتج نتائج أضعف. وتُظهر الدراسة أن تحسين التفاوض وحده قد لا يحل هذه المشكلة.
لا يورد المصدر أي حقائق خاصة بالمغرب. وبالنسبة للقراء، فإن الدرس العالمي هو أن أنظمة الوكلاء لا تحسن التنسيق إلا عندما تقدّر التفضيلات البشرية بدقة.
Project Swap هو اختبار مضبوط لوكلاء الذكاء الاصطناعي في سياق تبادل بسيط. ويُظهر تقدمًا ملموسًا مقارنة بالطرق العشوائية والمرجعية. كما يُظهر فجوة واضحة بين أداء الوكلاء وأفضل نتيجة ممكنة تستند إلى معلومات بشرية.
تقدم Anthropic هذا العمل بوصفه خطوة مبكرة، لا نظامًا مكتملًا. وتكمن فائدة الدراسة في أنها تفصل بين التفاوض وفهم التفضيلات. وقد تكون هذه الفجوة مهمة بقدر أهمية آلية التبادل نفسها.
أضفوا Intelligence Artificielle Maroc إلى مصادركم المفضلة لرؤية المزيد من أخبارنا ذات الصلة في بحث Google.
نحن نبني منصات ذكاء اصطناعي مخصصة ومنتجات SaaS وتطبيقات أعمال ذكية وأنظمة أتمتة.
هذا النموذج مخصص لطلبات المشاريع وليس للأسئلة العامة حول الذكاء الاصطناعي.