
#
تقول TechCrunch إن Arena وصلت إلى 100 مليون دولار من الإيرادات السنوية المحسوبة بعد ثمانية أشهر من إطلاق خدمتها التجارية. بدأت المنصة كمشروع بحثي في UC Berkeley. وهي تستخدم أكثر من 10 ملايين تقييم من المستخدمين لترتيب النماذج.
ويقول المصدر نفسه إن Arena تبيع الآن خدمات أعمق لتقييم الذكاء الاصطناعي للمختبرات والشركات. وهذا مهم لأنه يُظهر تحولاً. لم يعد قياس أداء الذكاء الاصطناعي مجرد تمرين تقني. بل يمكن أن يكون أيضاً منتجاً ذا قيمة تجارية واضحة.
بالنسبة للقراء المغاربة، فإن الدرس الأساسي عملي. إذا كان من الممكن بيع تقييم النماذج على نطاق واسع، فهذا يعني أيضاً أنه شيء ينبغي على المشترين أخذه بجدية. أي فريق مغربي يخطط لنشر الذكاء الاصطناعي قد يحتاج إلى طريقة أفضل لمقارنة النماذج قبل اتخاذ القرار.
لا يحتاج المغرب إلى نسخ هذه الشركة كي يتعلم منها. النقطة المفيدة هي الانضباط الذي يقف وراء المنتج. لا ينبغي اختيار النموذج فقط لأنه يبدو متقدماً أو شائعاً.
قد تواجه المؤسسات المغربية احتياجات متعددة اللغات. وقد تعمل أيضاً مع بيانات محلية محدودة. في هذا السياق، قد لا يخبرك معيار قياس صُمم لسوق أخرى بالقصة كاملة. ستحتاج الفرق إلى اختبار النماذج وفق حالات الاستخدام الخاصة بها.
الشراء مسألة أخرى. إذا اشترت جهة عامة أو شركة خاصة أدوات ذكاء اصطناعي، فعليها أن تسأل كيف تم تقييم النموذج. وعليها أيضاً أن تسأل ما البيانات التي استُخدمت، وما المهام التي جرى اختبارها، وما حالات الفشل التي تم العثور عليها. يمكن لهذه الأسئلة أن تقلل الأخطاء المكلفة.
قد تحتاج مؤسسة مصرفية أو شركة ناشئة أو وزارة مغربية إلى مقارنة عدة نماذج قبل النشر. يشير مثال Arena إلى أن التقييم يمكن أن يكون منظماً وقابلاً للتكرار وذا قيمة. وهذا يمكن أن يساعد الفرق على تجنب الاعتماد على الادعاءات التسويقية وحدها.
غالباً ما تعمل الفرق المغربية بأكثر من لغة. وهذا يخلق تحدياً أمام المعايير العامة. قد يؤدي نموذج أداءً جيداً في لغة ما وضعيفاً في أخرى. يمكن للاختبار المحلي أن يكشف هذه الفجوات قبل أن يلاحظها المستخدمون.
يمكن لأدوات الذكاء الاصطناعي المستخدمة في خدمة العملاء أو مراجعة المستندات أو الدعم الداخلي أن تخلق مخاطر إذا فشلت بصمت. يمكن أن يساعد التقييم الفرق على قياس الدقة والاتساق وسلوك الرفض. وبالنسبة للقراء المغاربة، فهذا مهم بشكل خاص عندما تكون الخصوصية والامتثال جزءاً من القرار.
عندما يقول مورّد إن نموذجاً ما قوي، يمكن للمشتري المغربي أن يطلب دليلاً. يمكن لنتائج التقييم أن تدعم نقاشاً أكثر جدية. كما يمكن أن تساعد فرق الشراء على مقارنة الخيارات على الأساس نفسه.
لا يعني نمو Arena أن أي معيار قياس يكفي. قد تكون لوحة الصدارة مفيدة، لكنها قد تخفي أيضاً حدوداً مهمة. إذا لم تتطابق مجموعة الاختبار مع المهمة الحقيقية، فقد يضلل الترتيب المشترين.
توافر البيانات قيد رئيسي. قد لا تمتلك الفرق المغربية أمثلة موسومة كافية لبناء اختبارات داخلية قوية. وهذا يعني أنها قد تحتاج إلى البدء بشكل صغير والتركيز أولاً على أهم سير العمل. افتراض: ستحتاج فرق كثيرة إلى بناء بيانات التقييم تدريجياً بدلاً من دفعة واحدة.
المهارات قيد آخر. يتطلب التقييم الجيد أشخاصاً يفهمون المهمة التجارية وسلوك النموذج والمخاطر. ومن دون هذا المزيج، قد تقيس الفرق الشيء الخطأ. وقد تفوت أيضاً حالات الفشل المهمة في الإنتاج.
البنية التحتية مهمة أيضاً. قد يتطلب التقييم اختبارات متكررة وتسجيلات ومراجعات. وهذا يحتاج إلى أنظمة مستقرة وعمليات واضحة. إذا كانت هذه العناصر ضعيفة، فقد يصعب الوثوق بالنتائج.
ينبغي أن تكون الخصوصية والأمن السيبراني جزءاً من العملية أيضاً. قد تحتوي بيانات الاختبار على معلومات حساسة. وستحتاج الفرق إلى ضوابط للوصول والتخزين والمشاركة. كما ينبغي أن تتحقق مما إذا كان اختبار النموذج يخلق تعرضاً جديداً في بيئتها.
الامتثال هو الطبقة الأخيرة. قد يحتاج صناع القرار المغاربة والمشترون من الشركات إلى السؤال عمّا إذا كان نظام الذكاء الاصطناعي قابلاً للشرح والتدقيق والمراقبة. التقييم لا يحل محل الحوكمة. بل يدعمها.
ابدأ بالقرار، لا بالنموذج. اسأل ما الذي يجب أن يفعله نظام الذكاء الاصطناعي، ومن سيستخدمه، وما تكلفة الفشل. ثم صمّم التقييم وفقاً لهذه الاحتياجات.
استخدم مجموعة صغيرة من المهام الحقيقية. أدرج أمثلة من سير العمل المغربي حيثما أمكن. إذا كان الفريق يعمل بالعربية أو الفرنسية أو بمزيج بينهما، فاختبر هذه الحالات مباشرة. لا تفترض أن معياراً عالمياً سيغطيها.
أنشئ عملية مراجعة بسيطة. تتبع الدقة والأخطاء والحالات الحدية. احتفظ بملاحظات حول الأماكن التي يتعثر فيها النموذج. يمكن لهذا السجل أن يساعد في الشراء والتدقيق والترقيات المستقبلية.
أشرك فرق الشؤون القانونية والأمن والأعمال مبكراً. فقد تلاحظ هذه الفرق مشكلات في الخصوصية أو الامتثال لا تراها الفرق التقنية. كما يمكنها المساعدة في تحديد معنى «جيد بما يكفي» بالنسبة للمؤسسة.
بالنسبة للقراء المغاربة، الدرس الأوسع واضح. الذكاء الاصطناعي ينتقل من العروض التوضيحية إلى القرارات. ومع حدوث ذلك، يصبح التقييم جزءاً من سلسلة القيمة. ويشير نمو Arena إلى أن السوق يكافئ الآن من يستطيعون قياس النماذج جيداً.
يُظهر الإنجاز المالي الذي حققته Arena أن قياس أداء الذكاء الاصطناعي أصبح عملاً حقيقياً. ويعتمد نهج الشركة في ترتيب النماذج على تقييمات المستخدمين على نطاق واسع، وهذا يشير إلى اتجاه أوسع.
بالنسبة للمغرب، لا تتعلق الخلاصة العملية بشركة واحدة. بل تتعلق بالانضباط. قبل شراء الذكاء الاصطناعي أو نشره، قد تحتاج الفرق إلى اختبارات أفضل، وحوكمة أوضح، وتوقعات أكثر واقعية.
أضفوا Intelligence Artificielle Maroc إلى مصادركم المفضلة لرؤية المزيد من أخبارنا ذات الصلة في بحث Google.
نحن نبني منصات ذكاء اصطناعي مخصصة ومنتجات SaaS وتطبيقات أعمال ذكية وأنظمة أتمتة.
هذا النموذج مخصص لطلبات المشاريع وليس للأسئلة العامة حول الذكاء الاصطناعي.