
#
نشرت AWS مقال «Speaker-labeled transcription with WhisperX on SageMaker AI» في 24 سبتمبر 2026. المقال دليل تقني للنشر. وهو ليس ادعاءً بأن WhisperX من إنشاء AWS أو أنه أُطلق حديثاً.
يصف الدليل حاوية AWS Deep Learning Container مخصصة للنشر على Amazon SageMaker AI. وتجمع الحاوية Whisper وwav2vec2 للمحاذاة القسرية وتجزئة المتحدثين في صورة جاهزة لوحدات GPU. وهي مصممة لسير عمل تفريغ الكلام الذي يحتاج إلى أكثر من مجرد إخراج نصي بسيط.
يبني WhisperX على نموذج Whisper مفتوح المصدر للتعرف التلقائي على الكلام من OpenAI. وتقول AWS إنه يضيف الاستدلال على دفعات، وطوابع زمنية على مستوى الكلمات، ووسوم المتحدثين. ويتيح هذا المزيج إرجاع الصوت على هيئة نصوص منظمة.
تسرد AWS أربعة تنسيقات للإخراج: JSON وJSON المطول وSRT وVTT. وتدعم هذه التنسيقات استخدامات مختلفة لاحقة. ويعرضها الدليل كخيارات إخراج، وليس كادعاءات أداء مقاسة.
تتبع الحاوية عقدة الخدمة الخاصة بـ SageMaker. فهي تستمع على المنفذ 8080، وتقبل طلبات الاستدلال على `/invocations`، وتعرض `/ping` لفحوصات السلامة. وتستخدم الطلبات بيانات نموذج متعددة الأجزاء.
يقول الدليل إن الطلبات قد تتضمن حقولاً للغة والتجزئة بين المتحدثين وصيغة الاستجابة. وهذا يجعل النشر قابلاً للتهيئة وقت الاستدلال. كما تتضمن التدوينة متطلبات النشر المسبقة وتشير إلى دفتر AWS Samples.
تقارن AWS بين نقاط النهاية المتزامنة في الوقت الفعلي ونقاط النهاية غير المتزامنة. وتناسب نقاط النهاية في الوقت الفعلي المقاطع القصيرة التفاعلية. ويذكر الدليل أن الاستجابات في الوقت الفعلي يجب أن تلتزم بحد SageMaker البالغ 60 ثانية.
يُعرض الاستدلال غير المتزامن للملفات الصوتية الطويلة أو مهام الدفعات ذات الحجم الأكبر. فهو يرسل الصوت ويسترجعه عبر S3 ويمكنه التوسع إلى الصفر عند الخمول. كما يوضح المقال اختيار مثيل GPU، وتثبيت AMI الخاص بـ GPU المطلوب، والتوسع بمهمة واحدة لكل حاوية، وضوابط التكلفة.
تذكر AWS عدة أمثلة على أعباء العمل حيث قد تكون الطوابع الزمنية والإسناد مهمين. وتشمل هذه مكالمات مراكز الاتصال، والاجتماعات، والبودكاست، والإفادات، ووسائل الإعلام المذاعة، ومراجعة المجالات الخاضعة للتنظيم. وهذه أمثلة فقط. ولا يقدمها المقال على أنها نتائج عملاء.
يركز الدليل على آليات النشر بدلاً من النتائج التجارية. فهو يشرح كيفية حزم النموذج، وكيفية إرسال الطلبات، وكيفية اختيار نوع نقطة النهاية. وهذا يجعله مفيداً للفرق التي تقيم خطوط أنابيب تفريغ الكلام.
تسلط المصدر الضوء على خيارات تشغيلية تؤثر في الموثوقية والتكلفة. فنوع نقطة النهاية مهم لأن المقاطع القصيرة والصوت الطويل لهما احتياجات مختلفة. كما يؤثر اختيار GPU وتثبيت AMI المطلوب في إعداد النشر.
تشير الإشارة إلى وسوم المتحدثين والطوابع الزمنية على مستوى الكلمات إلى الحاجة إلى التعامل بعناية مع النصوص المفرغة. وهذا اعتبار تشغيلي، وليس ادعاءً قانونياً أو تنظيمياً. ولا تضيف التدوينة أي إرشادات امتثال خاصة بدولة معينة.
لا يورد المصدر أي حقائق أو توفر أو تبنٍّ خاص بالمغرب. والدرس العالمي المشروط هو أن الفرق التي تقيم أنظمة التفريغ ينبغي أن تتحقق من حدود نقاط النهاية وصيغ الإخراج وسلوك التوسع قبل النشر.
يُظهر دليل AWS كيف يمكن نشر WhisperX على SageMaker AI كحاوية جاهزة لوحدات GPU. وهو يجمع بين التفريغ والمحاذاة وتجزئة المتحدثين في سير عمل واحد. والنتيجة هي إعداد تفريغ منظم مع عدة صيغ إخراج ونمطين لنقطة النهاية.
بالنسبة للقراء الذين يقارنون خيارات النشر، تكمن القيمة الأساسية في الجانب العملي. فالمقال يشرح كيفية تقديم الصوت، وكيفية تنسيق الطلبات، وكيفية الاختيار بين الاستدلال في الوقت الفعلي والاستدلال غير المتزامن. وهو يظل مركزاً على تفاصيل التنفيذ بدلاً من ادعاءات المنتج.
أضفوا Intelligence Artificielle Maroc إلى مصادركم المفضلة لرؤية المزيد من أخبارنا ذات الصلة في بحث Google.
نحن نبني منصات ذكاء اصطناعي مخصصة ومنتجات SaaS وتطبيقات أعمال ذكية وأنظمة أتمتة.
هذا النموذج مخصص لطلبات المشاريع وليس للأسئلة العامة حول الذكاء الاصطناعي.