News

دليل AWS لتفريغ WhisperX مع وسم المتحدث على SageMaker

نشرت AWS دليلاً للنشر الخاص بـ WhisperX على SageMaker AI، ويغطي وسوم المتحدثين والطوابع الزمنية وصيغ الإخراج وخيارات نقاط النهاية.
Sep 27, 2026·3 min read
دليل AWS لتفريغ WhisperX مع وسم المتحدث على SageMaker

#

النقاط الرئيسية

  • نشرت AWS دليلاً تقنياً لـ WhisperX على SageMaker AI.
  • يجمع الحاوي بين Whisper وwav2vec2 للمحاذاة القسرية وتجزئة المتحدثين.
  • يدعم نصوصاً منظمة مع طوابع زمنية ووسوم للمتحدثين.
  • تصف AWS خيارات النشر في الوقت الفعلي وغير المتزامن.
  • تتضمن التدوينة تفاصيل النشر والمتطلبات المسبقة وضوابط التكلفة.

AWS تنشر دليلاً للنشر

نشرت AWS مقال «Speaker-labeled transcription with WhisperX on SageMaker AI» في 24 سبتمبر 2026. المقال دليل تقني للنشر. وهو ليس ادعاءً بأن WhisperX من إنشاء AWS أو أنه أُطلق حديثاً.

يصف الدليل حاوية AWS Deep Learning Container مخصصة للنشر على Amazon SageMaker AI. وتجمع الحاوية Whisper وwav2vec2 للمحاذاة القسرية وتجزئة المتحدثين في صورة جاهزة لوحدات GPU. وهي مصممة لسير عمل تفريغ الكلام الذي يحتاج إلى أكثر من مجرد إخراج نصي بسيط.

ما الذي يضيفه WhisperX

يبني WhisperX على نموذج Whisper مفتوح المصدر للتعرف التلقائي على الكلام من OpenAI. وتقول AWS إنه يضيف الاستدلال على دفعات، وطوابع زمنية على مستوى الكلمات، ووسوم المتحدثين. ويتيح هذا المزيج إرجاع الصوت على هيئة نصوص منظمة.

تسرد AWS أربعة تنسيقات للإخراج: JSON وJSON المطول وSRT وVTT. وتدعم هذه التنسيقات استخدامات مختلفة لاحقة. ويعرضها الدليل كخيارات إخراج، وليس كادعاءات أداء مقاسة.

كيف تعمل الحاوية

تتبع الحاوية عقدة الخدمة الخاصة بـ SageMaker. فهي تستمع على المنفذ 8080، وتقبل طلبات الاستدلال على `/invocations`، وتعرض `/ping` لفحوصات السلامة. وتستخدم الطلبات بيانات نموذج متعددة الأجزاء.

يقول الدليل إن الطلبات قد تتضمن حقولاً للغة والتجزئة بين المتحدثين وصيغة الاستجابة. وهذا يجعل النشر قابلاً للتهيئة وقت الاستدلال. كما تتضمن التدوينة متطلبات النشر المسبقة وتشير إلى دفتر AWS Samples.

خيارات نقطة النهاية والتوسع

تقارن AWS بين نقاط النهاية المتزامنة في الوقت الفعلي ونقاط النهاية غير المتزامنة. وتناسب نقاط النهاية في الوقت الفعلي المقاطع القصيرة التفاعلية. ويذكر الدليل أن الاستجابات في الوقت الفعلي يجب أن تلتزم بحد SageMaker البالغ 60 ثانية.

يُعرض الاستدلال غير المتزامن للملفات الصوتية الطويلة أو مهام الدفعات ذات الحجم الأكبر. فهو يرسل الصوت ويسترجعه عبر S3 ويمكنه التوسع إلى الصفر عند الخمول. كما يوضح المقال اختيار مثيل GPU، وتثبيت AMI الخاص بـ GPU المطلوب، والتوسع بمهمة واحدة لكل حاوية، وضوابط التكلفة.

أمثلة على أعباء العمل في الدليل

تذكر AWS عدة أمثلة على أعباء العمل حيث قد تكون الطوابع الزمنية والإسناد مهمين. وتشمل هذه مكالمات مراكز الاتصال، والاجتماعات، والبودكاست، والإفادات، ووسائل الإعلام المذاعة، ومراجعة المجالات الخاضعة للتنظيم. وهذه أمثلة فقط. ولا يقدمها المقال على أنها نتائج عملاء.

يركز الدليل على آليات النشر بدلاً من النتائج التجارية. فهو يشرح كيفية حزم النموذج، وكيفية إرسال الطلبات، وكيفية اختيار نوع نقطة النهاية. وهذا يجعله مفيداً للفرق التي تقيم خطوط أنابيب تفريغ الكلام.

الحوكمة والاعتبارات التشغيلية

تسلط المصدر الضوء على خيارات تشغيلية تؤثر في الموثوقية والتكلفة. فنوع نقطة النهاية مهم لأن المقاطع القصيرة والصوت الطويل لهما احتياجات مختلفة. كما يؤثر اختيار GPU وتثبيت AMI المطلوب في إعداد النشر.

تشير الإشارة إلى وسوم المتحدثين والطوابع الزمنية على مستوى الكلمات إلى الحاجة إلى التعامل بعناية مع النصوص المفرغة. وهذا اعتبار تشغيلي، وليس ادعاءً قانونياً أو تنظيمياً. ولا تضيف التدوينة أي إرشادات امتثال خاصة بدولة معينة.

الصلة بالمغرب

لا يورد المصدر أي حقائق أو توفر أو تبنٍّ خاص بالمغرب. والدرس العالمي المشروط هو أن الفرق التي تقيم أنظمة التفريغ ينبغي أن تتحقق من حدود نقاط النهاية وصيغ الإخراج وسلوك التوسع قبل النشر.

الخلاصة

يُظهر دليل AWS كيف يمكن نشر WhisperX على SageMaker AI كحاوية جاهزة لوحدات GPU. وهو يجمع بين التفريغ والمحاذاة وتجزئة المتحدثين في سير عمل واحد. والنتيجة هي إعداد تفريغ منظم مع عدة صيغ إخراج ونمطين لنقطة النهاية.

بالنسبة للقراء الذين يقارنون خيارات النشر، تكمن القيمة الأساسية في الجانب العملي. فالمقال يشرح كيفية تقديم الصوت، وكيفية تنسيق الطلبات، وكيفية الاختيار بين الاستدلال في الوقت الفعلي والاستدلال غير المتزامن. وهو يظل مركزاً على تفاصيل التنفيذ بدلاً من ادعاءات المنتج.

تابعونا على Google

أضفوا Intelligence Artificielle Maroc إلى مصادركم المفضلة لرؤية المزيد من أخبارنا ذات الصلة في بحث Google.

إضافتنا كمصدر مفضّل
تطوير منصات الذكاء الاصطناعي

ما الذي ترغب في بنائه؟

نحن نبني منصات ذكاء اصطناعي مخصصة ومنتجات SaaS وتطبيقات أعمال ذكية وأنظمة أتمتة.

هذا النموذج مخصص لطلبات المشاريع وليس للأسئلة العامة حول الذكاء الاصطناعي.

الاسم *
البريد الإلكتروني المهني *
المؤسسة (اختياري)
الحل *
وصف مختصر للمشروع *

Related Articles

featured
J
Jawad
·Sep 27, 2026

AWS توضح كيفية نشر Qwen3-TTS على SageMaker

featured
J
Jawad
·Sep 27, 2026

CoreWeave تربط أدوات برمجة الذكاء الاصطناعي ببيانات البنية التحتية عبر MCP

featured
J
Jawad
·Sep 26, 2026

أنثروبيك تلتزم بنحو 11.6 مليار دولار لسعة أكاماي السحابية

featured
J
Jawad
·Sep 26, 2026

Crusoe تنهي شراكة توربينات Boom بقيمة 1.25 مليار دولار