📖 الذكاء الاصطناعي والصوت · جزء 3

Whisper من OpenAI: تحويل الصوت لنص ببساطة

دليل عملي لاستخدام Whisper المجاني لتحويل التسجيلات الصوتية للنص، مع نصائح للمبتدئين والتقنيين.

Whisper — النموذج المجاني اللي بيحوّل أي تسجيل صوتي لنص

Whisper هو نموذج ASR (Automatic Speech Recognition) مفتوح المصدر من OpenAI، بيحوّل الكلام لسلسلة نصية بدقة عالية. بدنا نعرف ليه هو أحدث ثورة بمجال تحويل الصوت للنص، وكيف نقدر نستخدمه من غير ما نكتب سطر برمجة، وكمان كيف نطبّقه للمبرمجين.

ليش بنحتاجه؟

تخيل إن عندك مقابلة ساعة بدك تفرّغها، أو محاضرة جامدة بدك تنسخ نصها لتكتب تقرير. عادةً بنقعد نكتب يدوياً أو نستعين بخدمات مدفوعة، وهاد بياخد وقت وكتير جهد. Whisper بيحل هالإشكال لأنه بيشتغل محلياً، ما بيحتاج إنترنت، وبدعم تقريباً 99 لغة منشان يترجم إشي صوتي لنص بسرعة.

كيف بيشتغل؟

  • التدريب: النموذج تدرب على 680 ألف ساعة صوت من مصادر مختلفة، يعني شاف أصوات من كل حتة، فبيقدر يتعامل مع لهجات كتير.
  • المدخل: بتعطيه ملف صوتي (WAV أو MP3).
  • المعالجة: Whisper بيقسم الصوت لمقاطع صغيرة، كل مقطع بيحول إلى تمثيل رقمي اسمه spectrogram — يعني صورة تمثل الترددات عبر الزمن.
  • التنبؤ: النموذج يقرأ الـ spectrogram ويطلع تسلسل من الرموز النصية (tokens) باستخدام decoder.
  • الإخراج: النص النهائي بيظهر مع توقيتات (timestamps) إذا بدّك تشتغل على ترقيم الكلام.

مثال محسوس

بدنا نطبق على سيناريو واقعي: بدك تفرّغ مقابلة عمل مدتها 45 دقيقة.

  1. حمّل الملف الصوتي على جهازك.
  2. إذا ما عندك خبرة برمجية، استعمل تطبيق ويب مجاني مبني على Whisper مثل WhisperWeb أو OpenAI Whisper Demo (بدون تسجيل).
  3. حمّل الملف، اختار اللغة (العربي) واضغط "تحويل".
  4. بعد دقيقة أو اثنين، رح يطلع لك النص كامل مع توقيتات، فيك تنسخه وتضيفه لتقريرك.

لو بدّك تتعمق تقنياً:

import whisper
model = whisper.load_model("small")  # أو "large" إذا بدك دقة أعلى
result = model.transcribe("interview.wav", language="ar")
print(result["text"])  # النص الناتج

بهالطريقة ما في حاجة لتثبيت مكتبات إضافية، وكل شي بيشتغل على جهازك.

أحجام النموذج

  • tiny: سريع جداً، بدقة منخفضة، مناسب للهواتف أو الأجهزة الضعيفة.
  • base و small: توازن بين السرعة والدقة، كتير مستخدمين.
  • medium و large: أعلى دقة، بتحتاج GPU أو معالج قوي، مناسب للملفات الطويلة أو اللي فيها لهجات معقدة.

أخطاء وسوء فهم شائع

  • بيترجم لأي لغة – Whisper بيترجم الكلام للغة المكتوبة، مش بيترجم من لغة لأخرى. إذا بدك ترجمة، لازم تستخدم خدمة ترجمة منفصلة.
  • دقته 100% – النموذج مش معصوم من الأخطاء، خاصةً بالأسماء، المصطلحات التقنية، أو اللهجات المحكية. لازم تراجع النص وتصححه.
  • بيحتاج إنترنت – النسخ المفتوحة بتشتغل محلياً بدون إنترنت، بس بعض التطبيقات السحابية بتحتاج اتصال.

خلاصة سريعة

  • Whisper هو نموذج مجاني مفتوح المصدر لتحويل الصوت للنص، بدعم ~99 لغة.
  • فيك تستخدمه بسهولة عبر تطبيقات ويب أو بسطرين Python إذا بدك تتحكم أكتر.
  • اختار حجم النموذج حسب الحاجة: tiny للسرعة، large للدقة.
  • دقته عالية للغة الفصحى، لكن اللهجات المحكية ممكن تحتاج تصحيح يدوي.
  • ما في داعي للإنترنت إذا شغّلت النسخة المحلية، وبيشتغل على ملفات طويلة مثل المقابلات والمحاضرات.

كمّل رحلتك من هون

شوفي فيديوهات شرح على يوتيوب عن «Whisper OpenAI tutorial speech to text»

📘 مصطلحات وردت بالمقالة

Whisper نموذج مفتوح المصدر من OpenAI لتحويل الكلام إلى نص
ASR Automatic Speech Recognition — تقنية تحويل الصوت إلى نص
spectrogram تمثيل بصري للترددات الصوتية عبر الزمن
decoder جزء من النموذج يترجم التمثيلات الرقمية إلى رموز نصية
📖 كل أجزاء السلسلة (5)
  1. كيف بيفهم الكمبيوتر الصوت؟
  2. ASR: كيف يحوّل الكمبيوتر كلامك لنص مكتوب؟
  3. Whisper من OpenAI: تحويل الصوت لنص ببساطة (هون إنتِ)
  4. تحويل النص لكلام (Text-to-Speech): كيف صار الكمبيوتر يحكي زي البشر؟
  5. المحادثة الصوتية الفورية: ليش صارت بلا تأخير؟