كيف بيفهم الكمبيوتر الصوت؟
الكمبيوتر ما بيسمع زينا — بيحوّل الصوت لصورة اسمها mel-spectrogram وبيقرأها. رحلة بسيطة خطوة بخطوة من الموجة للصورة.
كيف بيفهم الكمبيوتر الصوت؟
لما بتحكي مع مساعدك الصوتي وبيفهمك، أو لما Shazam بيتعرف على أغنية بثواني، أو لما الواتساب بيحوّل رسالتك الصوتية لنص — بكل هالحالات في نفس السؤال: كيف الكمبيوتر «سمع» وفهم؟ الجواب المفاجئ: الكمبيوتر ما بيسمع الصوت زينا — هو بيحوّله لصورة وبيقرأها. بهالمقالة رح نمشي بهالرحلة خطوة خطوة، بدون تعقيد.
المشكلة: النموذج بيفهم أرقام، والصوت موجة
نماذج الذكاء الاصطناعي بتشتغل على أرقام منظّمة. أما الصوت، فهو موجة مستمرة فيها آلاف الاهتزازات بالثانية — إشي فوضوي كتير عالنموذج يتعامل معه مباشرة. عشان هيك بنحتاج نحوّل الموجة لتمثيل رقمي مضغوط ومنظّم اسمه audio features (خصائص الصوت)، وأشهر واحد منها اسمه mel-spectrogram.
الرحلة: من موجة لصورة
- ١. التسجيل بيصير أرقام: أول إشي، الصوت بينسجّل كسلسلة طويلة من الأرقام — كل رقم بيمثّل «موقع» الموجة بلحظة معينة. بنسجّل آلاف القياسات بالثانية (هاد اسمه sample rate).
- ٢. بنقسم الصوت لشرائح رفيعة: زي ما بتقص الخبز شرائح عشان تشوف كل وحدة لحالها، بنقسم الصوت لمقاطع قصيرة كتير (أجزاء من الثانية). كل شريحة بتمثّل «لحظة» من الصوت.
- ٣. بنحلّل ترددات كل شريحة: لكل شريحة، بنسأل: شو النغمات اللي فيها؟ في أصوات غليظة (ترددات منخفضة) ولا حادة (ترددات عالية)؟ العملية الرياضية اللي بتعمل هيك اسمها STFT — وما يهمك تفاصيلها، المهم إنها بتفكك الشريحة لمكوناتها.
- ٤. بنقيس قوة كل تردد: لكل تردد، بنحسب قدّيش هو قوي (عالي) أو ضعيف (خافت) بهاللحظة.
- ٥. بنعدّل المقياس ليشبه أذن الإنسان: أذننا حساسة للفرق بين النغمات المنخفضة أكتر من العالية. مقياس mel بيعيد ترتيب الترددات بنفس منطق أذن الإنسان — وعشان هيك النتيجة اسمها mel-spectrogram.
- ٦. النتيجة: صورة! بيطلع عنا جدول ثنائي الأبعاد: المحور الأفقي هو الزمن، والعمودي هو الترددات، ولون كل نقطة بيمثل قوة التردد بهاللحظة. هاي فعلياً صورة — والنماذج شاطرة كتير بقراءة الصور.
من هون والطريق معروف: الصورة بتنعطى لنموذج (زي شبكات الـ CNN أو الـ Transformers) يتعلم يميّز الأنماط فيها — كلام، موسيقى، ضجيج، أي إشي.
مثال محسوس
تخيل بدك تبني تطبيق يفرّق بين صوت عصفور وصوت سيارة. بتسجّل مقاطع من الاتنين، وبتحوّل كل مقطع لـ mel-spectrogram. صورة العصفور رح تطلع فيها خطوط رفيعة عالية (ترددات حادة ومتقطعة)، وصورة السيارة خطوط عريضة مشوشة تحت (هدير منخفض مستمر). الفرق واضح بالصورة حتى لعينك إنت! النموذج بيتعلم يميّز هالأنماط، وكل ما جمعت عينات أكتر، بيبني تمثيلات رقمية (embeddings) أدق للأصوات وبيصير تمييزه أقوى.
أخطاء وسوء فهم شائع
- «الكمبيوتر بيسمع زينا»: لأ — هو بيحلل أنماط بصرية بصورة الترددات. ما في «سمع» ولا فهم للمعنى، في تمييز أنماط.
- تسجيلات بمعدلات عينة مختلفة: لو كل ملف مسجّل بـ sample rate مختلف، الصور بتطلع غير متناسقة والنموذج بيتلخبط. أول قاعدة عملية: وحّد معدل العينة لكل ملفاتك.
- القيم الخام بدون معايرة: فرق الصوت العالي والخافت بيطغى على الأنماط الفعلية — عشان هيك بنعمل خطوة معايرة (normalization) بتظبط القيم على نطاق موحّد قبل التدريب.
خلاصة سريعة
- الكمبيوتر ما بيسمع — بيحوّل الصوت لصورة (mel-spectrogram) وبيقرأها.
- الرحلة: تسجيل رقمي ← شرائح قصيرة ← تحليل ترددات (STFT) ← مقياس mel الشبيه بأذن الإنسان ← صورة.
- مقياس mel مصمم ليحاكي حساسية أذن الإنسان للنغمات.
- الصورة الناتجة بتنعطى لنماذج الصور المعروفة (CNN / Transformers).
- عملياً: وحّد الـ sample rate وعاير القيم — هدول أكتر غلطتين بيوقع فيهم المبتدئين.
كمّل رحلتك من هون
- لسّا جديد عالموضوع كله؟ ابدأ من شو يعني ذكاء اصطناعي (AI)؟
- كمّل الرحلة: ASR — تحويل الكلام لنص ثم Whisper من OpenAI
- والاتجاه العكسي — من نص لصوت: ج٤: تحويل النص لكلام (TTS)
- ج٥ (خاتمة السلسلة): المحادثة الصوتية الفورية
- صادفت مصطلح مش واضح؟ افتح قاموس «شو يعني؟»