مقال متخصص

صوت يشبه صاحبه.. كيف يتحقق الصحفي من التسجيل الصوتي؟

كان الصوت من أكثر الأدلة إقناعًا في المادة الصحفية، فيكفي أن نسمع شخصية معروفة تتحدث حتى نعتقد أن وجود صوتها يحسم مسألة هويتها، وأن الكلمات التي نسمعها خرجت منها بالفعل، لكن هذه القاعدة لم تعد صالحة بالبساطة نفسها. خاصة مع التطور السريع في تقنيات توليد الكلام واستنساخ الأصوات الذي جعل من الممكن إنتاج صوت قريب جدًا من صوت شخص حقيقي، كما أصبح تعديل تسجيل موجود أصلًا أسهل، من دون الحاجة إلى تصنيع المقطع كاملًا.
وعندما يتحقق الصحفي من صورة، فهو يتعامل مع أثر بصري يمكن فحص عناصره مباشرة: النصوص الظاهرة، والوجوه والمعالم الجغرافية والظلال والإضاءة، إضافة إلى البحث العكسي ومقارنة النسخ. أما التسجيل الصوتي، فهو أثر سمعي لا يظهر محتواه بالطريقة نفسها؛ إذ لا يكشف التسجيل بمجرد الاستماع إليه ظروف تسجيله، أو ما إذا كان جزء منه قد حُذف أو أضيف، أو كيف انتقل من مصدره الأول إلى النسخة المتداولة.
وأصبح التعامل مع التسجيلات الصوتية، "مسألة تحقق"، -خصوصًا عندما تُستخدم لإسناد تصريحات إلى شخصيات عامة ومشاهير أو لإثبات واقعة سياسية أو أمنية-، تتجاوز التعرف إلى هوية المتحدث وما قيل، لتشمل مصدر التسجيل وأقدم نسخة متاحة، وما إذا كان الملف قد مر بالضغط أو إعادة الترميز أو التحرير، إلى جانب فحص خصائص الصوت نفسه. 

ويشمل البحث والتحقق في خصائص الصوت نفسه "تحليل الموجة الصوتية والطيف، ومراجعة الخلفية والضوضاء والصدى، ومراقبة التغيرات في جودة التسجيل والانتقالات بين المقاطع، ثم مقارنة النتائج بالمصادر والتسجيلات الأخرى المتاحة". وبذلك يصبح الصوت مادة يمكن فحصها على أكثر من مستوى، لا مجرد تسجيل يُحكم عليه من خلال الاستماع إليه.

من استنساخ الصوت إلى أزمة التحقق

تعمل تقنيات التزييف الصوتي الحديثة بأكثر من طريقة. فبعض الأنظمة يحول النص المكتوب إلى كلام بصوت اصطناعي، بينما تسمح أنظمة أخرى بتحويل صوت متحدث إلى صوت شخص آخر مع الحفاظ على الكلمات نفسها. وهناك أيضًا التلاعب الجزئي، حيث يُضاف مقطع اصطناعي إلى تسجيل حقيقي بدل إنتاج الملف كاملًا من الصفر. وهذا النوع الأخير يضاعف صعوبة التحقق، لأن التسجيل قد يبدو طبيعيًا في معظمه بينما يكون الجزء المعدل هو الجملة التي تحمل المعنى الأساسي.

ففي يناير 2024، تلقى ناخبون في ولاية نيوهامبشر الأميركية مكالمات آلية تضمنت صوتًا مولدًا بالذكاء الاصطناعي يحاكي صوت الرئيس جو بايدن، ويدعو إلى عدم التصويت في الانتخابات التمهيدية. وفي سبتمبر من العام نفسه،  فرضت لجنة الاتصالات الفيدرالية الأميركية غرامة قدرها 6 ملايين دولار  على ستيف كرامر، وقالت إن الحملة استخدمت استنساخ الصوت بالذكاء الاصطناعي إلى جانب انتحال هوية المتصل لنشر الرسالة. وقدمت الواقعة مثالًا واضحًا على انتقال استنساخ الصوت من تقنية يمكن اختبارها في المختبر إلى وسيلة يمكن استخدامها في حملة اتصالات حقيقية على نطاق واسع.

ولم تكن لك الواقعة الأولى التي تكشف قدرة التزييف الصوتي على الوصول إلى المجال السياسي. حيث تشير مراجعة إلى واقعة تعود إلى 2019، عندما نُشرت على يوتيوب خطابات مزيفة تحاكي سياسيين كنديين، وكذلك انتشار تسجيل مزيف للرئيس الأميركي السابق باراك أوباما منذ 2018، في مثال على إمكانية استخدام التزييف الصوتي لتضليل الناخبين. وراجعت الدراسة التي نشرت في فبراير 2025، وشملت أكثر من 200 ورقة بحثية منشورة، تناولت نماذج كشف التزييف في الكلام، وبيانات التدريب، وطرق التقييم، وقابلية التعميم، والتزييف الجزئي، والاختبار عبر مجموعات بيانات مختلفة.

ولا تكمن الخطورة الصحفية في التوليد الكامل فقط،  ففي 2024، انتشر تسجيل نُسب إلى مدير مدرسة بيكسفيل الثانوية في ماريلاند الأميركية، وتضمن تصريحات عنصرية ومسيئة معادية للسامية. سرعان ما تعاملت وسائل إعلام وسكان محليون مع التسجيل باعتباره حقيقيًا وهو ما خلف تهديدات بالقتل وإجراءات إدارية، قبل أن يتبين خلال التحقيق أن الصوت مفبرك باستخدام تقنية استنساخ الصوت. 
وأظهرت القضية أيضًا أن التسجيل كان صوتيًا بالأساس، أي أنه لم يقدم للمستمع العلامات البصرية التي قد تساعد أحيانًا في اكتشاف تزييف الفيديو. وأفادت تقارير عن وجود نقاط انتقال وخصائص صوتية أثارت الشك أثناء فحصه، لكن الوصول إلى النتيجة اعتمد على التحقيق والخبرة التقنية، لا على الاستماع وحده. وهو ما أكدته مراجعة مركز تاو للصحافة الرقمية باستعانة السلطات بخبراء في الأدلة الجنائية.
ماذا يفعل الصحفي عندما يصل التسجيل إلى غرفة الأخبار؟

الخطوة الأولى ليست تشغيل الكاشف، بل حماية المادة التي وصلت. إذا حصل الصحفي على ملف صوتي من مصدر أو جهاز أو تطبيق، فعليه الاحتفاظ بالنسخة كما وردت، وتوثيق مصدرها ووقت استلامها وطريقة وصولها، ثم إجراء الفحص والتحويل على نسخة عمل. وإذا أمكن الوصول إلى التسجيل الأصلي أو إلى أقدم جيل متاح منه، فذلك أفضل من الاكتفاء بنسخة أعيد رفعها أو إرسالها عبر تطبيقات أعادت ضغطها.
وتوصي إرشادات SWGDE بطلب التسجيل الأصلي أو أقدم نسخة متاحة، والحفاظ على النسخة المستلمة دون تغيير، وإجراء عمليات الفحص على نسخة عمل منفصلة. وبعد ذلك يأتي التفريغ، يحول الصحفي التسجيل إلى نص كامل أو إلى نص للجزء محل الادعاء، ثم يراجعه مقابل الصوت نفسه. الهدف ليس الاستغناء عن التسجيل، وإنما تحويل ما قيل إلى مادة يمكن البحث عنها ومقارنتها بتصريحات أخرى. فإذا كانت الجملة المنسوبة إلى شخصية عامة موجودة في التسجيل، يمكن البحث عن مقابلة أو مؤتمر أو خطاب أطول وردت فيه، أو مقارنة الكلمات بالسياق الذي قُدمت فيه. لكن التفريغ يجيب عن سؤال "ماذا قيل؟"، ولا يجيب عن سؤال "كيف سُجل؟"؛ لذلك يبقى الفحص الصوتي منفصلًا.

ثم يأتي الاستماع التحليلي، فلا يسأل الصحفي فقط: هل الصوت يشبه فلانًا؟ بل يستمع إلى بدايات الجمل ونهاياتها، والانتقالات بين المقاطع، وتغير الخلفية، والضوضاء المستمرة، والصدى، والتنفس، والتوقفات، وأي تغير مفاجئ في جودة التسجيل. بعض هذه الملاحظات قد تكون طبيعية، لكنها يمكن أن تحدد مواضع بعينها للفحص التقني بدل التعامل مع الملف كله ككتلة واحدة.

كما يمكن التوصية بتقسيم التسجيل إلى مقاطع والعمل على مناطق محددة بدل معالجة الملف كله دفعة واحدة. وإذا كان الجزء المهم من التسجيل هو جملة واحدة، فيمكن مقارنة هذه الجملة بما قبلها وبعدها، ومراجعة ما إذا كانت خصائص التسجيل تستمر عبر المقطع أم تتغير فجأة، وفي بعض الحالات التحقيقية الموسعة، يتم استخدام waveform وspectrogram والتحليلات الطيفية لتوصيف هذه التغيرات، مع تسجيل النسخة المستخدمة والأدوات والعمليات التي أُجريت عليها.

وبالحديث عن التحقق من هوية المتحدث، فلا تكون المقارنة من نوع "يبدو أنه فلان"، إنما تعتمد قدر الإمكان على تسجيل سابق وموثوق للشخص نفسه، ويفضل أن يكون قريبًا زمنيًا ومشابهًا من حيث ظروف التسجيل والجودة. ويمكن استخدام أنظمة مقارنة الأصوات للمساعدة في تحديد ما إذا كان التسجيل المشكوك فيه يتوافق مع صوت مرجعي معروف، لكن المقارنة تبقى عنصرًا في التحقيق، ولا تثبت وحدها أن الشخص قال الكلمات.
متى يستخدم الصحفي أدوات كشف التزييف؟

بعد حفظ الملف وتوثيق مصدره وفحص محتواه وخصائصه الأساسية، يمكن إدخال أدوات الكشف الآلي إلى العملية. وهنا يجب أن يكون السؤال محددًا: ما الذي أريد من الأداة أن تختبره؟ لأن بعض الأدوات تركز على احتمال كون الصوت مولدًا اصطناعيًا، وبعضها يقارن بين صوتين، وبعض الأنظمة تتعامل مع خصائص الإشارة التي قد ترتبط بآلية التوليد. ومن ثم فإن اختيار الأداة يجب أن يتوافق مع طبيعة السؤال، لا أن يكون الخطوة الأولى في التحقيق.
وتقدم أداة VerificAudio التي طورتها مجموعة PRISA Media الإسبانية مثالًا عمليًا على إدخال هذه الخطوة في سير عمل غرفة الأخبار. فالأداة تسمح بإجراء مقارنة بين تسجيل مشكوك فيه وتسجيل حقيقي للشخص نفسه، كما توفر نمطًا آخر لتقدير ما إذا كان التسجيل أقرب إلى الصوت الحقيقي أو الاصطناعي. بينما يوضح مطوروها أن النتيجة ليست حكمًا مطلقًا؛ بل نسبة أو ميل يستخدمها الصحفي ضمن عملية تحقق أوسع. وعندما يصل تسجيل مشبوه إلى فرق التحقق في المجموعة، يُفحص مصدره، وقنوات توزيعه، وسياقه الإخباري، والتسجيلات المشابهة له، إلى جانب تحليل الأداة.

ولا تعني النتيجة "86% اصطناعي" مثلًا أن الصحفي أثبت أن التسجيل مزيف. فالنموذج يحلل خصائص الإشارة ويقارنها بما تعلم رصده، وقد يتغير أداؤه عندما تتغير اللغة أو اللهجة أو الجودة أو طريقة التوليد أو عملية الضغط التي تعرض لها الملف. ولهذا تكون نتيجة الكاشف معلومة فنية يجب تفسيرها ضمن بقية الأدلة، لا حكمًا نهائيًا على المادة.

وتقدم دراسة نشرت عام 2022، مثالًا على هذه المشكلة، حيث جمع الباحثون 37.9 ساعة من تسجيلات حقيقية عُثر عليها في العالم الواقعي لشخصيات عامة، منها 17.2 ساعة من التسجيلات المزيفة، ثم اختبروا نماذج كشف مختلفة عليها. ووجدوا أن أداء النماذج تراجع بصورة كبيرة على هذه البيانات مقارنة بالبيئات المخبرية. وخلص الباحثون إلى أن أداء الكواشف خارج بيئة الاختبار التقليدية قد يكون أضعف بكثير، وأن التسجيلات الواقعية أكثر تنوعًا وتعقيدًا من المجموعات المصممة للتدريب والاختبار.
وتتوافق هذه النتيجة مع مراجعة منهجية منشورة في أبريل 2026، شملت 27 دراسة في كشف التزييف الصوتي، إلى أن أداء النماذج يتأثر باختلاف مجموعات البيانات وجودة التسجيل والضوضاء وأساليب التوليد، وأن الانتقال من بيانات إلى أخرى يظل تحديًا رئيسيًا. وتشير المراجعة إلى أن بعض النماذج تحقق مستويات مرتفعة داخل مجموعات بيانات محددة، بينما تتراجع قابلية تعميمها خارج تلك البيئة.

وتؤكد دراسة أخرى منشورة في يونيو 2026، تناولت كشف التزييف لوسائط متعددة بالصوت والصورة والفيديو، استمرار فجوة في الأداء عند الانتقال إلى بيانات خارج نطاق التدريب، مع تراجع بلغ 10 إلى 15% في تجارب الخروج عن التوزيع، إلى جانب قابلية بعض النماذج لهجمات خصمية تجاوز نجاحها 80% في اختبارات معينة.
بعد فحص الصوت.. افحص القصة التي يحملها

في حال أجاب الفحص التقني عن بعض الأسئلة، تبدأ بعده طبقة أخرى من العمل، وهي السؤال "هل يثبت التسجيل أصلًا الادعاء الذي نُشر معه؟"، كما يعود الصحفي إلى المصدر الأول والنسخة الأولى، لاستكمال الفحص التقني وترتيب السياق.
يُبحث عن أقدم نسخة يمكن الوصول إليها، وعن الحساب أو الجهة التي نشرت التسجيل أولًا، وعن أي نسخة أطول أو ملف أعلى جودة، وعن الحدث أو المقابلة أو الاتصال الذي يُقال إن التسجيل خرج منه. وإذا كان التسجيل من مؤتمر أو مقابلة، يمكن البحث عن التسجيل الكامل أو بث الحدث أو النص الرسمي، ثم مطابقة الجملة محل الادعاء مع ما قيل قبلها وبعدها.

كما يجب فحص النسخ المتداولة ووجود اختلافات فيما بينها من عدمه، فمثلًا فإذا وُجد تسجيل بطول 43 ثانية وتسجيل آخر بطول دقيقتين، فالاختلاف نفسه يصبح محل سؤال، هل حُذف جزء؟ هل تغير ترتيب الكلام؟ هل كانت هناك مقدمة أو إجابة سبقت الجملة التي انتشرت؟ وهل الصوت في النسخة الأقصر مطابق للنسخة الأطول؟ ففي التحقق الصوتي، النسخ المتعددة ليست مجرد مواد مكررة؛ لأنها قد تكون هي التي تكشف قصة الملف.
يمكن أن تضيف البيانات الوصفية، وتقنيات "الوصول للمصدر الأصلي provenance"، أو تتبع منشأ المحتوى، طبقة أخرى إلى عملية التحقق، فمعايير مثل "أصالة المحتوى C2PA" و"بيانات الاعتماد للمحتوى Content Credentials" صممت لتوثيق معلومات عن أصل الملف والتعديلات التي طرأت عليه، بما يتيح تتبع بعض مراحل إنشاء المحتوى ومعالجته. هذه البيانات مفيدة عندما تكون متاحة لكنها لا تقدم حكمًا مستقلًا على صحة الادعاء المرتبط بالتسجيل. حيث تساعد البيانات في معرفة أصل الملف وتاريخه وسلامة بيانات المنشأ نفسها، وتكمل التحقق الصحفي والتحليل الجنائي بدل أن تحل محلهما.
وفي النهاية، لا ينتهي التحقق عند نتيجة كاشف آلي، ولم يعد السؤال المهني الأكثر أهمية هو ما إذا كان الصوت يبدو مألوفًا أو حقيقيًا، بل ما الذي يثبت أن صاحبه قال فعلًا ما نسمعه. فالصوت يمكن تقليده، والمقطع يمكن اقتطاعه، والملف يمكن إعادة تقديمه في سياق آخر، بينما تبقى مهمة الصحفي هي جمع الأدلة التي تربط التسجيل بالقول والحدث والمكان والزمان المنسوبة إليه. بهذا المعنى، ولم يعد التحقق يقتصر على فحص الصوت نفسه، وإنما امتد إلى تتبع رحلة التسجيل كاملة، من مصدره الأول إلى النسخة التي وصلت إلى الجمهور.

b2FOkd6INnjkG1wDth0HrJniAwu0H3kSki9PshNu.webp