




يظهرعدة وجوه في اللقطة. ويتم مطابقة صوت كل متحدث مع الترجمة الصوتية الخاصة به، داخل الإطار نفسه.
وجوه مدفوعة عن الكاميرا. لقطات من الجانب ومن زاوية ثلاثة أرباع، والمتحدثون ينظرون إلى شاشة أو إلى بعضهم البعض.
أفواه مغطاة جزئيًا. اللحى، والشوارب، والنظارات، أو يد قريبة من الوجه، أو ميكروفون يظهر في الإطار — حتى عندما يكون الفم محجوبًا جزئيًا، تظل تعابير الوجه الدقيقة واضحة.
القطع وحركة الكاميرا. لقطات مصورة بالكاميرا المحمولة، وحركات الكاميرا الأفقية، ومونتاج يغير الزاوية في منتصف الجملة.
إضاءة متفاوتة. قاعة محاضرات، ملاذ، ومكتب في نهاية اليوم.
الحوار السريع. التداخلات، والمقاطعات، ووتيرة الكلام التي يتحدث بها الناس عندما يخرجون عن النص.
تسجيلات طويلة. جلسات كاملة ووحدات دراسية، من البداية إلى النهاية.
تتميز هذه المنتجات بمستوى متطور من مزامنة الشفاه. وتضحي بالدقة مقابل دقائق.
بالنسبة للحجم المتكرر، فإن Rask تقوم واجهة برمجة التطبيقات (API) عملية تحميل الملفات واحدًا تلو الآخر وما يترتب عليها من عمليات نقل، بما في ذلك مزامنة الصوت.
معتمد. متوافق مع معيار SOC 2 من النوع الثاني واللائحة العامة لحماية البيانات (GDPR). تظل ملفات الفيديو والصوت مشفرة أثناء النقل وعند التخزين.
تظل لقطاتك ملكك. ولا يتم استخدام محتواك لتدريب النماذج.
الموافقة هي الأولوية. في العديد من الأنظمة القانونية، يتمتع الصوت والوجه بحماية مماثلة لتلك التي توفرها التوقيعات. يعمل موقع Rask باستخدام لقطات تمتلكها وأصوات لديك إذن باستخدامها.
هناك خيار محايد. ففي حالة عدم توفر الموافقة على صوت معين، يمكن استخدام صوت اصطناعي يتمتع بحقوق الاستخدام لنقل نفس المحتوى.
تعمل تقنية مزامنة الشفاه بالذكاء الاصطناعي على تعديل حركات فم الشخص في الفيديو بحيث تتوافق مع مسار صوتي جديد. وبفضل الذكاء الاصطناعي، يقرأ النموذج الكلام باللغة المستهدفة — أصواته وتوقيته وسرعته — ويعيد تشكيل حركة شفاه المتحدث إطارًا بإطار لتتناسب مع الصوت. تجعل تقنية مزامنة الشفاه هذه الفيديو المترجم يبدو وكأنه تم تصويره بتلك اللغة. كما تُستخدم هذه التقنية في الرسوم المتحركة ثنائية الأبعاد وثلاثية الأبعاد لتحريك الحوار تلقائيًا، بما يتجاوز حالات استخدام الترجمة المحلية. والنتيجة هي فيديو بمزامنة شفاه، وليس مجرد دبلجة صوتية.
ما عليك سوى تحميل الفيديو على Rask واختيار اللغات المستهدفة. يقوم موقع Rask بتحويله إلى نص وترجمته، ثم تقوم أنت بمراجعة النتيجة وتعديل النص والخط الزمني. وعندما تصبح الترجمة بالشكل الذي تريده، انقر على «مزامنة الشفاه»، وسيقوم موقع Rask باستخدام تقنية مزامنة الشفاه المدعومة بالذكاء الاصطناعي لإعادة تشكيل حركة شفاه المتحدث طوال الفيديو. قم بمعاينة النتيجة النهائية، وأعد إنشاء أي مقطع يبدو غير متناسق، ثم قم بالتصدير.
نفس الخطوات الثلاث في أداة إنشاء مزامنة الشفاه: ما عليك سوى التحميل، واختيار اللغة المستهدفة، والموافقة على الترجمة، وتطبيق مزامنة الشفاه. هكذا تعمل مزامنة الشفاه بالذكاء الاصطناعي في الواقع: يتولى موقع Rask مهام النسخ، والترجمة، والصوت، وحركة الشفاه. أما دورك فيتمثل في مراجعة النص والموافقة على النتيجة النهائية، وتلك المراجعة هي ما يُحدث الفرق في الجودة عند إنشاء مقاطع فيديو بمزامنة الشفاه.
يعتمد الأمر على ما تقوم بمزامنة الشفاه معه، لكن بالنسبة لمعظم الفرق، فإن هذه هي الخطوات الثلاث التي تتبعها لإنشاء مقاطع فيديو مزامنة الشفاه. تعمل الأدوات المصممة لمقاطع الفيديو القصيرة على مواقع التواصل الاجتماعي على تحسين السرعة عند التعامل مع وجه واحد، بينما تتولى منصات الترجمة المحلية إدارة كيفية عمل الذكاء الاصطناعي لمزامنة الشفاه ضمن مسار عمل واحد: النسخ، والترجمة، وتوليد الصوت، وتعديل حركة الفم. أما الأدوات المصممة للتوطين، فيجب أن تدعم المحتوى الطويل، والمتحدثين المتعددين، والتحكم في المصطلحات، والمراجعة قبل النشر. وقد تناولنا الوضع الحالي في دليلنا الخاص بـ أفضل تطبيقات مزامنة الشفاه بالذكاء الاصطناعي.
Rask الفواتير تُحسب بالدقائق، والدقيقة الواحدة تمثل رصيدًا عامًّا تنفقه على الترجمة أو المزامنة الصوتية. تستهلك الترجمة دقيقة واحدة لكل دقيقة من الفيديو النهائي، لكل لغة.
يعتمد مزامنة الشفاه على المستوى: يستغرق المستوى «القياسي» دقيقة واحدة لكل دقيقة من الفيديو، بينما يستغرق المستوى «المحسّن» 3 دقائق. وتبلغ مدة وحدة تدريبية مدتها عشر دقائق بلغتين مع مزامنة الشفاه «المحسّنة» 80 دقيقة — 20 دقيقة للترجمة و60 دقيقة لمزامنة الشفاه. أما نفس الوحدة على المستوى «القياسي» فتبلغ مدتها 40 دقيقة.
من الناحية المالية، تبلغ تكلفة ميزة مزامنة الشفاه 1 دولار لكل دقيقة من الفيديو في الباقة «القياسية»، و3 دولارات لكل دقيقة في الباقة «المحسّنة»، مع توفر خصومات على باقات «المؤسسات».
تتراوح الباقات من «Creator» إلى «Enterprise»، وتتوفر دقائق إضافية في الباقات السنوية. التفاصيل الكاملة متوفرة على الأسعار.
قم بتحميل ملفات بتنسيقات MP4 أو MOV أو WEBM أو MKV أو AVI، أو الصق رابطًا من YouTube أو Google Drive.
في الاشتراك، لا توجد قيود صارمة على حجم الملف أو مدته، كما يدعم موقع Rask التسجيلات الطويلة: مثل وحدات الدورات التدريبية الكاملة والجلسات المسجلة. بالنسبة لمقاطع الفيديو التي تزيد مدتها عن ثلاث ساعات، نوصي بتقسيمها إلى جزأين لتسريع عملية المعالجة. يتم التصدير بتنسيق MP4، مع تضمين الترجمة في الملف أو تقديمها كملف SRT منفصل.
هناك عاملان يحددان النتيجة: المستوى الذي تختاره والمواد الأصلية. يثبت المستوى «المحسّن» عند الفحص الدقيق، بما في ذلك على الوجوه التي تحمل لحى أو نظارات. أما المستوى «القياسي» فهو أقل دقة وقد يبدو آليًا.
علاوة على ذلك، فإن الوجه الواضح والمركّز، والإضاءة المتساوية، والصوت النقي توفر للعارضة أفضل الظروف للعمل. يمكنك تحميل مقاطع فيديو بدقة تصل إلى 4K لمزامنة الشفاه. أما التشويش الشديد الناتج عن الحركة، أو تغطية الفم خلال معظم اللقطة، أو مصدر الفيديو ذو الدقة المنخفضة جدًّا، فتقلل من جودة المخرجات، ويظهر ذلك جليًّا في النتيجة النهائية. ونظرًا لأن وقت المعالجة يعتمد على طول الفيديو ودقته وتعقيد المشهد، فإن مراقبة التقدم في الوقت الفعلي تساعدك على التخطيط لعمليات التحرير والتنزيل. قم بالمعاينة قبل النشر وأعد إنشاء المقاطع الفردية التي تعاني من خلل في التزامن؛ فهذه العملية المتكررة هي ما يضمن توحيد معايير المكتبة بأكملها.
نعم. تعتمد مدة المعالجة على طول الفيديو ودقته ومدى تعقيد المصدر. تقوم أداة « Rask » بإنشاء البصمة الصوتية من الصوت الموجود بالفعل في الفيديو المصدر، لذا فإن الصوت يأتي مباشرةً من مقطع الفيديو نفسه، دون الحاجة إلى ملف صوتي إضافي أو تسجيل منفصل لصوتك. تتوفر ميزة استنساخ الصوت متاح بـ32 لغة، مع عناصر تحكم مستقلة لتحديد مدى تطابق الناتج مع هوية المتحدث ومدى نقل العاطفة.
نعم. يقوم موقع Rask بفصل المتحدثين في التسجيل الخاص بك، وتخصيص صوت لكل منهم، ومطابقة كل وجه يظهر في اللقطة مع الصوت المترجم الخاص به. وتظل الندوات والمقابلات والتسجيلات التي يشارك فيها مقدمان قابلة للاستخدام دون الحاجة إلى تقسيم الملف. المزيد عن الترجمة متعددة المتحدثين.
يُعتبر مزامنة الصوت مع الصورة أمرًا قانونيًا عندما تمتلك حقوق ملكية اللقطات وتوافق الشخص الذي يظهر في الفيديو. في العديد من الأنظمة القانونية، يتمتع الصوت والوجه بحماية مماثلة لتلك التي يتمتع بها التوقيع، لذا فإن الحصول على الموافقة هو نقطة الانطلاق للنشر التجاري. وفي حالة عدم توفر موافقة بشأن صوت معين، يمكن استخدام صوت اصطناعي محايد مع حقوق استخدام لتغطية نفس المحتوى.
يحل الدبلجة بالذكاء الاصطناعي محل الصوت الأصلي. وتؤدي مزامنة الشفاه إلى تغيير ما يراه المشاهدون، لذا فإن أفضل النتائج تتحقق في محتوى الفيديو الذي يظل فيه الكلام وحركة الشاشة متناسقين، وتتطابق حركة الشفاه مع الصوت الجديد. أما استنساخ الصوت فيحدد صوت من سيسمعونه. وهذه العناصر الثلاثة مجتمعة: الدبلجة وحدها تنقل صوتًا مترجمًا، أما الدبلجة مع مزامنة الشفاه فتجعل المتحدث أمام الكاميرا يبدو مقنعًا، و استنساخ الصوت يحافظ على أن يكون الشخص هو نفسه بشكل واضح.