
العالم25/9/2026، 8:38:20 ص1
جيميناي يطور أداء الأصوات بالذكاء الاصطناعي.. نبرة ولهجة ومشاعر تحاكي التمثيل
واشنطن-سانا لم تعد تقنيات تحويل النصوص إلى أصوات تقتصر على قراءة الكلمات المكتوبة، إذ تتجه نماذج الذكاء الاصطناعي إلى تقديم أداء صوتي أكثر تنوعاً، يحاكي بعض عناصر الأداء البشري من حيث النبرة والإيقاع والمشاعر وطريقة إلقاء الجمل. وذكر موقع «أندرويد أوثوريتي» التقني أمس الخميس أن «
واشنطن-سانا لم تعد تقنيات تحويل النصوص إلى أصوات تقتصر على قراءة الكلمات المكتوبة، إذ تتجه نماذج الذكاء الاصطناعي إلى تقديم أداء صوتي أكثر تنوعاً، يحاكي بعض عناصر الأداء البشري من حيث النبرة والإيقاع والمشاعر وطريقة إلقاء الجمل. وذكر موقع «أندرويد أوثوريتي» التقني أمس الخميس أن «جيميناي»، نموذج الذكاء الاصطناعي التابع لشركة «غوغل»، أضاف نماذج جديدة لتحويل النص إلى كلام، تتيح للمستخدم التحكم في طريقة إلقاء النصوص، بما يشمل النبرة واللهجة وسرعة الحديث والهمس والضحك والتنهدات والتوقفات. وتتيح هذه النماذج إنشاء أصوات جديدة انطلاقاً من أوصاف مكتوبة باللغة الطبيعية، مع دعم أكثر من 100 لغة ولهجة، إضافة إلى مجموعة كبيرة من الأصوات الجاهزة للاستخدام في تطبيقات مختلفة. ومن أبرز الميزات إمكانية استنساخ صوت اعتماداً على عينة صوتية قصيرة، مع الحفاظ على خصائصه خلال المقاطع الطويلة، شريطة امتلاك المستخدم الإذن اللازم لاستخدام الصوت. ولا تقتصر التقنية على إنتاج صوت واحد، إذ يمكن للنظام تحويل نص واحد إلى حوار بين شخصيتين، مع الحفاظ على اختلاف الأصوات وثباتها، ما يتيح تقديم محتوى صوتي أكثر تنوعاً في الكتب المسموعة والبودكاست والدبلجة ومقاطع الفيديو. كما يمكن للمستخدم إعطاء تعليمات تفصيلية حول أداء كل جملة، مثل التحدث بنبرة هادئة أو حماسية، وتغيير سرعة الكلام أو إدخال وقفات وتنهدات وضحكات، الأمر الذي يمنح النص المكتوب طابعاً أقرب إلى الحوار والأداء التمثيلي. وتشير نتائج اختبارات أعلنتها «غوغل» إلى أن نماذجها الجديدة حققت نتائج متقدمة في عدد من اختبارات جودة الأصوات، مع استمرار المنافسة مع شركات متخصصة في إنتاج الأصوات الاصطناعية. وبدأت «غوغل» إتاحة بعض هذه القدرات في خدماتها، ومنها «Gemini Notebook» و«Google Vids»، بينما يستطيع المطورون الوصول إلى النماذج عبر أدوات «جيميناي» المخصصة لهم. ومع تطور تقنيات استنساخ الأصوات، تضع «غوغل» قيوداً وإجراءات حماية للحد من إساءة استخدامها، من بينها اشتراط الحصول على موافقة صاحب الصوت، واستخدام تقنيات تساعد في تمييز المحتوى الذي أنشئ بالذكاء الاصطناعي. وتفتح هذه التقنيات المجال أمام استخدامات جديدة للصوت الاصطناعي، بحيث لا يقتصر دوره على تحويل الكلمات إلى كلام مسموع، بل يمتد إلى تحديد الطريقة التي تُقال بها الجملة وما تحمله من إيقاع ونبرة وتعبير.
#أخبار
