وصف المدون

إعلان الرئيسية

.
الصفحة الرئيسية جوجل تطلق نموذج Gemini 3.5 Transcribe لتحويل الكلام إلى نص بدقة غير مسبوقة وقريباً في متصفح كروم

جوجل تطلق نموذج Gemini 3.5 Transcribe لتحويل الكلام إلى نص بدقة غير مسبوقة وقريباً في متصفح كروم

أعلنت شركة جوجل اليوم عن إطلاق نموذج Gemini 3.5 Transcribe باعتباره نموذجها الأكثر دقة حتى الآن لتحويل الكلام المنطوق إلى نصوص مكتوبة، والذي يعمل بالفعل على تشغيل العديد من المنتجات الأساسية للشركة مثل لوحة المفاتيح والعديد من التطبيقات الذكية.

  • ✅ إطلاق نموذج Gemini 3.5 Transcribe كأدق نموذج لتحويل الصوت إلى نص من جوجل.
  • ✅ تقليل معدل الخطأ في الكلمات بشكل كبير ودعم البيئات الصاخبة بدقة عالية.
  • ✅ دعم أكثر من 85 لغة عالمية مع التعرّف التلقائي على اللهجات واللهجات المختلفة.
  • ✅ توفير النموذج للمطورين عبر Google AI Studio وقريباً في متصفح كروم وتطبيقات الماك.
نموذج جوجل الجديد لتحويل الصوت إلى نص

ثورة في التعرف على الصوت وتحويله إلى نصوص من جوجل

على عكس نماذج التعرف على الكلام التقليدية التي تعاني غالباً من الضوضاء المحيطة، والمصطلحات المعقدة، وصعوبة تنقية الكلمات المترددة، يقوم نموذج Gemini 3.5 Transcribe بتحويل التسجيلات الصوتية الخام بشكل مباشر إلى نصوص دقيقة ومنسقة ومصقولة بعناية فائقة.

تم تصميم هذا النموذج ليلتقط أسلوبك الطبيعي في التحدث لكي يفهم نيتك بشكل أفضل ويتعرف على المفردات المخصصة بدقة. وكما يظهر في تطبيق Rambler، يستطيع النموذج التعامل مع التصحيحات الذاتية التلقائية وحذف الكلمات الزائدة والحشو مثل الأصوات المتكررة، بالإضافة إلى تنسيق النصوص تلقائياً والتعرف على التعديلات الصوتية الطبيعية. كما تبرز جوجل النقاط التالية:

  • نسخ أكثر دقة: يحقق النموذج متوسط معدل خطأ في الكلمات (WER) منخفض للغاية يصل إلى 4.0% للبث المباشر و2.6% للحالات الأخرى، مع أداء قوي في البيئات الصاخبة.
  • مفردات مخصصة: يتعرف على المصطلحات المتخصصة والهجاء الفريد من خلال تكييف النصوص بسلاسة مع مفرداتك المخصصة.
  • دعم اللغات العالمية: يكتشف ويدس آلياً أكثر من 85 لغة مع التعامل بسلاسة مع اللهجات الإقليمية المتنوعة.
  • تحديد المتحدثين المتعددين: ينسب الكلام بدقة في التسجيلات الصوتية المسبقة مع طوابع زمنية لما يصل إلى ثلاثة متحدثين.

من حيث الأداء، يقدم النموذج ما وصفته جوجل بـ "تقدم كبير" في القدرات وتحسين معدلات الخطأ وتقليل زمن الاستجابة مقارنة بنموذج Chirp 3 السابق.

واجهة عرض توضيحية لنموذج الصوت

الهدف الآخر هو السماح للمستخدمين بتنفيذ المهام باستخدام أصواتهم. تتيح ميزة استدعاء الوظائف للنموذج تفويض المهام المعقدة مثل توليد الصور وتحليل الملفات لنماذج أخرى، ويمكن رؤية ذلك بوضوح في ميزة التحكم الصوتي في تطبيقات الحاسوب.

إلى جانب تطبيقات سطح المكتب ولوحة المفاتيح على أندرويد، يتوفر النموذج في ميكروفون المساعد الذكي لضمان دقة لا تصدق في النصوص والملفات النشطة.

وهو قريباً في متصفح كروم لتتمكن من التحدث للكتابة في أي حقل ويب بكل سهولة ويسر وبشكل طبيعي تماماً.

يتوفر Gemini 3.5 Transcribe حالياً في الحالات التالية:

  • للمطورين: في معاينة عامة عبر واجهة برمجة التطبيقات وخدمات جوجل السحابية المخصصة.
  • للشركات: في معاينة عامة عبر منصات وكلاء المؤسسات وقريباً في حلول تجارب العملاء.

ما هو نموذج Gemini 3.5 Transcribe الجديد؟

هو أحدث وأدق نموذج أطلُق بواسطة جوجل لتحويل الكلام المنطوق والصوت إلى نصوص كتابية بدقة متناهية مع تقليل نسبة الأخطاء وحذف الكلمات الزائدة تلقائياً.

ما هي أبرز التحسينات في هذا الإصدار مقارنة بالإصدارات السابقة؟

يقدم تحسناً كبيراً في معدل الخطأ في الكلمات (WER)، وانخفاضاً ملحوظاً في زمن الاستجابة بنسبة تصل إلى 70%، فضلاً عن دعمه لأكثر من 85 لغة عالمية.

كيف يمكن للمطورين الاستفادة من هذه التقنية؟

يتوفر النموذج حالياً للمطورين والشركات بنظام المعاينة العامة عبر منصات جوجل السحابية وأدوات الذكاء الاصطناعي المخصصة للمطورين.

هل يدعم النموذج التعرّف على أكثر من متحدث في نفس التسجيل؟

نعم، يدعم النموذج التعرف على ما يصل إلى ثلاثة متحدثين في التسجيلات الصوتية المسجلة مسبقاً مع توفير الطوابع الزمنية لكل متحدث.

🔎 في الختام، يمثل إطلاق نموذج Gemini 3.5 Transcribe نقلة نوعية في كيفية تفاعلنا مع الأجهزة عبر الصوت، حيث تتيح دقة التحويل العالية والقدرة على فهم السياق والتخلص من الضوضاء تجربة استخدام أكثر سلاسة وذكاء عبر مختلف منصات ومستعرضات الويب.

ليست هناك تعليقات
إرسال تعليق

قم بالتعليق على الموضوع

إعلان أول الموضوع

Ads

إعلان وسط الموضوع

ad

إعلان أخر الموضوع

Ad