كشفت شركة جوجل عن نموذج ذكاء اصطناعي صوتي جديد يقدم طفرة في مجالات التعرف على الصوت والتدوين النصي. وأوضحت الشركة أن النموذج الجديد “Gemini 3.5 Transcribe” يتميز بدقة أعلى مقارنة بالإصدارات السابقة، إلى جانب قدرته على التعرف التلقائي على أكثر من 85 لغة، وتحويل الحديث العفوي وغير المنظم إلى نصوص منسقة بدقة، فضلًا عن إمكانية إجراء التعديلات عبر الأوامر الصوتية وحذف الكلمات الزائدة تلقائيًا.
وأكدت جوجل أن النموذج قادر على تعلم المصطلحات الخاصة وطريقة كتابة الأسماء الفريدة، إلى جانب كفاءته في التقاط السلاسل الأبجدية والرقمية مثل أرقام الطلبات والرموز البريدية. كما تميز الموديل بقدرته على التمييز بين أصوات ما يصل إلى ثلاثة متحدثين في التسجيلات الصوتية المسبقة، مع تحديد التوقيت الزمني بدقة على مستوى الكلمة، وهو ما يُعد أداة مثالية لتفريغ المقاطع الصوتية مثل “البودكاست”.
ويُعد هذا النموذج القوة المحركة لميزة “Rambling” على أجهزة أندرويد الحديثة مثل سلسلة هواتف “Pixel 11″، إضافة إلى عمله عبر تطبيق “Gemini” على أجهزة ماك “macOS” لتقديم مهام تفاعلية بالتعاون مع نماذج الذكاء الاصطناعي الأخرى.
وفي خطوة لافتة، أعلنت جوجل أن المستخدمين سيتمكنون قريبًا من استخدام ميزة الإملاء الصوتي في أي حقل نصي داخل متصفح كروم، مما يتيح إملاء الردود والمنشورات وتوجيه الأوامر لـ “Gemini” بالصوت مباشرة.
كما يتوفر “Gemini 3.5 Transcribe” عبر منصة التطوير “Google Antigravity”، على أن يمتد ليشمل خدمات “Search Live”، و”Gemini Live”، ومستندات جوجل، و”Keep”، و”Gmail”، مع إتاحة واجهات البرمجة “APIs” للمطورين للاستفادة من قدراته.

