به گزارش آی سی تی نیوز؛ گوگل روز گذشته از مدل جدید تبدیل صوت به متن خود با نام Gemini 3.5 Transcribe رونمایی کرد. این مدل که جانشین مدل قبلی Chirp 3 محسوب می‌شود، با قابلیت‌های پیشرفته‌ای مانند پشتیبانی از بیش از ۸۵ زبان و گویش، شناسایی چند گوینده هم‌زمان و ویرایش با فرمان صوتی، تحولی جدید در حوزه دیکته صوتی ایجاد کرده است.

پشتیبانی از ۸۵ زبان و تشخیص خودکار لهجه

Gemini 3.5 Transcribe از بیش از ۸۵ زبان و گویش پشتیبانی می‌کند و می‌تواند به‌طور خودکار زبان مورد نظر را تشخیص دهد. این مدل با لهجه‌های مختلف کنار می‌آید و درک بالایی از تنوع گفتاری کاربران در سراسر جهان دارد.

قابلیت‌های پیشرفته ویرایش و اصلاح

مدل جدید گوگل می‌تواند کلمات زائد مانند «ام» و «آه» را به‌صورت خودکار حذف کند و خوداصلاحی‌های گوینده را در فرآیند تبدیل صوت به متن اعمال نماید. همچنین کاربران می‌توانند واژه‌نامه سفارشی برای تشخیص اصطلاحات تخصصی و املاهای خاص ارائه دهند تا مدل واژه‌های شخصی و غیرمرسوم را به‌درستی تشخیص دهد. یکی از جذاب‌ترین قابلیت‌های این مدل، ویرایش متن تولیدشده تنها با استفاده از فرمان صوتی است که تجربه‌ای کاملاً دست‌آزاد را برای کاربران فراهم می‌کند.

تشخیص چند گوینده هم‌زمان

در فایل‌های صوتی ضبط‌شده، Gemini 3.5 Transcribe می‌تواند تا سه گوینده را تشخیص داده و با برچسب زمانی به آنها نسبت دهد. این ویژگی برای جلسات کاری، مصاحبه‌ها و پادکست‌ها کاربرد فراوانی دارد و فرآیند پیاده‌سازی محتوای گفتاری را به‌شدت تسهیل می‌کند.

سرعت و دقت در سطح جدید

زمان تبدیل صوت به متن در Gemini 3.5 Transcribe در مقایسه با مدل قبلی Chirp 3 حدود ۷۰ درصد بهبود یافته است. نرخ خطای کلمات در حالت زنده به ۵.۵ درصد رسیده که نشان‌دهنده دقت بالای این مدل در تشخیص گفتار است.

دسترسی و برنامه‌های گسترش

مدل Gemini 3.5 Transcribe در حال حاضر در Gboard Rambler روی گوشی پیکسل ۱۱ و در برنامه Gemini در سیستمعامل macOS فعال است. گوگل همچنین این مدل را از طریق Google AI Studio، Antigravity و Gemini API در اختیار توسعه‌دهندگان قرار داده است. این شرکت وعده داده که به‌زودی قابلیت دیکته صوتی را از طریق مرورگر کروم در تمامی صفحات وب فعال کند تا کاربران بتوانند در هر فیلد متنی، با صدای خود متن بنویسند. همچنین مدل جدید قابلیت تابع‌فراخوانی دارد و می‌تواند وظایف پیچیده مانند تولید تصویر و تحلیل فایل را به سایر مدل‌های Gemini واگذار کند.

تحلیل ICTNews

رونمایی از Gemini 3.5 Transcribe نشان می‌دهد که گوگل با جدیت به دنبال تسخیر بازار تبدیل صوت به متن است. بهبود ۷۰ درصدی سرعت و کاهش نرخ خطا به ۵.۵ درصد، این مدل را به رقیبی جدی برای محصولات مشابه در بازار تبدیل کرده است. گسترش این قابلیت به مرورگر کروم می‌تواند نقطه عطفی در تعامل کاربران با وب باشد و مفهوم «نوشتن با صدا» را به یک هنجار روزمره تبدیل کند. با توجه به اینکه این مدل از طریق API نیز در دسترس توسعه‌دهندگان قرار گرفته، به نظر می‌رسد که موج جدیدی از اپلیکیشن‌های مبتنی بر دیکته صوتی در راه است.