به گزارش آی سی تی نیوز؛ گوگل روز گذشته از مدل جدید تبدیل صوت به متن خود با نام Gemini 3.5 Transcribe رونمایی کرد. این مدل که جانشین مدل قبلی Chirp 3 محسوب میشود، با قابلیتهای پیشرفتهای مانند پشتیبانی از بیش از ۸۵ زبان و گویش، شناسایی چند گوینده همزمان و ویرایش با فرمان صوتی، تحولی جدید در حوزه دیکته صوتی ایجاد کرده است.
پشتیبانی از ۸۵ زبان و تشخیص خودکار لهجه
Gemini 3.5 Transcribe از بیش از ۸۵ زبان و گویش پشتیبانی میکند و میتواند بهطور خودکار زبان مورد نظر را تشخیص دهد. این مدل با لهجههای مختلف کنار میآید و درک بالایی از تنوع گفتاری کاربران در سراسر جهان دارد.
قابلیتهای پیشرفته ویرایش و اصلاح
مدل جدید گوگل میتواند کلمات زائد مانند «ام» و «آه» را بهصورت خودکار حذف کند و خوداصلاحیهای گوینده را در فرآیند تبدیل صوت به متن اعمال نماید. همچنین کاربران میتوانند واژهنامه سفارشی برای تشخیص اصطلاحات تخصصی و املاهای خاص ارائه دهند تا مدل واژههای شخصی و غیرمرسوم را بهدرستی تشخیص دهد. یکی از جذابترین قابلیتهای این مدل، ویرایش متن تولیدشده تنها با استفاده از فرمان صوتی است که تجربهای کاملاً دستآزاد را برای کاربران فراهم میکند.
تشخیص چند گوینده همزمان
در فایلهای صوتی ضبطشده، Gemini 3.5 Transcribe میتواند تا سه گوینده را تشخیص داده و با برچسب زمانی به آنها نسبت دهد. این ویژگی برای جلسات کاری، مصاحبهها و پادکستها کاربرد فراوانی دارد و فرآیند پیادهسازی محتوای گفتاری را بهشدت تسهیل میکند.
سرعت و دقت در سطح جدید
زمان تبدیل صوت به متن در Gemini 3.5 Transcribe در مقایسه با مدل قبلی Chirp 3 حدود ۷۰ درصد بهبود یافته است. نرخ خطای کلمات در حالت زنده به ۵.۵ درصد رسیده که نشاندهنده دقت بالای این مدل در تشخیص گفتار است.
دسترسی و برنامههای گسترش
مدل Gemini 3.5 Transcribe در حال حاضر در Gboard Rambler روی گوشی پیکسل ۱۱ و در برنامه Gemini در سیستمعامل macOS فعال است. گوگل همچنین این مدل را از طریق Google AI Studio، Antigravity و Gemini API در اختیار توسعهدهندگان قرار داده است. این شرکت وعده داده که بهزودی قابلیت دیکته صوتی را از طریق مرورگر کروم در تمامی صفحات وب فعال کند تا کاربران بتوانند در هر فیلد متنی، با صدای خود متن بنویسند. همچنین مدل جدید قابلیت تابعفراخوانی دارد و میتواند وظایف پیچیده مانند تولید تصویر و تحلیل فایل را به سایر مدلهای Gemini واگذار کند.
تحلیل ICTNews
رونمایی از Gemini 3.5 Transcribe نشان میدهد که گوگل با جدیت به دنبال تسخیر بازار تبدیل صوت به متن است. بهبود ۷۰ درصدی سرعت و کاهش نرخ خطا به ۵.۵ درصد، این مدل را به رقیبی جدی برای محصولات مشابه در بازار تبدیل کرده است. گسترش این قابلیت به مرورگر کروم میتواند نقطه عطفی در تعامل کاربران با وب باشد و مفهوم «نوشتن با صدا» را به یک هنجار روزمره تبدیل کند. با توجه به اینکه این مدل از طریق API نیز در دسترس توسعهدهندگان قرار گرفته، به نظر میرسد که موج جدیدی از اپلیکیشنهای مبتنی بر دیکته صوتی در راه است.