23:59 05 / 06 /1405
مدل Gemini ۳.۵ Transcribe رونمایی شد

مدل جدید گوگل کلمات زائد و گفتار نامنظم را به متن ساختاریافته تبدیل می‌کند

مدل Gemini ۳.۵ Transcribe گوگل
گوگل از مدل صوتی جدید Gemini ۳.۵ Transcribe رونمایی کرده است که با هدف بهبود تشخیص گفتار و تبدیل مکالمات طبیعی به متن طراحی شده است. این مدل علاوه بر شناسایی خودکار بیش از ۸۵ زبان، می‌تواند اصلاحات حین صحبت، کلمات زائد و ساختار نامنظم گفتار را تشخیص دهد و خروجی مرتب‌تری تولید کند و قرار است امکان استفاده از قابلیت تبدیل گفتار به متن را در هر فیلد متنی مرورگر کروم نیز فراهم کند.

به گزارش خبرگزاری آنا؛ گوگل می‌گوید Gemini ۳.۵ Transcribe نسبت به مدل‌های قبلی در تبدیل گفتار به متن دقت بیشتری دارد و می‌تواند نحوه صحبت کردن طبیعی کاربران را بهتر درک کند. این مدل به‌جای تبدیل کلمه‌به‌کلمه گفتار به متن، تلاش می‌کند منظور کاربر و ساختار جمله را تشخیص دهد و در نتیجه حتی زمانی که فرد هنگام صحبت کردن جمله خود را اصلاح می‌کند یا افکارش را به‌صورت نامنظم بیان می‌کند، متن نهایی را با ساختار منسجم‌تری ارائه دهد.

تبدیل گفتار طبیعی به متن مرتب

یکی از قابلیت‌های اصلی این مدل، توانایی پردازش گفتار‌های نامنظم و تبدیل آن‌ها به متن ساختاریافته است. برای مثال، کاربر می‌تواند هنگام صحبت کردن جمله‌ای را آغاز کند، بخشی از آن را اصلاح کند و ادامه جمله را با ساختاری متفاوت بیان کند و مدل تلاش می‌کند به‌جای ثبت تمام مکث‌ها و اصلاحات، منظور نهایی را در قالب متنی تمیزتر ارائه دهد.

Gemini ۳.۵ Transcribe همچنین کلمات زائد و پرکننده مانند مکث‌های گفتاری و عبارت‌هایی که در صحبت روزمره برای فکر کردن یا ادامه دادن جمله استفاده می‌شوند را حذف می‌کند. این قابلیت می‌تواند هنگام تهیه یادداشت، نوشتن متن از طریق گفتار یا تبدیل یک ایده خام به محتوای قابل استفاده، نیاز به ویرایش دستی را کاهش دهد.

تشخیص واژگان و اطلاعات خاص

گوگل اعلام کرده است که این مدل می‌تواند واژگان سفارشی و شیوه‌های خاص نوشتن کلمات را نیز یاد بگیرد. این قابلیت برای کاربرانی که با نام‌های تخصصی، اصطلاحات کمتر شناخته‌شده یا واژگان اختصاصی یک کسب‌وکار سروکار دارند اهمیت دارد، زیرا مدل می‌تواند این کلمات را دقیق‌تر در متن تشخیص دهد.

Gemini ۳.۵ Transcribe در شناسایی رشته‌های ترکیبی از حروف و اعداد نیز عملکرد مناسبی دارد و می‌تواند مواردی مانند شماره سفارش و کد‌های پستی را با دقت بیشتری ثبت کند. چنین قابلیتی برای تبدیل مکالمات کاری، اطلاعات سفارش‌ها یا داده‌هایی که ثبت دقیق حروف و اعداد در آن‌ها اهمیت دارد کاربردی خواهد بود.

تفکیک صدای چند گوینده

این مدل در پردازش فایل‌های صوتی از پیش ضبط‌شده نیز می‌تواند صدای حداکثر سه گوینده را از یکدیگر تفکیک کند. گوگل همچنین اعلام کرده است که Gemini ۳.۵ Transcribe می‌تواند برای کلمات مختلف، زمان دقیق قرار گرفتن آن‌ها در فایل صوتی را ثبت کند و به این ترتیب متن رونویسی‌شده با زمان‌بندی سطح کلمه در اختیار کاربر قرار می‌گیرد. این قابلیت می‌تواند برای تولید متن از فایل‌های صوتی چندنفره، از جمله پادکست‌ها و گفت‌و‌گو‌های ضبط‌شده، کاربرد داشته باشد و امکان پیدا کردن بخش‌های مشخصی از فایل صوتی را نیز ساده‌تر کند.

استفاده در محصولات گوگل

Gemini ۳.۵ Transcribe هم‌اکنون در برخی قابلیت‌های جدید محصولات گوگل مورد استفاده قرار گرفته است. این مدل نیروی پشت قابلیت Rambler در گوشی‌های اندرویدی مانند گوشی‌های خانواده پیکسل ۱۱ است و در نسخه مک‌اواس برنامه جمینای نیز مورد استفاده قرار می‌گیرد و می‌تواند در کنار سایر مدل‌های جمینای برای انجام برخی وظایف عامل‌محور به کار گرفته شود.

گوگل همچنین اعلام کرده است که این مدل به‌تدریج به سرویس‌های دیگری مانند Search Live ،Gemini Live ،Google Docs ،Google Keep و Gmail راه پیدا می‌کند. توسعه‌دهندگان نیز می‌توانند از طریق API به قابلیت‌های این مدل دسترسی پیدا کنند و آن را در برنامه‌ها و سرویس‌های خود به کار بگیرند.

تبدیل گفتار به متن در تمام فیلد‌های کروم

یکی از کاربرد‌های جالب Gemini ۳.۵ Transcribe قرار است به مرورگر کروم مربوط باشد. گوگل می‌گوید کاربران در آینده نزدیک می‌توانند از قابلیت تبدیل گفتار به متن در هر فیلد متنی داخل صفحات وب استفاده کنند و برای مثال پاسخ‌ها، پست‌ها یا پیام‌های خود را با صحبت کردن بنویسند.

این قابلیت همچنین می‌تواند برای وارد کردن دستور‌های متنی به جمینای از طریق صدا مورد استفاده قرار بگیرد. در نتیجه، کاربر برای استفاده از قابلیت‌های تبدیل گفتار به متن دیگر الزاماً به یک برنامه اختصاصی نیاز نخواهد داشت و می‌تواند در محیط‌های مختلف وب مستقیماً صحبت کند تا متن مورد نظرش در کادر مربوط وارد شود.

انتهای پیام/

ارسال نظر