Перейти к содержимому

حذف خودکار تپق ها در مدل جدید تبدیل گفتار به متن گوگل | Gemini 3.5 Transcribe

rezasaad plus

0:00 / 0:00

حذف خودکار تپق ها در مدل جدید تبدیل گفتار به متن گوگل | Gemini 3.5 Transcribe

6 350 просмотров · 1 день назад
rezasaad plus
13,7 тыс. подписчиков
6 350 просмотров · 1 день назад
گوگل به‌تازگی از مدل‌های جدید هوش مصنوعی صوتی خودش تحت عنوان Gemini 3.5 Transcribe و Gemini 3.5 Transcribe Live در پلتفرم Google AI Studio رونمایی کرده. این مدل‌های پیشرفته برای تبدیل دقیق صوت و گفتار به متن طراحی شدن و از بیش از ۸۵ زبان زنده دنیا از جمله زبان فارسی پشتیبانی می‌کنن. توی این ویدیو به‌صورت جامع و عملی به بررسی و تست عملکرد این ابزار جدید در پردازش و تبدیل صدا به متن فارسی می‌پردازیم. در طول ویدیو بخش‌های مختلف محیط Google AI Studio و قابلیت‌های کلیدی این مدل هوش مصنوعی رو بررسی می‌کنیم. یکی از مهم‌ترین ویژگی‌های این نسخه، قابلیت Custom Vocabulary هست که به شما اجازه میده کلمات تخصصی یا اسامی خاص رو به سیستم معرفی کنین تا در خروجی متن بدون خطا نوشته بشن. همچنین قابلیت Smart Transcription برای اصلاح گرامر، حذف تپق‌ها و مرتب‌سازی خودکار متن گفتار وجود داره که عملکرد متفاوتی در مقایسه با تبدیل خام صدا ارائه میده. علاوه بر این، تست تبدیل زنده گفتار از طریق میکروفون، رونویسی صدا از تب‌های مرورگر و همچنین آپلود فایل‌های صوتی طولانی پادکست از طریق گوگل درایو رو روی فایل‌هایی با فرمت FLAC انجام میدیم. در این بررسی، سرعت پردازش مدل، دقت تشخیص کلمات فارسی، نحوه ایجاد تایم‌استمپ‌ها و محدودیت‌ها یا تداخل‌های موجود میان قابلیت‌هایی مثل کلمات سفارشی و زمان‌بندی کلمات رو مورد ارزیابی دقیق قرار میدیم. اگر به دنبال ابزاری قدرتمند برای پیاده‌سازی متن پادکست یا ساخت سرویس‌های صوتی هوشمند هستین، این مدل جدید گوگل پتانسیل بالایی در پردازش زبان فارسی داره. –––––––––––––––––––––––––––––– لینک معرفی https://deepmind.google/models/gemini... لینک Ai Studio https://aistudio.google.com بررسی Gemini 3.5 Live Translate    • انقلاب گوگل در ترجمه زنده با هوش مصنوعی جد...   –––––––––––––––––––––––––––––– 00:00 مقدمه و ماجرای تایم استمپ هوش مصنوعی 00:30 معرفی ابزار جدید Gemini 3.5 Transcribe گوگل 01:43 ورود به محیط Google AI Studio و انتخاب مدل‌ها 03:05 تنظیم زبان فارسی و قابلیت کلمات سفارشی (Custom Vocabulary) 04:55 بررسی قابلیت هوشمند Smart Transcription 05:45 تست زنده تبدیل صدا به متن با میکروفون 08:20 تست رونویسی مستقیم صدا از تب مرورگر 10:18 تبدیل فایل صوتی پادکست به متن با مدل Transcribe 12:40 بررسی ارور تداخل Custom Vocabulary و Word Timestamps 14:10 تست سرعت تبدیل فایل پادکست طولانی به متن 15:13 ارزیابی دقت متن فارسی و نحوه عملکرد تایم‌استمپ‌ها 16:23 جمع‌بندی، کاربرد API مدل صوتی و نتیجه‌گیری –––––––––––––––––––––––––––––– کانال تلگرام رضاصاد پلاس https://t.me/rezasaadplus –––––––––––––––––––––––––––––– اینجا توی رضاصاد پلاس در مورد هوش مصنوعی و تکنولوژی‌های جدید حرف میزنیم