حذف خودکار تپق ها در مدل جدید تبدیل گفتار به متن گوگل | Gemini 3.5 Transcribe
rezasaad plus
0:00 / 0:00
حذف خودکار تپق ها در مدل جدید تبدیل گفتار به متن گوگل | Gemini 3.5 Transcribe
6 350 просмотров · 1 день назад
rezasaad plus
13,7 тыс. подписчиков
6 350 просмотров · 1 день назад
گوگل بهتازگی از مدلهای جدید هوش مصنوعی صوتی خودش تحت عنوان Gemini 3.5 Transcribe و Gemini 3.5 Transcribe Live در پلتفرم Google AI Studio رونمایی کرده. این مدلهای پیشرفته برای تبدیل دقیق صوت و گفتار به متن طراحی شدن و از بیش از ۸۵ زبان زنده دنیا از جمله زبان فارسی پشتیبانی میکنن. توی این ویدیو بهصورت جامع و عملی به بررسی و تست عملکرد این ابزار جدید در پردازش و تبدیل صدا به متن فارسی میپردازیم.
در طول ویدیو بخشهای مختلف محیط Google AI Studio و قابلیتهای کلیدی این مدل هوش مصنوعی رو بررسی میکنیم. یکی از مهمترین ویژگیهای این نسخه، قابلیت Custom Vocabulary هست که به شما اجازه میده کلمات تخصصی یا اسامی خاص رو به سیستم معرفی کنین تا در خروجی متن بدون خطا نوشته بشن. همچنین قابلیت Smart Transcription برای اصلاح گرامر، حذف تپقها و مرتبسازی خودکار متن گفتار وجود داره که عملکرد متفاوتی در مقایسه با تبدیل خام صدا ارائه میده.
علاوه بر این، تست تبدیل زنده گفتار از طریق میکروفون، رونویسی صدا از تبهای مرورگر و همچنین آپلود فایلهای صوتی طولانی پادکست از طریق گوگل درایو رو روی فایلهایی با فرمت FLAC انجام میدیم. در این بررسی، سرعت پردازش مدل، دقت تشخیص کلمات فارسی، نحوه ایجاد تایماستمپها و محدودیتها یا تداخلهای موجود میان قابلیتهایی مثل کلمات سفارشی و زمانبندی کلمات رو مورد ارزیابی دقیق قرار میدیم. اگر به دنبال ابزاری قدرتمند برای پیادهسازی متن پادکست یا ساخت سرویسهای صوتی هوشمند هستین، این مدل جدید گوگل پتانسیل بالایی در پردازش زبان فارسی داره.
––––––––––––––––––––––––––––––
لینک معرفی
https://deepmind.google/models/gemini...
لینک Ai Studio
https://aistudio.google.com
بررسی Gemini 3.5 Live Translate
• انقلاب گوگل در ترجمه زنده با هوش مصنوعی جد...
––––––––––––––––––––––––––––––
00:00 مقدمه و ماجرای تایم استمپ هوش مصنوعی
00:30 معرفی ابزار جدید Gemini 3.5 Transcribe گوگل
01:43 ورود به محیط Google AI Studio و انتخاب مدلها
03:05 تنظیم زبان فارسی و قابلیت کلمات سفارشی (Custom Vocabulary)
04:55 بررسی قابلیت هوشمند Smart Transcription
05:45 تست زنده تبدیل صدا به متن با میکروفون
08:20 تست رونویسی مستقیم صدا از تب مرورگر
10:18 تبدیل فایل صوتی پادکست به متن با مدل Transcribe
12:40 بررسی ارور تداخل Custom Vocabulary و Word Timestamps
14:10 تست سرعت تبدیل فایل پادکست طولانی به متن
15:13 ارزیابی دقت متن فارسی و نحوه عملکرد تایماستمپها
16:23 جمعبندی، کاربرد API مدل صوتی و نتیجهگیری
––––––––––––––––––––––––––––––
کانال تلگرام رضاصاد پلاس
https://t.me/rezasaadplus
––––––––––––––––––––––––––––––
اینجا توی رضاصاد پلاس در مورد هوش مصنوعی و تکنولوژیهای جدید حرف میزنیم