Перейти к содержимому

«Запись»: транскрибация, статьи и озвучка в одной бесплатной программе

Иван Титов

0:00 / 0:00

«Запись»: транскрибация, статьи и озвучка в одной бесплатной программе

669 просмотров · 1 мес. назад
Иван Титов
1,49 тыс. подписчиков
669 просмотров · 1 мес. назад
🎙 «Запись» — моя бесплатная open-source программа, которая объединяет весь цикл работы с речью: транскрибация → LLM-обработка → озвучка. Всё в одном окне, а размер — почти в десять раз меньше, чем 2,5 ГБ у Buzz, который я показывал в прошлый раз. В этом видео показываю: 🎯 транскрибацию русской речи пайплайном GigaAM + T-one (модели Сбера и Т-Банка) — лучшее качество для русского из бесплатного, работает локально; 🌍 Whisper для остальных языков — тоже локально; 🤖 генерацию описания для YouTube, таймкодов, телеграм-поста и статьи по транскрипту одной кнопкой; ✍️ настройку промптов под себя — «пиши описание от первого лица в моём стиле»; 🔑 подключение LLM по своим ключам через Anthropic-совместимый endpoint — я использую GLM по подписке, вся обработка из этого видео уложилась примерно в 1% пятичасовой квоты; 📜 историю расшифровок и озвучек — после закрытия программы ничего не теряется; 🔊 озвучку текста: локально (Piper, Silero) и через облака — Яндекс SpeechKit, Сбер SaluteSpeech и бесплатный Microsoft Edge TTS; 📚 как я превращаю главы своей книги в аудио, чтобы вычитывать её на слух; 💰 сколько стоит облачный синтез: глава книги у Яндекса вышла примерно в 12 рублей, Edge TTS — бесплатно. ⏱ Таймкоды 00:00 Вступление: две проблемы Buzz — 2,5 ГБ и разорванный процесс 01:13 Приложение «Запись»: пайплайн GigaAM + T-one для русского языка 01:44 Сравниваем размер: 235 МБ против 2,5 ГБ 02:07 Интерфейс: история расшифровок, экспорт в TXT и SRT 03:13 Настройки: движки GigaAM и Whisper, выбор модели 03:51 LLM-профили: свои ключи и Anthropic-совместимый endpoint 04:13 Встроенные промпты: описание, таймкоды, телеграм-пост, статья 04:43 Вкладка ИИ-обработки: описание для YouTube одной кнопкой 05:12 Генерируем таймкоды и телеграм-пост 06:02 Пишем статью по видео 06:36 Сколько это стоит: ~1% пятичасовой квоты GLM 07:27 Транскрибация нового видео: перетащил файл и ждёшь 08:39 Настраиваю промпт «описание в моём стиле» с примером 09:50 Стриминг описания в реальном времени, проверка качества 10:51 Таймкоды: сверял с листочком — всё точно 11:29 Телеграм-пост и статья по новому видео 12:44 Итоги: бесплатно, локально, ~250 МБ 13:24 Обновления: ленивая загрузка модели и упрощённые настройки 14:06 Новая функция — озвучка текста (TTS) 14:31 Озвучиваю главу своей книги: голоса, паузы, LLM-нормализация 16:21 Слушаем результат локальной озвучки 17:40 Облачная озвучка: Яндекс SpeechKit и Сбер SaluteSpeech (и почему Сбер не покажу) 18:32 Тест Яндекс SpeechKit: голос Алёна и цена вопроса 21:52 Бесплатный Microsoft Edge TTS: голоса Дмитрий и Светлана 24:29 История озвучек и сравнение качества 25:33 Итоги 🔗 Ссылки 💻 «Запись» на GitHub: https://github.com/ivanarama/zapis 📜 Подробная Статья https://infostart.ru/1c/articles/2748... 🍴 Мой форк Buzz с поддержкой GigaAM: https://github.com/ivanarama/buzz ▶️ Прошлое видео про Buzz:    • Превращаем видео в текст с таймкодами | Bu...   ⭐ Если программа оказалась полезной — поставьте звезду на GitHub. 💬 Знаете локальную TTS-модель качественнее Piper и Silero? Напишите в комментариях — добавлю её в программу.