«Запись»: транскрибация, статьи и озвучка в одной бесплатной программе
Иван Титов
0:00 / 0:00
«Запись»: транскрибация, статьи и озвучка в одной бесплатной программе
669 просмотров · 1 мес. назад
Иван Титов
1,49 тыс. подписчиков
669 просмотров · 1 мес. назад
🎙 «Запись» — моя бесплатная open-source программа, которая объединяет весь цикл работы с речью: транскрибация → LLM-обработка → озвучка. Всё в одном окне, а размер — почти в десять раз меньше, чем 2,5 ГБ у Buzz, который я показывал в прошлый раз.
В этом видео показываю:
🎯 транскрибацию русской речи пайплайном GigaAM + T-one (модели Сбера и Т-Банка) — лучшее качество для русского из бесплатного, работает локально;
🌍 Whisper для остальных языков — тоже локально;
🤖 генерацию описания для YouTube, таймкодов, телеграм-поста и статьи по транскрипту одной кнопкой;
✍️ настройку промптов под себя — «пиши описание от первого лица в моём стиле»;
🔑 подключение LLM по своим ключам через Anthropic-совместимый endpoint — я использую GLM по подписке, вся обработка из этого видео уложилась примерно в 1% пятичасовой квоты;
📜 историю расшифровок и озвучек — после закрытия программы ничего не теряется;
🔊 озвучку текста: локально (Piper, Silero) и через облака — Яндекс SpeechKit, Сбер SaluteSpeech и бесплатный Microsoft Edge TTS;
📚 как я превращаю главы своей книги в аудио, чтобы вычитывать её на слух;
💰 сколько стоит облачный синтез: глава книги у Яндекса вышла примерно в 12 рублей, Edge TTS — бесплатно.
⏱ Таймкоды
00:00 Вступление: две проблемы Buzz — 2,5 ГБ и разорванный процесс
01:13 Приложение «Запись»: пайплайн GigaAM + T-one для русского языка
01:44 Сравниваем размер: 235 МБ против 2,5 ГБ
02:07 Интерфейс: история расшифровок, экспорт в TXT и SRT
03:13 Настройки: движки GigaAM и Whisper, выбор модели
03:51 LLM-профили: свои ключи и Anthropic-совместимый endpoint
04:13 Встроенные промпты: описание, таймкоды, телеграм-пост, статья
04:43 Вкладка ИИ-обработки: описание для YouTube одной кнопкой
05:12 Генерируем таймкоды и телеграм-пост
06:02 Пишем статью по видео
06:36 Сколько это стоит: ~1% пятичасовой квоты GLM
07:27 Транскрибация нового видео: перетащил файл и ждёшь
08:39 Настраиваю промпт «описание в моём стиле» с примером
09:50 Стриминг описания в реальном времени, проверка качества
10:51 Таймкоды: сверял с листочком — всё точно
11:29 Телеграм-пост и статья по новому видео
12:44 Итоги: бесплатно, локально, ~250 МБ
13:24 Обновления: ленивая загрузка модели и упрощённые настройки
14:06 Новая функция — озвучка текста (TTS)
14:31 Озвучиваю главу своей книги: голоса, паузы, LLM-нормализация
16:21 Слушаем результат локальной озвучки
17:40 Облачная озвучка: Яндекс SpeechKit и Сбер SaluteSpeech (и почему Сбер не покажу)
18:32 Тест Яндекс SpeechKit: голос Алёна и цена вопроса
21:52 Бесплатный Microsoft Edge TTS: голоса Дмитрий и Светлана
24:29 История озвучек и сравнение качества
25:33 Итоги
🔗 Ссылки
💻 «Запись» на GitHub: https://github.com/ivanarama/zapis
📜 Подробная Статья https://infostart.ru/1c/articles/2748...
🍴 Мой форк Buzz с поддержкой GigaAM: https://github.com/ivanarama/buzz
▶️ Прошлое видео про Buzz: • Превращаем видео в текст с таймкодами | Bu...
⭐ Если программа оказалась полезной — поставьте звезду на GitHub.
💬 Знаете локальную TTS-модель качественнее Piper и Silero? Напишите в комментариях — добавлю её в программу.