Как я создал полноценного локального голосового ИИ-агента и ускорил его работу
Codacus
0:00 / 0:00
Как я создал полноценного локального голосового ИИ-агента и ускорил его работу
80 615 просмотров · 2 недели назад
Codacus
42,9 тыс. подписчиков
80 615 просмотров · 2 недели назад
Попробуйте CodeRabbit: https://coderabbit.link/codacus-003
Голосовой агент, похожий на Astra, работающий полностью на локальном оборудовании с 12 ГБ видеокарты. Но заставить его говорить было легко. Чтобы он быстро реагировал, потребовалось гораздо больше усилий.
В этом видео я создаю локального голосового помощника внутри Pithagoras и демонстрирую каждую оптимизацию с помощью демонстраций в реальном времени. Мы переходим от медленного последовательного конвейера к перекрывающимся процессам транскрипции, генерации моделей, синтеза речи и воспроизведения.
Агент может видеть скриншоты, просматривать веб-страницы, использовать терминал и писать документы на интерактивном холсте — всё это с помощью голоса.
Вы увидите:
• Почему оригинальный голосовой конвейер казался таким медленным
• Разбиение предложений на фрагменты и параллельная генерация/воспроизведение TTS
• Транскрипция во время разговора
• Более быстрые первые ответы с сохранением мысли для последующей работы
• Квантование и потоковая передача Breeze-TTS-2 с помощью audio.cpp
• Как контекст, кэширование и обработка подсказок влияют на время ответа
Временные метки глав:
00:00 Введение
01:08 Модели
03:20 Размещение на одной карте
06:55 Устранение тишины
11:40 Сокращение времени ожидания
16:04 Создание агента
23:31 Сборка
В конфигурации используется:
• Qwen3.6-35B-A3B: для Brain
• Breeze-TTS-2 для TTS
• Whisper для STT
• Silero VAD: Voice Interruption
Работает на RTX 3060 с 12 ГБ видеопамяти, с использованием системной оперативной памяти и разгрузки ЦП для размещения стека.
🛠️ Pithagoras: https://github.com/thecodacus/pithagoras
#localai #voiceagent #gpt6 #astra #jarvis #localagent #llamacpp #voiceai