Перейти к содержимому

Как я создал полноценного локального голосового ИИ-агента и ускорил его работу

Codacus

0:00 / 0:00

Как я создал полноценного локального голосового ИИ-агента и ускорил его работу

80 615 просмотров · 2 недели назад
Codacus
42,9 тыс. подписчиков
80 615 просмотров · 2 недели назад
Попробуйте CodeRabbit: https://coderabbit.link/codacus-003 Голосовой агент, похожий на Astra, работающий полностью на локальном оборудовании с 12 ГБ видеокарты. Но заставить его говорить было легко. Чтобы он быстро реагировал, потребовалось гораздо больше усилий. В этом видео я создаю локального голосового помощника внутри Pithagoras и демонстрирую каждую оптимизацию с помощью демонстраций в реальном времени. Мы переходим от медленного последовательного конвейера к перекрывающимся процессам транскрипции, генерации моделей, синтеза речи и воспроизведения. Агент может видеть скриншоты, просматривать веб-страницы, использовать терминал и писать документы на интерактивном холсте — всё это с помощью голоса. Вы увидите: • Почему оригинальный голосовой конвейер казался таким медленным • Разбиение предложений на фрагменты и параллельная генерация/воспроизведение TTS • Транскрипция во время разговора • Более быстрые первые ответы с сохранением мысли для последующей работы • Квантование и потоковая передача Breeze-TTS-2 с помощью audio.cpp • Как контекст, кэширование и обработка подсказок влияют на время ответа Временные метки глав: 00:00 Введение 01:08 Модели 03:20 Размещение на одной карте 06:55 Устранение тишины 11:40 Сокращение времени ожидания 16:04 Создание агента 23:31 Сборка В конфигурации используется: • Qwen3.6-35B-A3B: для Brain • Breeze-TTS-2 для TTS • Whisper для STT • Silero VAD: Voice Interruption Работает на RTX 3060 с 12 ГБ видеопамяти, с использованием системной оперативной памяти и разгрузки ЦП для размещения стека. 🛠️ Pithagoras: https://github.com/thecodacus/pithagoras #localai #voiceagent #gpt6 #astra #jarvis #localagent #llamacpp #voiceai