Действительно ли частота ошибок распознавания слов — это лишь показушная метрика?
PolyAI
0:00 / 0:00
Действительно ли частота ошибок распознавания слов — это лишь показушная метрика?
143 454 просмотра · 1 месяц назад
PolyAI
2,9 тыс. подписчиков
143 454 просмотра · 1 месяц назад
Показатель частоты ошибок в словах — это число, которое большинство представителей индустрии голосового ИИ постоянно цитируют. Возможно, покупателям следует доверять ему меньше всего.
В этом эпизоде Никола Мркшич и Оливер Шоулсон, руководитель отдела проектирования и разработки агентов PolyAI, разбираются в результатах анализа более 100 000 рабочих звонков, проведенного в течение месяца, и в том, насколько хорошо голосовые агенты понимают людей.
Их главный вывод: частота ошибок в словах скрыта в шуме. Большинство неточностей в транскрипции безвредны. Пропущенное слово-паразит, пропущенный артикль, неправильная интонация в языке со сложной морфологией — ничто из этого не меняет смысла, который имел в виду клиент. Меньшая группа — это критические ошибки в сущностях, например, одна неправильная цифра в телефонном номере, и именно они незаметно прерывают звонок. Когда команда Оливера выделила безвредные ошибки самостоятельно, они объяснили менее 1% вариации качества разговора. Никола называет их пустыми калориями.
Больший сюрприз: успешность выполнения задач оставалась практически неизменной, в то время как ошибки, изменяющие смысл, накапливались. Линия была настолько чистой, что казалось, будто её подстроили. Современные операторы исправляют ошибки, задавая быстрый уточняющий вопрос и переходя к следующему вопросу, так что клиенты теряют немного времени, а не результат. Более старые детерминированные системы этого сделать не могли.
Эпизод завершается обсуждением того, в чём распознавание речи всё ещё отстаёт, и откровенным обзором полнодуплексных интерфейсов, таких как GPT Live, которые созданы для общения через голосовую связь.
Для всех, кто оценивает голосовой ИИ, вот главный вывод: перестаньте ориентироваться на эталонный показатель ошибок распознавания слов. Начните измерять успешность выполнения задач и качество разговора в собственных звонках. Чтобы узнать больше об успешных диалоговых агентах, посетите https://poly.ai?utm_source=youtube&ut...
Главы:
[00:00] Введение: Почему целый эпизод посвящен частоте ошибок в словах
[00:02] Частота ошибок в словах — ужасный показатель качества разговора
[00:07] Классификация ошибок по влиянию на бизнес: безобидные, семантические и критические
[00:13] Безобидные ошибки — пустые калории, они ничего не предсказывают
[00:15] LLM-ы восстанавливаются после ошибок лучше, чем вы думаете
[00:20] Реальность производства: 6,7% WER превосходит заявления поставщиков о 2-3%
[00:22] Семантические и критические ошибки оказывают противоположное влияние на передачу данных
[00:24] ASR с учетом контекста — это Будущее — не слепая транскрипция
[00:26] Полнодуплексное прерывание — это лень в плане пользовательского опыта, а не функция
[00:28] Ключевые выводы: перестаньте гнаться за WER, начните измерять влияние на бизнес