Перейти к содержимому

Действительно ли частота ошибок распознавания слов — это лишь показушная метрика?

PolyAI

0:00 / 0:00

Действительно ли частота ошибок распознавания слов — это лишь показушная метрика?

143 454 просмотра · 1 месяц назад
PolyAI
2,9 тыс. подписчиков
143 454 просмотра · 1 месяц назад
Показатель частоты ошибок в словах — это число, которое большинство представителей индустрии голосового ИИ постоянно цитируют. Возможно, покупателям следует доверять ему меньше всего. В этом эпизоде ​​Никола Мркшич и Оливер Шоулсон, руководитель отдела проектирования и разработки агентов PolyAI, разбираются в результатах анализа более 100 000 рабочих звонков, проведенного в течение месяца, и в том, насколько хорошо голосовые агенты понимают людей. Их главный вывод: частота ошибок в словах скрыта в шуме. Большинство неточностей в транскрипции безвредны. Пропущенное слово-паразит, пропущенный артикль, неправильная интонация в языке со сложной морфологией — ничто из этого не меняет смысла, который имел в виду клиент. Меньшая группа — это критические ошибки в сущностях, например, одна неправильная цифра в телефонном номере, и именно они незаметно прерывают звонок. Когда команда Оливера выделила безвредные ошибки самостоятельно, они объяснили менее 1% вариации качества разговора. Никола называет их пустыми калориями. Больший сюрприз: успешность выполнения задач оставалась практически неизменной, в то время как ошибки, изменяющие смысл, накапливались. Линия была настолько чистой, что казалось, будто её подстроили. Современные операторы исправляют ошибки, задавая быстрый уточняющий вопрос и переходя к следующему вопросу, так что клиенты теряют немного времени, а не результат. Более старые детерминированные системы этого сделать не могли. Эпизод завершается обсуждением того, в чём распознавание речи всё ещё отстаёт, и откровенным обзором полнодуплексных интерфейсов, таких как GPT Live, которые созданы для общения через голосовую связь. Для всех, кто оценивает голосовой ИИ, вот главный вывод: перестаньте ориентироваться на эталонный показатель ошибок распознавания слов. Начните измерять успешность выполнения задач и качество разговора в собственных звонках. Чтобы узнать больше об успешных диалоговых агентах, посетите https://poly.ai?utm_source=youtube&ut... Главы: [00:00] Введение: Почему целый эпизод посвящен частоте ошибок в словах [00:02] Частота ошибок в словах — ужасный показатель качества разговора [00:07] Классификация ошибок по влиянию на бизнес: безобидные, семантические и критические [00:13] Безобидные ошибки — пустые калории, они ничего не предсказывают [00:15] LLM-ы восстанавливаются после ошибок лучше, чем вы думаете [00:20] Реальность производства: 6,7% WER превосходит заявления поставщиков о 2-3% [00:22] Семантические и критические ошибки оказывают противоположное влияние на передачу данных [00:24] ASR с учетом контекста — это Будущее — не слепая транскрипция [00:26] Полнодуплексное прерывание — это лень в плане пользовательского опыта, а не функция [00:28] Ключевые выводы: перестаньте гнаться за WER, начните измерять влияние на бизнес