Изучаем нечеткий поиск с помощью Python
Analytics in Practice
0:00 / 0:00
Изучаем нечеткий поиск с помощью Python
1 847 просмотров · 2 года назад
Analytics in Practice
2,69 тыс. подписчиков
1 847 просмотров · 2 года назад
Нечеткое сопоставление — это метод, используемый для выявления похожих, но не идентичных текстовых записей, особенно полезный при обработке орфографических ошибок или несоответствий форматирования. В бейсбольном наборе данных нечеткое сопоставление использовалось для выравнивания имен игроков в двух источниках данных, где имена типа «Грегг Зау» и «Грегг Заун» относились к одному и тому же игроку. Специальная функция применяла метод fuzz.ratio для вычисления показателей сходства и сопоставления имен игроков выше установленного порогового значения. Аналогичный подход был расширен для сопоставления котировок акций на биржах США и Великобритании, где названия компаний часто указывались немного по-разному. Нечеткое сопоставление успешно сопоставило записи типа «APPLE INC.» на NASDAQ с их эквивалентом на Лондонской фондовой бирже. Для повышения точности были сохранены только совпадения с показателями сходства 90 или выше. Затем сопоставленные записи были объединены и сравнены по цене акций с использованием данных Yahoo Finance. Было обнаружено несколько расхождений в ценах акций, вероятно, из-за разницы валютных курсов, рыночных условий или использования депозитарных расписок. В рамках проекта также были продемонстрированы нечеткие сравнения имен и адресов, показавшие различную степень сходства. Наконец, к распространенным алгоритмам нечеткого сопоставления относятся расстояние Левенштейна, коэффициент сходства Жаккара и косинусное сходство, все из которых поддерживают гибкие задачи очистки и интеграции данных в реальных условиях.