Broadcast Join против Shuffle Hash Join: разбор стратегий объединения PySpark в Databricks
DataBeli
0:00 / 0:00
Broadcast Join против Shuffle Hash Join: разбор стратегий объединения PySpark в Databricks
4 826 просмотров · 10 месяцев назад
DataBeli
15 тыс. подписчиков
4 826 просмотров · 10 месяцев назад
В этом видео мы разберемся, как происходит внутреннее объединение таблиц в PySpark и Spark. Вы узнаете о двух основных стратегиях объединения — широковещательном объединении (Broadcast Join) и объединении с перемешиванием хэшей (Shuffle Hash Join), как Spark определяет, какую из них использовать, и как вы можете управлять этим поведением в Databricks с помощью параметров конфигурации и подсказок.
Весь код и файлы данных доступны по следующему пути:
https://github.com/databeli/pyspark_c...
Презентация PowerPoint, использованная в полном плейлисте (27 слайдов)
https://topmate.io/narender_kumar_91/...
Что вы узнаете:
Внутреннее устройство объединений Spark
Что такое широковещательное объединение (Broadcast Join) и как оно предотвращает перемешивание данных
Как работает хэш-объединение с перемешиванием (Shuffle Hash Join), когда оба набора данных большие
Сравнение производительности: широковещательное объединение против объединения с перемешиванием (Shuffle Join)
Понимание перемешивания данных в Spark
Настройка autoBroadcastJoinThreshold для индивидуальной настройки
Использование spark.conf.set для регулировки ограничений размера объединения
Определение типа объединения с помощью explain() в PySpark
Использование подсказок широковещательной рассылки в PySpark и SQL
Узнайте, как Databricks Photon Engine оптимизирует объединения
#pyspark #pysparktutorial #databricks #databrickstutorial