Перейти к содержимому

Файлы Parquet: построчное и столбцовое хранение, глубокий разбор записи и чтения с визуализацией

Vishwas Pawar

0:00 / 0:00

Файлы Parquet: построчное и столбцовое хранение, глубокий разбор записи и чтения с визуализацией

315 просмотров · 3 месяца назад
Vishwas Pawar
5,37 тыс. подписчиков
315 просмотров · 3 месяца назад
В этом видео мы подробно рассмотрим, как работает файл Parquet и почему он так полезен для аналитических задач. Мы начнем с рассмотрения ограничений традиционного построчного хранения данных, когда запрос может считывать ненужные строки и столбцы. Затем мы перейдем к внутренней структуре файла Parquet и разберемся, как он хранит данные, используя группы строк, блоки столбцов, страницы, заголовки страниц, метаданные нижнего колонтитула, смещения, длины и статистику. На анимированном примере мы покажем, как строка преобразуется в столбцовый формат модулем записи Parquet. Затем мы смоделируем реальный запрос на чтение: SELECT Name FROM Employees WHERE City = 'Chicago'; Вы увидите, как модуль чтения Parquet переходит к нижнему колонтитулу, загружает метаданные, использует статистику групп строк, считывает только необходимые столбцы и страницы и сокращает количество ненужных операций чтения по сравнению с построчным хранением данных. Это видео полезно, если вы хотите понять Parquet глубже, чем просто поверхностно, и увидеть, что на самом деле происходит во время операций записи и чтения. Разделы 00:00 Введение 00:56 Глава 1: Ограничения построчного хранения 04:35 Глава 2: Обзор файлов Parquet 07:17 Глава 3: Программа записи файлов Parquet: преобразование строк в столбцы 18:40 Позиционные индексы в данных страницы 21:52 Глава 4: Объяснение работы программы чтения файлов Parquet с помощью моделирования запросов Рассмотренные темы Ограничения построчного хранения Зачем нужен Parquet Структура файла Parquet Заголовок и концевик файла Группы строк Фрагменты столбцов Страницы и заголовки страниц Метаданные нижнего колонтитула Смещения и длины Статистика Min-max Позиционные индексы в данных страницы Как программа записи Parquet хранит данные Как программа чтения Parquet считывает только необходимые данные Моделирование запроса с использованием SELECT Name FROM Employees WHERE City = 'Chicago' Основные выводы Построчное хранение предполагает чтение данных построчно, в то время как Parquet хранит данные по столбцам. Это позволяет аналитическим запросам считывать только необходимые столбцы и пропускать ненужные данные, используя метаданные и статистику. Именно поэтому Parquet широко используется в современных платформах данных, хранилищах данных, системах обработки больших данных и аналитических рабочих нагрузках.