Файлы Parquet: построчное и столбцовое хранение, глубокий разбор записи и чтения с визуализацией
Vishwas Pawar
0:00 / 0:00
Файлы Parquet: построчное и столбцовое хранение, глубокий разбор записи и чтения с визуализацией
315 просмотров · 3 месяца назад
Vishwas Pawar
5,37 тыс. подписчиков
315 просмотров · 3 месяца назад
В этом видео мы подробно рассмотрим, как работает файл Parquet и почему он так полезен для аналитических задач.
Мы начнем с рассмотрения ограничений традиционного построчного хранения данных, когда запрос может считывать ненужные строки и столбцы. Затем мы перейдем к внутренней структуре файла Parquet и разберемся, как он хранит данные, используя группы строк, блоки столбцов, страницы, заголовки страниц, метаданные нижнего колонтитула, смещения, длины и статистику.
На анимированном примере мы покажем, как строка преобразуется в столбцовый формат модулем записи Parquet. Затем мы смоделируем реальный запрос на чтение:
SELECT Name
FROM Employees
WHERE City = 'Chicago';
Вы увидите, как модуль чтения Parquet переходит к нижнему колонтитулу, загружает метаданные, использует статистику групп строк, считывает только необходимые столбцы и страницы и сокращает количество ненужных операций чтения по сравнению с построчным хранением данных.
Это видео полезно, если вы хотите понять Parquet глубже, чем просто поверхностно, и увидеть, что на самом деле происходит во время операций записи и чтения.
Разделы
00:00 Введение
00:56 Глава 1: Ограничения построчного хранения
04:35 Глава 2: Обзор файлов Parquet
07:17 Глава 3: Программа записи файлов Parquet: преобразование строк в столбцы
18:40 Позиционные индексы в данных страницы
21:52 Глава 4: Объяснение работы программы чтения файлов Parquet с помощью моделирования запросов
Рассмотренные темы
Ограничения построчного хранения
Зачем нужен Parquet
Структура файла Parquet
Заголовок и концевик файла
Группы строк
Фрагменты столбцов
Страницы и заголовки страниц
Метаданные нижнего колонтитула
Смещения и длины
Статистика Min-max
Позиционные индексы в данных страницы
Как программа записи Parquet хранит данные
Как программа чтения Parquet считывает только необходимые данные
Моделирование запроса с использованием SELECT Name FROM Employees WHERE City = 'Chicago'
Основные выводы
Построчное хранение предполагает чтение данных построчно, в то время как Parquet хранит данные по столбцам. Это позволяет аналитическим запросам считывать только необходимые столбцы и пропускать ненужные данные, используя метаданные и статистику.
Именно поэтому Parquet широко используется в современных платформах данных, хранилищах данных, системах обработки больших данных и аналитических рабочих нагрузках.