Apache Iceberg для низколатентных нагрузок: ускорение запросов с помощью Iceberg-Rust и Cheetah
Apache Iceberg
0:00 / 0:00
Apache Iceberg для низколатентных нагрузок: ускорение запросов с помощью Iceberg-Rust и Cheetah
803 просмотра · 1 год назад
Apache Iceberg
3,62 тыс. подписчиков
803 просмотра · 1 год назад
Сессия на #icebergSummit 2025, представленная Скоттом Доннелли из Balyasny Asset Management.
Описание сессии:
#ApacheIceberg стал основным форматом таблиц для управления хранилищами данных петабайтного масштаба, при этом реализация механизмов запросов обычно отвечает в лучшем случае за несколько секунд. В среде хедж-фондов наши пользователи требуют более быстрых ответов: производительность запросов к таблицам Iceberg менее секунды. В этом докладе будет рассказано о пути, который мы прошли при разработке Cheetah, высокопроизводительного распределенного сервиса Arrow Flight, способного предоставлять ответы на запросы к таблицам Iceberg всего за 60 мс. Для достижения этой цели было сделано множество предложений для iceberg-rust, таких как пропуск страниц Parquet — iceberg-rust стал первой из основных библиотек Apache Iceberg, реализовавшей эту возможность.
Cheetah идет еще дальше, реализуя кэширование разобранных метаданных Parquet и разделов необработанных данных, а также распределенный сегментированный кэш, чтобы обеспечить упомянутые выше уровни производительности.
В этом докладе будет рассмотрено, как Cheetah расширяет возможности Iceberg, какие оптимизации позволяют выполнять запросы со скоростью менее секунды, а также эволюция iceberg-rust для поддержки этих новых рабочих нагрузок. Участники получат представление об оптимизации Iceberg для аналитики в реальном времени, о лучших практиках настройки производительности и обосновают необходимость интеграции этих инноваций обратно в сам Apache Iceberg-rust.