FastBCP : l'export de données parallélisé
DATANOSCO
0:00 / 0:00
FastBCP : l'export de données parallélisé
61 просмотр · 3 месяца назад
DATANOSCO
937 подписчиков
61 просмотр · 3 месяца назад
FastBCP, développé par arpe.io, est conçu pour exporter rapidement des données depuis diverses bases de données relationnelles (PostgreSQL, SQL Server, Oracle, etc.) vers différents formats de fichiers tels que CSV, Parquet, JSON et Excel, et vers des destinations de stockage on-prem ou dans le cloud (AWS S3, Azure, Google Cloud Storage). On aborde la technique d'intra-parallélisme, qui permettent de découper des tables volumineuses en "morceaux" pour optimiser la vitesse de transfert et l'utilisation des cœurs de CPU, répondant ainsi aux limitations des systèmes mono-threadés. L'outil est une solution simple à intégrer via ligne de commande, aussi efficace pour les migrations de bases de données complètes, le tout proposé à un prix très abordable.
Alors que la puissance de calcul disponible a été multipliée par 75 en vingt ans grâce à la multiplication des cœurs CPU, les outils traditionnels de transfert de données peinent à exploiter cette évolution matérielle. La société arpe.io adresse cette problématique avec plusieurs outils, dont FastBCP, un utilitaire en ligne de commande qui repense fondamentalement l'approche du transfert de données depuis les bases relationnelles.
FastBCP se distingue par son architecture axée sur le parallélisme intra-table. L'outil découpe une table volumineuse en plusieurs segments traités simultanément par différents cœurs. Cette approche se décline en plusieurs stratégies adaptées aux spécificités de chaque système source : "ctid" pour PostgreSQL, "rowid" pour Oracle, DataSlice pour Netezza, PhysLoc pour SQL Server mais aussi "RangeId" pour les tables avec identifiants séquentiels, Ntile, Random et DataDriven viennent compléter les techniques de parallélisation.
La méthode "DataDriven" offre un double avantage : elle optimise la parallélisation tout en créant automatiquement une structure de partitionnement selon une logique métier, par exemple en fonction de l'année d'une commande. Elle facilite également les chargements différentiels, permettant de ne recharger que les données récentes lors des synchronisations ultérieures.
L'outil fonctionne en streaming, lisant directement depuis la source et écrivant vers la destination sans étape intermédiaire. Cette architecture limite drastiquement la consommation de mémoire et permet des transferts directs vers le cloud via des "multipart uploads", éliminant le besoin de stockage temporaire local.
Les sources possibles sont PostgreSQL, SQL Server, Oracle, MySQL, Netezza, SAP HANA et Teradata. Les formats de sortie sont variés : parquet, csv , json, bson, excel ... vers l'on-prem ou le cloud (AWS S3, Azure ABS et ADLS Gen2, GCS, et les S3 compatibles comme OVH ou Minio)
LakeXpress un autre logiciel Arpe.io, qui s'appuie sur FastBCP, peut migrer des bases de données entières vers le cloud en une seule ligne de commande. L'outil génère également des métadonnées au format CDM, facilitant la recréation automatique des schémas dans les plateformes cloud comme Snowflake ou Databricks.
Les résultats terrain démontrent l'impact de cette approche. Au Ministère de la Justice, un traitement d'export initialement dimensionné à 15 heures a été ramené à 8 minutes avec parallélisation.
Le modèle commercial adopté par arpe.io tranche avec les pratiques du secteur. La licence mensuelle est proposée à un prix fixe, sans variable liée au volume de données, au nombre d'utilisateurs ou de cœurs utilisés. Cette tarification fixe offre une prévisibilité totale des coûts. Des versions d'essai sont disponibles librement, et la société propose un accompagnement conseil pour optimiser les configurations des bases sources et cibles.
Pour en savoir plus : https://arpe.io