Перейти к содержимому

Dataoops Episode 60 : Cloudera, la redécouverte

Architecture & Performance

0:00 / 0:00

Dataoops Episode 60 : Cloudera, la redécouverte

39 просмотров · 2 недели назад
Architecture & Performance
41 подписчик
39 просмотров · 2 недели назад
Dans ce 60e épisode de Dataoops, nous recevons Denis Fraval-Olivier de Cloudera pour comprendre ce qu'est devenu l'éditeur historiquement associé à Hadoop. Cloudera se présente aujourd'hui comme une plateforme complète couvrant l'ensemble du cycle de vie de la donnée : ingestion, streaming, stockage, data engineering, analytique, gouvernance et intelligence artificielle. L'épisode revient notamment sur l'importance de l'open source et des standards ouverts comme Apache Iceberg, mais aussi sur la stratégie hybride de Cloudera : proposer les mêmes services on-premises ou dans les principaux clouds publics et permettre aux entreprises de choisir leur infrastructure en fonction des coûts, des performances et des contraintes de souveraineté. Une large partie de la discussion est consacrée à l'IA générative. Cloudera mise notamment sur l'exécution privée ou air-gapped des LLM, sur son intégration avec NVIDIA NIM et sur un modèle économique davantage basé sur l'infrastructure que sur une facturation au token. Nous abordons également en détail la couche stockage avec S3, ADLS, GCS, HDFS et Apache Ozone, la gouvernance et le contrôle d'accès fin avec Apache Ranger, la fédération SQL avec Trino, ainsi que NiFi et Airflow pour l'ingestion et l'orchestration. Enfin, nous discutons RAG, recherche vectorielle, Apache Solr, Milvus, Pinecone et Neo4j, dans un écosystème IA qui reste encore très mouvant et dans lequel Cloudera privilégie pour l'instant l'ouverture et l'intégration plutôt que l'imposition d'une technologie unique.