Introduction au Big Data
Quand le volume, la vitesse ou la variété dépassent la machine unique : architectures distribuées et traitement à l'échelle.
Définitions et enjeux
Volume, vélocité, variété, véracité, valeur. Quand le Big Data est justifié et quand il ne l'est pas.
Stockage distribué
Systèmes de fichiers distribués, réplication, partitionnement, stockage objet, lacs de données, formats colonnes.
Traitement distribué
MapReduce, Spark, transformations et actions, évaluation paresseuse, partitions, remaniement.
Bases NoSQL
Familles clé-valeur, document, colonne, graphe. Théorème CAP, cohérence à terme, choix selon l'usage.
Flux et temps réel
Traitement en flux, Kafka, fenêtres temporelles, différence lot et flux, garanties de livraison.
Architecture et coûts
Architecture de données de bout en bout, catalogue, traçabilité, coût du stockage et du calcul, contraintes locales de connectivité.