La qualité des données d’AWS Glue prend désormais en charge les statistiques de distribution pour le profilage des données

Publié le: 27 juil. 2026

La qualité des données d’AWS Glue prend désormais en charge un nouvel analyseur de distribution qui génère des profils de distribution de fréquence pour vos données. Avec ce nouvel analyseur de distribution dans le langage de définition de la qualité des données (DQDL), vous pouvez générer des histogrammes pour les colonnes numériques et des distributions de valeurs pour les colonnes catégorielles, datées et booléennes. Grâce à la prise en charge du dénombrement de bacs personnalisé, vous pouvez explorer la forme et les modèles de vos données selon la granularité qui convient le mieux à votre cas d’utilisation.

Comprendre comment les données sont distribuées est essentiel pour créer des pipelines de données fiables. Les statistiques de distribution vous aident à identifier rapidement les asymétries, les valeurs aberrantes et les tendances inattendues dans vos jeux de données, sans avoir à écrire de code personnalisé. Cette fonctionnalité s’intègre directement à vos ensembles de règles DQDL existants, ce qui vous permet d’ajouter un profilage de distribution à vos contrôles de qualité des données actuels en une seule opération d’évaluation. Les statistiques de distribution sont stockées dans Amazon S3 pour les requêtes futures via des services tels qu’Amazon Athena, et sont également affichées via des API, ce qui facilite l’intégration des informations de distribution dans les flux de travail de surveillance et les outils de visualisation, notamment SageMaker Unified Studio.

Les statistiques de distribution de la qualité des données d’AWS Glue sont disponibles dans toutes les Régions AWS commerciales et les régions AWS GovCloud (US).

Pour en savoir plus sur la qualité des données de Glue, consultez la documentation relative à la qualité des données d’AWS Glue. Pour commencer à utiliser Distribution Analyzer, consultez la documentation relative aux analyseurs.