AWS Glue Data Quality unterstützt jetzt Verteilungsstatistiken für Datenprofilerstellung
AWS Glue Data Quality unterstützt jetzt einen neuen Distribution Analyzer, der Frequenzverteilungsprofile für Ihre Daten generiert. Mit diesem neuen Distribution Analyzer in der Data Quality Definition Language (DQDL) können Sie Histogramme für numerische Spalten und Wertverteilungen für kategoriale, Datums- und boolesche Spalten generieren. Dank der Unterstützung für benutzerdefinierte Bin-Counts können Sie die Form und Muster Ihrer Daten mit der Granularität untersuchen, die für Ihren Anwendungsfall am wichtigsten ist.
Zu verstehen, wie Daten verteilt werden, ist für den Aufbau zuverlässiger Datenpipelines von grundlegender Bedeutung. Mithilfe von Verteilungsstatistiken können Sie Verzerrungen, Ausreißer und unerwartete Muster in Ihren Datensätzen schnell erkennen, ohne benutzerdefinierten Code schreiben zu müssen. Die Funktion lässt sich direkt in Ihre vorhandenen DQDL-Regelsätze integrieren, sodass Sie in einem einzigen Testlauf neben Ihren aktuellen Datenqualitätsprüfungen auch Verteilungsprofile hinzufügen können. Verteilungsstatistiken werden in Amazon S3 für zukünftige Abfragen über Dienste wie Amazon Athena gespeichert und auch über APIs abgerufen, sodass Verteilungsinformationen einfach in Überwachungsworkflows und Visualisierungstools wie SageMaker Unified Studio integriert werden können.
Die Statistiken zur Verteilung von AWS Glue Data Quality sind in allen kommerziellen AWS-Regionen und AWS-GovCloud-Regionen (USA) verfügbar.
Weitere Informationen zu Glue Data Quality finden Sie in der Dokumentation zu AWS Glue Data Quality. Informationen zum Einstieg in die Verwendung von Distribution Analyzer finden Sie in der Analyzers-Dokumentation.