O AWS Glue Data Quality agora oferece suporte a estatísticas de distribuição para criação de perfis de dados
O AWS Glue Data Quality agora oferece suporte a um novo Analisador de Distribuição que gera perfis de distribuição de frequência para seus dados. Usando esse novo Analisador de Distribuição na Linguagem de Definição de Qualidade de Dados (DQDL), você pode gerar histogramas para colunas numéricas e distribuições de valores para colunas categóricas, de data e booleanas. Com suporte para contagens de compartimentos personalizadas, você pode explorar a forma e os padrões de seus dados na granularidade que mais importa para seu caso de uso.
Entender como os dados são distribuídos é fundamental para criar pipelines de dados confiáveis. As estatísticas de distribuição ajudam você a identificar rapidamente distorções, discrepâncias e padrões inesperados em seus conjuntos de dados, sem escrever código personalizado. O recurso se integra diretamente aos seus conjuntos de regras DQDL existentes, para que você possa adicionar perfis de distribuição junto com suas verificações atuais de qualidade de dados em uma única execução de avaliação. As estatísticas de distribuição são armazenadas no Amazon S3 para futuras consultas por meio de serviços como o Amazon Athena e também são exibidas por meio de APIs, facilitando a integração de insights de distribuição em fluxos de trabalho de monitoramento e ferramentas de visualização, incluindo o SageMaker Unified Studio.
As estatísticas de distribuição do AWS Glue Data Quality estão disponíveis em todas as regiões comerciais da AWS e regiões da AWS GovCloud (EUA).
Para saber mais sobre o AWS Glue Data Quality, visite a documentação de qualidade de dados do AWS Glue. Para começar a usar o Distribution Analyzer, acesse a documentação do Analyzers.