Функция «Качество данных AWS Glue» теперь поддерживает статистику распределения для профилирования данных
Функция «Качество данных AWS Glue» теперь поддерживает новый Анализатор распределения, который генерирует профили распределения частот для ваших данных. Используя этот новый Анализатор распределения на Языке определения качества данных (Data Quality Definition Language, DQDL), вы можете создавать гистограммы для числовых столбцов и распределения значений для столбцов категорий, дат и логических столбцов. Благодаря поддержке настраиваемого количества корзин вы можете изучать форму и закономерности данных с той степенью детализации, которая наиболее важна для вашего примера использования.
Понимание того, как распределяются данные, является основой для создания надежных конвейеров данных. Статистика распределения помогает быстро выявлять асимметрию, отклонения и неожиданные закономерности в наборах данных без написания специального кода. Эта возможность напрямую интегрируется с существующими наборами правил DQDL, поэтому вы можете добавить профилирование дистрибуции вместе с текущими проверками качества данных за один запуск оценки. Статистика распространения хранится в Amazon S3 для будущих запросов через такие сервисы, как Amazon Athena, а также отображается с помощью API, что упрощает интеграцию аналитических данных о распределении в рабочие процессы мониторинга и инструменты визуализации, включая Единую студию SageMaker.
Статистика распределения в функции «Качество данных AWS Glue» доступна во всех коммерческих регионах AWS и регионах AWS GovCloud (США).
Чтобы узнать больше о функции «Качество данных Glue», ознакомьтесь с документацией по «Качеству данных AWS Glue». Для начала работы с Анализатором распределения ознакомьтесь с документацией по Анализаторам.