Поддержка таблиц Apache Iceberg v3 в Amazon Redshift
Amazon Redshift теперь поддерживает чтение и запись в таблицах Apache Iceberg версии 3 из озера данных. Apache Iceberg представляет собой открытый формат таблиц, и в его версии 3 добавлено несколько новых функций. С запуском новой версии в Amazon Redshift появилась поддержка значений столбцов по умолчанию, отслеживания происхождении строк и векторов удаления.
Значения столбцов по умолчанию позволяют задавать начальное значение, применяемое Amazon Redshift в случае, если никакого значения не указано. Они упрощают трансформацию схем по мере добавления столбцов в существующие таблицы. Отслеживание происхождения строк создает псевдостолбцы с данными, идентифицирующими каждую строку и порядковый номер последнего обновления. Это позволяет создавать конвейеры инкрементных изменений и рабочие процессы сбора данных об изменениях (CDC), в которых будут обрабатываться только измененные строки. Векторы удаления заменяют файлы позиционного удаления из Iceberg версии 2 на компактные сжатые битовые отображения, которые обеспечивают более быстрое чтение и запись для рабочих нагрузок с высокой частотой изменения и удаления данных, таких как, например, удаление записей для соблюдения нормативных требований. Можно создать таблицу версии 3 с помощью инструкции CREATE TABLE <название_таблицы> ... USING ICEBERG TABLE PROPERTIES ('format-version' = '3') или обновить существующую таблицу версии 2 на месте с помощью инструкции ALTER TABLE <название_таблицы> SET TABLE PROPERTIES ('format-version' = '3').
Новый формат версии 3 поддерживается в выделенных и бессерверных кластерах Amazon Redshift на базе процессоров Graviton. См. дополнительные сведения о функциях Apache Iceberg версии 3 в документации Amazon Redshift.