跳至主要内容

Amazon S3

Amazon S3 Files

首个也是唯一一项能为您的数据提供功能齐全、高性能文件系统访问权限的云对象存储服务

什么是 S3 Files?

S3 Files 是一个共享文件系统,可将任何 AWS 计算直接与您存储在 Amazon S3 中的数据连接。它提供对您所有 S3 数据的快速、直接访问,以完整文件系统语义和低延迟性能的形式呈现为文件,且您的数据始终保留在 S3 中。这意味着基于文件的应用程序、代理和团队现在可以使用他们所依赖的工具,将 S3 数据作为文件系统进行访问和处理。您无需再复制数据,也无需在对象存储与文件系统存储之间来回传输数据。现在,贵公司基于文件的工具和应用程序可以直接从任何计算实例、容器和函数访问 S3 数据,并使用您的团队和代理已依赖的工具进行操作。

借助 S3 Files,Amazon S3 成为首个也是唯一一项能为您的数据提供功能齐全、高性能文件系统访问权限的云对象存储服务。S3 Files 既具备文件系统的性能与简便性,又兼具 S3 的可扩展性、持久性和成本效益。它消除了数据孤岛,解决了复杂的同步问题,也无需进行任何权衡。文件存储与对象存储完美融合于一体,不会出现性能妥协。 

优势

    您的应用程序、代理和用户期望以文件和文件夹的形式处理数据。有了 S3 Files,任何需要以文件形式处理 S3 数据的内容都可以直接实现。Python 库、ML 框架、CLI 实用程序和 shell 脚本都可以处理您的 S3 数据,无需自定义连接器,也无需学习新的 API。

    S3 Files 提供低延迟和每秒高达数 TB 的聚合读取吞吐量。通过智能缓存,性能专门针对文件工作负载进行了优化,最小化延迟并最大化吞吐量。S3 Files 智能地将您的活动工作集加载到高性能存储上,提供低延迟访问,同时保持成本与您正在积极使用的内容成比例。

    当工作流程需要对象和文件访问时,组织会在存储系统之间复制数据。S3 Files 消除了重复存储和保持单独系统同步所需的管道。您的数据存在于 S3 中并保留在 S3 中,可通过文件和对象接口同时访问。一份副本,一个管理位置,零同步开销。

    S3 Files 基于 S3 的按实际使用量付费模式构建,无需预置容量,无最低承诺。您的工作负载在 S3 内自动扩展,适用于高性能、可扩展的使用案例。存储随数据增长自动扩展,从单个数据集到 PB 级,成本与活动工作集成比例,无需管理基础设施。与在 S3 和单独文件系统之间循环数据相比,S3 Files 成本降低高达 90%。

数据点

90%
与在 S3 和单独文件系统之间循环数据相比,成本降低高达 90%
1000 万+
每存储桶文件系统 IOPS
4TB/s+
每秒数 TB 的聚合读取吞吐量
2.5 万
计算资源可以同时访问同一 S3 文件系统

S3 Files 工作原理

S3 Files 就像一个传统的高性能文件系统,可以被任何基于 Linux 的计算资源访问,但它对文件和文件夹的视图反映的是您 S3 存储桶中的内容。S3 Files 使用 Amazon EFS 构建,它会智能地将您的活跃工作集加载到高性能存储上。这为频繁访问的数据提供了低延迟,同时使成本与您活跃使用的内容成比例。当您读取文件时,S3 Files 会将部分文件元数据和内容延迟加载到高性能存储上。不符合您配置的文件大小阈值的数据将直接从 S3 读取,不涉及文件系统存储。当您写入数据时,您的写入会先发送到高持久性的高性能存储,然后同步回 S3 以保持存储桶的一致性。在可配置时间窗口(1 到 365 天,默认为 30 天)内未被访问的数据将自动从该存储中过期,因此您只需为活跃使用的内容付费,而您的权威数据始终保留在 S3 中。

特征和功能

    任何新的或现有的 S3 存储桶都可以作为文件系统访问,无需数据迁移。您现有的基于文件的应用程序和工具的工作方式与今天完全相同。无需更改代码,无需自定义连接器,无需学习新的 API。使用前缀精确定位基于文件的工作负载所需的内容,因此只有您的活动数据集被放置在文件系统的高性能存储上。更改自动同步回您的 S3 存储桶。您的完整数据集保留在 S3 中,按需可用,而您的工作负载精确处理它们所需的数据。借助 S3 Files,您可通过标准 NFS 文件接口以低延迟执行所有文件操作。

    通过共享文件系统,从多个计算资源同时访问同一 S3 存储桶。专为协作构建,S3 Files 支持跨任何 AWS 计算资源(包括 Lambda、EC2、ECS、EKS、Fargate 和 Batch)最多 25,000 个活动连接。它们都可以实时读写同一数据,具有 NFS 关闭-打开一致性。这使得 S3 Files 非常适合多个用户、应用程序或代理需要同时共享访问数据的协作工作负载。

    与在 S3 和单独文件系统之间循环数据相比,S3 Files 成本降低高达 90%。它通过智能地将您正在积极使用的数据加载到高性能存储上,保持成本与活动工作集成比例。您配置文件大小阈值和保留窗口,S3 Files 自动管理哪些内容保留在高性能存储上,哪些内容直接从 S3 读取。对于大读取(1 MiB 或更大),数据直接从 S3 流式传输,即使它驻留在高性能存储上。由于 S3 针对高吞吐量进行了优化,这些读取仅产生标准 S3 GET 请求费用,无文件系统费用。当您写入数据时,S3 Files 在提交到 S3 之前在高性能存储上批量处理写入,减少 S3 请求费用。在配置窗口内未被访问的数据自动过期,因此您只需为正在积极使用的内容付费,同时保持对 S3 中完整数据集的完全访问。

    S3 Files 通过文件和对象接口同时让您完全访问整个 S3 存储桶。您基于文件的应用程序工作方式与今天完全相同。您的基于对象的应用程序和工作流程保持不变。S3 Files 智能缓存文件工作负载所需的数据以实现高性能,而 S3 的全面规模、耐久性和经济性仍是您数据存储的基础。无需修改,无需权衡,两个独立系统之间无需协调。

重点行业

生命科学与医疗保健

生命科学组织通过生物信息学管道处理来自 S3 的 PB 级测序数据,这些管道需要文件系统操作来创建比对文件、合并结果和更新变异调用。医疗保健提供商将医学图像存储在 S3 中,并为诊断工作站和 PACS 系统提供文件系统访问。研究机构支持临床试验数据的协作分析,同时通过加密和访问控制将 S3 作为单一事实来源,具有完整的审计跟踪记录和法规合规性。

Missing alt text value

金融服务

量化研究人员构建和测试模型,使用 PB 级历史市场数据,运行需要共享、低延迟访问实时数据集的模拟和回测。维护数据的单独本地副本会导致版本漂移、重复成本和更慢的迭代周期。通过 S3 Files,团队中的每个研究人员都可以同时使用同一个实时 S3 数据集,日内风险计算具有低延迟,结果可立即用于每个下游工作流程。研究周期加速,整个团队始终使用单一事实来源。

Missing alt text value

媒体和娱乐

制作团队、VFX 工作室与渲染农场依赖基于文件的工具在整个制作生命周期中访问和处理素材和资产为活动制作和长期归档管理单独的存储系统会增加每个项目的成本、复杂性和阻力。通过 S3 Files,艺术家和编辑直接使用 S3 和他们已有的工具工作,同时相同内容仍可通过 S3 API 用于转码和 CDN 交付,全部来自一份副本,无需同步。制作更快,内容始终在每个工作流程需要的地方。

Missing alt text value

制造和工程

工程团队运行 CAD 工作流程,在整个运行过程中生成和更新大文件,将结果存储在 S3 中以实现长期保留、版本控制和跨团队协作。以前,要将模拟工具的结果导入 S3 进行共享访问,需要手动传输和管道开销。通过 S3 Files,模拟工具在运行进行时逐步将结果写入 S3,全球各地的团队通过共享挂载存储桶实时查看更新。每次迭代都通过 S3 版本控制自动保留,因此工程师花更少时间管理数据,更多时间迭代设计。

Missing alt text value

使用案例

    人工智能代理不仅读取数据,它们还基于数据采取行动、生成新数据、与其他代理协调并在任务间维护状态。代理依赖基于文件的工具,如 Python 库、CLI 实用程序和 shell 脚本,它们需要一个地方来读取输入、写入输出、持久化内存和日志,并与管道中的其他代理共享中间状态。S3 Files 为代理在一个地方提供所有这些功能。每个代理访问同一 S3 文件系统,使用标准文件操作处理共享数据,无需学习特定服务的 API,也无需构建协调层。S3 成为您整个代理实例集的共享操作环境,而不仅仅是工作完成后数据存放的地方。

    ML 工作负载有一个特定问题,对象存储和传统文件系统单独都无法很好地解决。训练数据集存在于 S3 中是因为其规模和成本,但预处理管道、特征工程脚本和训练框架都期望处理文件。结果是每次运行前都有一个复制和暂存步骤:从 S3 拉取数据,移动到文件系统,处理,然后将结果推回。这一步为每次迭代增加了时间、成本、复杂性和另一个故障点。S3 Files 消除了这一开销。数据科学家和 ML 工程师可以通过文件系统直接处理 S3 训练数据,并在原地运行管道。预处理自动写回同一存储桶。多个训练任务可以同时读取同一数据集,无需重复。更快的迭代带来更快的质量洞察时间,因为数据始终是最新的、始终在一个地方、始终可用。

    跨越应用程序、用户、管道和工具的现代工作流程是为读写文件而构建的。它们浏览目录、打开数据集、附加结果并使用标准文件操作保存输出。以前将这些应用程序连接到 S3 需要先将数据从 S3 复制出来,因为 S3 基于 API 的模型与期望文件系统的软件不兼容。S3 Files 移除了这一障碍。您现有的应用程序挂载 S3 文件系统并像今天一样处理数据,无需更改代码、无需自定义连接器、无需数据移动。应用程序不知道它在与 S3 通信。它只是正常工作。

    使您的 S3 数据在任何计算资源上原生可用。通过 S3 Files,您的存储桶现在作为挂载点出现在计算资源上,使研究人员、分析师和数据科学家能够使用他们已有的工具浏览目录、打开数据集、运行模拟和保存结果。您的团队使用标准文件操作从任何计算资源直接访问 S3 数据,所有成员同时读写同一存储桶。

客户评价

Bayer

Bayer 是医疗保健和营养领域的全球领导者,使命是“人人健康,无人饥饿”。 该公司开发药品和农产品,旨在应对与全球人口增长相关的挑战。Bayer 投资于生命科学研究和数据驱动方法,目标是推进人类健康成果和支持可持续食品生产实践。

“Bayer 的研究团队处理存储在 S3 中的大量科学数据。在 S3 Files 之前,访问这些数据意味着在分析开始前将整个数据集下载到本地存储。这造成了延迟,并要求我们在研究基础设施中维护额外的副本。S3 Files 通过让我们的数据科学家根据现有安全和访问控制协议将 S3 数据直接挂载为文件系统来简化这一工作流程。研究人员现在可以打开数据集、运行分析并在共享结果上进行协作,无需等待下载或管理数据移动。这一转变简化了我们的研发运营,减少了基础设施开销,使我们的团队能够专注于研究和创新。”

Ben Gonzalez,Bayer 高级云工程师

Bayer corporate logo in green and blue circular design on a transparent background.

Deloitte

Deloitte 是专业服务领域的全球领导者,在 150 个国家拥有约 47 万名专业人员,提供跨行业的咨询、审计、税务和咨询服务。

“在我们为客户构建人工智能代理解决方案时,有效的协调至关重要。Amazon S3 Files 是一个差异化因素,为我们的代理式架构提供了一个共享工作空间,代理可以在其中保留上下文、交换中间结果并在复杂分析管道中组织工作,同时使用标准文件操作。能够将 S3 作为代理日志、状态和检查点的本地驱动器,这可以简化多代理设计、提升自动化水平并加速交付速度。”

Chris Jangareddy,Deloitte Consulting LLP 董事总经理,AWS 联盟 AI 和数据负责人

Missing alt text value

Cloudsmith

Cloudsmith 保护人工智能驱动的软件供应链。管理二进制制品并保护您的企业免受恶意软件包和漏洞的侵害。代理式人工智能开发意味着更多软件、更多依赖项和更多风险。Cloudsmith 为您的团队提供预先验证的制品的精选存储库,他们可以以人工智能的规模和速度安全地进行构建。

“我们的平台每天处理数十万个构件,依赖 S3 和文件系统来处理复杂的包处理和同步工作流程,以保持客户的软件供应链安全。这引入了显著的运营开销、延迟和维护复杂性。我们对使用 S3 Files 感到兴奋,我们的 Fargate 容器和 Lambda 函数可以直接将 S3 数据作为文件系统访问,消除了自定义同步逻辑的需要。这简化了我们的架构,缩短了开发人员、系统和代理的包可用时间,并保持与现有基于文件的工具和制品处理工作流程的兼容性,这些对我们的全球运营至关重要。”

Ronan O'Dulaing,Cloudsmith 工程副总裁

Missing alt text value

Presidio

Presidio 是一家顶级的 IT 服务和解决方案提供商,帮助组织将当今技术与未来创新连接起来。作为 AWS 主 要咨询合作伙伴,Presidio 通过云基础设施设计、部署和管理,指导金融服务、医疗保健、媒体和娱乐领域的企业。

“Amazon S3 Files 通过将对象存储与基于文件的工作负载连接来推进迁移与现代化,使客户能够通过熟悉的文件接口访问 S3 数据,同时保留 S3 的耐久性和可扩展性。对于正在向 AWS 转型的组织,这为现代化遗留应用程序提供了灵活的路径,无需破坏性重写或冗余存储。

在 Presidio,我们将 Amazon S3 Files 视为人工智能驱动工作负载的关键推动者,将文件和对象存储整合到单一基础中,消除重复系统和运营复杂性。随着客户推进生成式人工智能、高级分析和代理式使用案例,这一点变得尤为强大,能够实现对共享数据集的低延迟访问,并帮助团队高效地从开发过渡到生产。”

Ken Ordini,Presidio 工程副总裁

Presidio logo in blue text on a white background.

Snorkel AI

Snorkel AI 是一家前沿人工智能数据实验室,帮助团队构建高性能前沿和代理式人工智能背后的数据和环境。该公司将平台技术与研究驱动的数据开发相结合,为现实世界的人工智能系统创建数据集、基准、评估和定制解决方案。

“在 Snorkel AI,我们专注于构建前沿数据集。我们的工作涵盖完整的人工智能生命周期,从为最具挑战性的代理任务提供的精选数据集,如 Snorkel Data Series,到评估、强化学习和生产规模的代理模拟。借助 S3 Files,我们的团队、代理和评估人员可以通过文件接口访问 S3 中的数据,无需在系统间复制数据或等待同步任务。这对强化学习和代理式工作负载尤其有价值,我们并行运行许多环境和模拟,支持跨多个代理的共享工作空间,并大规模执行长周期任务序列。”

Rustem Feyzkhanov,Snorkel AI 人工智能基础工程经理

Missing alt text value

Torc Robotics

Torc Robotics 是一家领先的自动驾驶汽车软件公司,用 4 级自动驾驶 8 级卡车革新货运。凭借其 TorcDrive 虚拟驾驶员软件,该公司正在将自动驾驶卡车商业化,为货运行业带来安全、持续的创新。

“Amazon S3 Files 将使我们的数据科学家能够使用标准文件操作直接在 S3 中访问机器学习训练数据,有效地将 S3 作为自动驾驶工作流程的本地驱动器。我们的开发人员可以将 PB 级传感器数据、模拟结果和模型检查点直接作为基础数据层在 S3 中处理。这简化了数据访问和处理,减少了构建物理人工智能管道的时间和复杂性,使 Torc 能够交付 AV 3.0 TorcDrive 可验证人工智能堆栈、数据循环和世界模拟,用于安全、可扩展自动驾驶卡车的训练和验证。”

Fiete Botschen,Torc Robotics 机器学习模型开发工程总监

Missing alt text value

Qube Research & Technologies(QRT)

Qube Research & Technologies(QRT)是一家全球量化和系统化投资管理公司,利用先进数学模型和高性能计算在全球市场识别交易机会。该公司的研究人员实时分析海量数据集,将历史市场数据与实时数据流相结合,开发和优化复杂的交易算法以驱动投资决策。

“在 QRT,我们的研究周期依赖于快速的迭代实验。我们的研究人员探索 PB 级逐笔市场数据、另类数据集和专有信号,以构建和回测跨资产类别的系统化策略。从历史上看,这需要在 S3 之外维护单独的高性能文件存储,迫使团队在我们的中央数据湖和计算工作站之间不断同步数据。S3 Files 改变了这一局面。我们的研究人员现在可以从工作站直接处理 S3 中的数据,运行回测、分析结果并在更大数据集上迭代策略,无需复制数据或管理 ETL 管道。这将多步骤工作流程压缩为无缝的研究循环。对我们来说,这意味着更快获得见解、更少的冗余存储成本,以及更多工程精力集中在它应该在的地方:构建更好的系统化策略。”

Jon Fautley,QRT 云基础设施负责人

Missing alt text value

找到今天要查找的内容了吗?

请提供您的意见,以便我们改进网页内容的质量