Anterior 使用 Amazon Bedrock 和 Llama 将临床审查时间缩短 75%
作者:Harshvardhan Chunawala、Chakravarthy Nagarajan、Khadija Mahmoud、Anuj Iravane | 2026 年 4 月 22 日
将数百页文件转化为可操作的临床洞察
Anterior 是一家由临床医生领导的人工智能公司,致力于为医疗保健支付者(保险公司)构建自动化解决方案。该公司着手解决医疗保健领域最棘手的数据问题之一,即识别和结构化通常以数百页非结构化记录形式到达的临床文件。在客户的 Amazon Web Services(AWS)环境中实施来自 Amazon Bedrock 上的 Meta 的 Llama 模型来驱动文件识别后,Anterior 在满足严格医疗保健数据治理要求的同时,实现了生产级性能。通过这种方法,Anterior 实现了完整的文件提取、提升了元数据准确性,并启用了下游自动化,将手动临床审查时间缩短了 75%。
解决医疗保健领域的文件识别难题
在美国,一个价值 5 万亿美元的产业中,每年的医疗管理成本超过 9500 亿美元。其中很大一部分负担来自健康计划内部的临床审查工作流程,医生和护士需要手动审阅大量医疗记录,以批准治疗方案、验证承保范围并管理患者护理。Anterior 是一家由临床医生领导的人工智能公司,专注于为医疗保健支付者(即处于提供者和患者交汇点的组织)自动化这些工作流程。
这些工作流程的核心是一项听起来简单、实则复杂的任务:在人工智能对临床案例进行推理之前,它必须先理解自己看到的内容。文件识别是所有下游自动化的前提条件。Anterior 必须将每个传入的临床数据包分割成单独的文件,确定每个文件的起始和结束位置,并提取结构化元数据,包括文件类型、标题、作者和创建日期。只有完成这些步骤,临床自动化才能继续进行 — 无论是将核磁共振成像报告路由到事先授权审查的正确环节、为临床医生显示最近的影像,还是验证文件是否支持推荐的治疗方案。然而,临床数据包可能长达数百页,并且以传真、扫描 PDF 或合并的多文件形式送达。它们可能包含影像、表格、表单甚至手写笔记,长期以来,传统人工智能和机器学习方法难以在生产规模下可靠地处理这些内容。
出错的代价非常高昂。“即使是文件识别中的微小错误,也可能在下游产生连锁反应,因为您的临床决策是基于不完整或不正确的信息做出的。”Anterior 临床科学家、医学博士 Khadija Mahmoud 表示。错误识别的文件边界可能导致从患者记录的错误部分提取临床信息,而丢失页面则可能造成合规缺口。任何能够处理生产级文件识别的模型,还必须满足严格的医疗保健数据治理要求。Anterior 的许多大型客户要求,所有人工智能处理(包括对受保护健康信息(PHI)的 LLM 推理)必须完全在其 AWS 环境中进行,因此无法接受外部 API 或第三方基础设施。
为临床自动化构建可扩展管道
Anterior 实施了一套由在 Amazon Bedrock 上运行的 Meta Llama 模型驱动的文件识别工作流。该架构在客户自己的 AWS 环境中端到端处理复杂的临床文件包,因此患者数据始终不会离开该边界。该工作流采用两阶段管道设计。第一阶段,使用光学字符识别(OCR)和布局感知解析处理大型临床 PDF。每一页都会转换为结构化文本提取,同时保留页面引用和唯一标识符。第二阶段,语言模型对这些解析后的提取内容进行分析,以确定文件边界、分类文件类型,并提取标题、作者、创建日期和临床描述等元数据。这一阶段由 Amazon Bedrock 上的 Llama 模型完成。
Anterior 使用相同的提示、数据集和评估标准,对 Llama 4 Maverick 17B 和 Llama 4 Scout 17B 与前沿规模的专有多模态模型进行了对比评估。整个评估完全在 AWS 基础设施内进行,并从准确性、完整性、一致性和延迟等方面衡量了生产就绪程度。数据集通过 Anterior 的合成数据管道生成,并由临床科学家精心策划,以反映真实世界的复杂性:模糊的格式、多文件包以及边缘案例。Llama 成为强有力的候选者,原因有几点:它支持多模态输入(这与临床数据的固有多模态特性相符),能够对高吞吐量工作负载进行高效推理,并提供大型上下文窗口,可轻松处理冗长的临床文件包。它也是可调优性最强的开放权重模型之一,这让 Anterior 能够通过提示和系统级约束来定制模型行为,并探索针对特定临床任务进行微调的更小专业模型,而非仅依赖前沿规模模型。
在 Amazon Bedrock 上运行 Llama,使公司的临床医生和工程师团队能够专注于解决临床问题,而无需管理基础设施。Bedrock 提供统一的界面来评估和部署基础模型,同时直接与 AWS 环境集成。“我们合作的许多大型健康计划都提出同样的问题:‘我们能否在自己的 AWS 环境中对 PHI 运行人工智能?’ Bedrock 托管的 Llama 模型让我们能够不打折扣地给出肯定的回答。”Anterior 应用人工智能负责人 Anuj Iravane 表示。Bedrock 还保留了灵活性:随着临床需求的变化,Anterior 可以评估其他模型或部署自定义微调版本,而无需重新构建架构。
加快临床决策并提高运营效率
在一组由临床医生精心策划的合成临床案例数据集上,Llama 4 Maverick 17B 和 Llama 4 Scout 17B 均在临床文件识别任务中展现出生产级性能。尽管仅使用 17B 个活跃参数(置于更大的模型架构中),这两款模型仍匹配了拥有数千亿参数的前沿规模模型,同时运行效率更高。它们实现了完整的页面覆盖率,即临床数据包中的每一页都被精确分配一次,没有遗漏或重复内容。在元数据提取方面的表现尤为突出。Llama 模型在识别文件作者和描述等关键信息时,达到了或超过了前沿模型的基准水平。作者识别准确率最高可达 97%,而前沿模型为 93.5%;描述忠实度则达到 98.4%。“我们印象深刻,”Iravane 表示,“Bedrock 上的 Llama 模型以远低于前沿模型的成本达到了我们的基准水平,而且在元数据提取方面,它们的表现实际上更好。您并不需要最大的模型来解决医疗保健领域最棘手的问题。”
各模型的延迟表现相当,但在 Bedrock 上运行的较小 Llama 模型在规模化场景下的效率优势会成倍放大。随着文件数量的增长,Anterior 能够在不牺牲准确性的前提下,以更低的单份文件成本处理更多案例。这对医疗工作流程的下游影响非常显著。在事先授权审查中,Anterior 平台将手动临床审查时间缩短了 75%,同时保持了 99.24% 的临床准确率。KLAS Research 的一项案例研究显示,该系统将患者等待癌症治疗批准的时间从几天或几周缩短至仅 155 秒。对于一家为大约 100 万名受保人提供服务的区域医疗保健组织而言,这些改进每年可转化为约 3000 万美元的运营成本节约。更快的文件理解最终意味着更快的临床决策以及患者更快获得护理服务。
Anterior 在六周内就从初始集成推进到部署。Llama 模型现已成为该公司生产环境中文件识别工作流的一部分,为多家企业客户提供服务。这些成果也验证了一种更广泛的架构思路:托管在 Amazon Bedrock 上的较小开放权重模型能够在医疗工作流程中与前沿规模的通用模型竞争。“美国的大部分医疗保健都运行在 AWS 上,”Iravane 说,“证明 Bedrock 上的 Llama 模型能够匹配前沿性能,意味着我们的客户可以更快部署、更好地控制成本,并保持他们所需的安全态势。”
Harshvardhan Chunawala
Chakravarthy Nagarajan
Chakravarthy Nagarajan 是一位专注于机器学习领域的首席解决方案架构师。在目前的职位上,他利用机器学习和生成式人工智能解决方案帮助客户解决现实世界中复杂的业务难题。他专注于模型定制化,帮助企业通过定制化技术充分释放大语言模型(LLM)的潜力。
Khadija Mahmoud
医学博士 Khadija Mahmoud 是 Anterior 公司应用人工智能领域的临床科学家,致力于处理临床数据集,并在现实医疗系统中开展基准测试与模型评测工作。她的研究重点包括临床推理、AI 中的偏见与公平性,以及机器学习在医疗保健领域的安全部署,相关研究成果已在同行评审期刊上发表。她拥有伦敦帝国理工学院颁发的人工智能(医疗保健方向)理学硕士学位和医学博士学位。
Anuj Iravane
Anuj Iravane 负责 Anterior 公司的人工智能业务,深耕科研和生产的交叉领域,致力于构建可靠、合规且具备自我提升能力的临床推理代理。在加入 Anterior 之前,他曾在 Amazon 从事推荐系统相关工作。他拥有西北大学计算机科学理学学士学位。除了人工智能领域的工作外,他还是印度独立电影界的制片人和导演。
找到今天要查找的内容了吗?
请提供您的意见,以便我们改进网页内容的质量