什么是人机协同?
为什么人机协同很重要?
尽管机器学习(ML)中有许多自动化流程,但创建和改进机器学习应用程序需要人工干预。诸如模型不确定性、决策过程中的模糊性或罕见的边缘案例之类的事件都可能导致模型输出不准确。人机协同方法增加了人工干预来手动解决这些问题。
在机器学习训练管线的关键点,例如数据标注、模型验证、更正、升级和主动学习,人类可以审查机器学习工具做出的决策,并在需要时对其进行完善。
在某些情况下,人类在接触点检查中甚至可能什么都不做。在审查机器学习模型输出及其决策后,该人员可能会同意模型输出并进行确认。然而,这种将人类纳入流程并进行确认的监督,是朝着提高机器学习精度和减少错误迈出的重要一步。
在具有高后果决策的模型中,例如医学模型或法律体系,人工监督尤其重要。人工检查输出有助于避免错误并验证模型是否按预期运行。
以下是人类参与机器学习过程的一些具体案例。
模型准确性和持续改进
尽管机器学习中的许多模型改进都是自主进行的,但人类可以介入,手动更正某些错误。具体而详细的反馈或纠正措施可以为机器学习模型提供更多信息,以便将其纳入再训练周期。少量的人类反馈可以大大改善应对措施和增强未来案例的决策过程。
一些机器学习模型采用主动学习,这是一种训练策略,模型会在训练过程中的特定时刻请求人工干预。这些请求发生在模型置信度最低的时候。例如,如果模型遇到模糊的数据样本,它会请求人机交互,以便提供更多上下文。这种定向学习形式有助于模型高效学习,并在最薄弱的领域进行改进。
关键和受监管的决策
法律或医疗部门等领域还有其他合规性法规,尤其是在数据处理、处置和使用方面。
临床实践中的许多模型都需要医生的监督才能检查其正确性。这些类型的应用程序在设计上被称为“人机协同”。在某些国家/地区,这是受法律监管的,例如欧盟的《人工智能法》,该法将医疗应用程序归类为高风险应用程序,需要人工干预。
边缘案例和低置信度输出
机器学习模型主要根据历史数据进行训练,能够根据其训练数据集推理新数据。当这些模型必须就边缘案例或未知领域做出决策或预测时,它们之前的训练无法自信地预测答案。与其让模型试图涵盖这些超出其专业领域的案例,不如由数据科学家或专家提供额外的上下文和反馈,以帮助完善模型的决策。
人机协同的工作原理是什么?
人机协同系统介于完全自主和完全手动的过程之间。模型做出预测,然后系统评估其是否可靠,只有在需要时才有人类介入提供见解。
以下是允许该过程发生的步骤和条件。
置信阈值和升级逻辑
只有在达到预定义的配置条件时,模型才会要求人类输入。通常,模型具有一个带有内部置信度阈值指标的外围系统。如果预测的置信度分数低于该阈值,则输出将被标记为升级以供人工审查。
高风险区域,例如前面提到的与高度监管区域相关的区域,在触发人类干预之前的阈值可能较低。
任务路由和劳动力管理
在模型标记任务以供审查后,它会进入人工工作流程队列。虽然使用的特定委托系统因公司而异,但通常由领域专家或内部团队审查任务。对于不太复杂的任务,众包审查者可以快速大规模地提供反馈。
专家团队接收更困难的任务,通常需要更长时间审查,并提供更详细且更细致的反馈。
反馈回路和模型再训练
人类提供的任何更正都将发送回模型,并用于更新模型以便其保留这些信息。人类提供的实际反馈通常遵循精心规划的结构,用来消除歧义,并清楚地解释机器今后应如何使用这些信息。

人机控制模型的类型有哪些?
机器学习系统可以使用多种不同类型的人机协作控制模型,具体取决于所需的控制和反馈程度。
了解这些差异是人工智能治理的重要组成部分,因为它们的区别可能导致公司不同的监管要求。
人机协同(HITL)
人机协同是指在任何操作发生之前,由人工主动审核任务。HITL 是一种更需人工参与的方法,需要更多投入与沟通。通常,这用于监管环境,在这些环境中,避免错误至关重要。
人机监督(HOTL)
人机监督是指人类参与监控系统,但不必批准每一个决策才能让模型进入下一步。必要时人类可以进行干预,但模型仍然具有一定的自主权,可以保持流程的畅通。HOTL 更适合风险较低的行业或高业务量的运营。一个例子是聊天机器人流程。
人类指挥(HIC)
人类指挥是指人类完全掌控系统并可以随时将其关闭。人类可以随时进行干预,改变决策过程或关闭人工智能。对于机器人或关键基础设施等自主系统,这是一种常用的控制设计模型。
人机协同的使用案例有哪些?
在许多使用案例中,企业可以使用人机协同系统。
数据标注和注释
人工注释者标注训练数据,例如图像、文本和音频,以供机器学习使用。对模型内容进行标注的过程是有监督机器学习的基础,在有监督机器学习中,人工输入直接影响训练和最终的模型性能。在这个过程中,人是必不可少的。
内容审核
当自动机器学习系统将内容标记为有害或模棱两可时,人工审核者会介入以确认这些决策。企业需要明确定义其对内容审核的置信水平,因为低阈值会迅速为人工审核者创造大量工作。
医学成像和临床决策支持
在医学成像系统中,人工智能工具可以识别医疗数据中的异常。但是,最终决策者始终是具有该特定领域专业知识的执业医生。尽管机器学习可以提供建议,但监管机构通常仍需要人类或人工监督。
金融服务
由于机器学习工具会将案例标记为需要审查,因此在欺诈检测系统中,人机协同很常见。在反洗钱工作流程中,人类会收到机器学习工具无法做出明确决策的任何上报案例。
生成式人工智能输出审查
在内容制作或编码过程中使用生成式人工智能的企业在部署之前会使用人工审查者来检查准确性。您可以让人类编辑或重写人工智能输出,使其与您的内部策略保持一致。
自主系统和机器人
尽管自主系统可以在不受干扰的情况下执行某些过程,但任何程度的不确定性或模糊性都可能触发人工审查。任务将上报给人工操作员,这样他们就可以在错误推入生产环境之前仔细检查。
人机协同的关键考虑因素有哪些?
尽管人机协同是提高准确性的有用过程,但企业仍需留意一些注意事项。
延迟与准确性的权衡
通过让人工审查者参与机器学习系统及其决策,会让流程耗时更长。在设计 HITL 工作流程时,您需要考虑特定使用案例的适当延迟级别。
审查者的质量和一致性
在要求审查机器学习模型的性能时,审查者可能并不总是能完美地保持一致。人工审查者可能会无意中在审查过程中引入偏见,这可能导致方向冲突。在使用量表来解决这个问题时,审查者可能还会因为不得不处理这么多不同的案例而感到疲劳。
质量控制机制可以帮助防止这些不一致之处影响您的反馈。拥有多元化的审查者队伍、结构化的指导方针和审计机制来努力降低这些风险也是一个好主意。
可扩展性
人机协同机制不能线性扩展,因为当您需要更多审查者时,劳动力成本和协调开销都会随之增加。自动流程可以轻松地继续扩展,但是管理 HITL 会在该流程中造成工作流程瓶颈。
数据隐私
人工审查者经常直接接触潜在的敏感数据。您需要谨慎对待这种接触,使用访问控制机制、数据匿名化或数据掩蔽,并尽可能遵守合规要求。
什么是人机协同最佳实践?
以下是一些最佳实践,可用于改善组织内的 HITL:
-
定义明确的上报标准,例如置信阈值、输入类型和决策风险等级,以帮助确定人员应在何时介入。
-
使用结构化注释指南来减少审核者的不一致性,并以模型可用于重新训练的格式提供反馈。
-
定期审计人工决策,以发现审核者在审核过程中的偏差或偏见。
-
计划在模型性能改善时减少对 HITL 的需求,逐步构建具有更高置信度阈值目标的更自动化系统。
-
保留大量的审计日志,以记录属于严格监管领域的任何使用案例。
-
按任务类型分离审核者池,以保持数据和反馈质量。
AWS 如何支持您的人机协同需求?
AWS 提供一系列人工智能服务,您可以在机器学习工作流程中融入人机协同实践。探索以下解决方案:
-
Amazon Augmented AI 是一项完全托管的服务,可以更轻松地整合开发人员对机器学习预测的审查,无需构建人工审查系统或管理大量人工分析师。Augmented AI 允许您根据您的特定要求对机器学习预测进行人工审查和审计。
-
Amazon SageMaker Ground Truth 提供最全面的人机协同功能。有两种使用 Amazon SageMaker Ground Truth 的方法:自助式产品和 AWS 托管产品。在自助式产品中,您的数据标注者、内容创建者和提示工程师可以使用我们的低代码用户界面来加速人机协同任务,同时可以灵活地构建并管理您自己的自定义工作流程。在 AWS 托管的产品(SageMaker Ground Truth Plus)中,我们会根据您的使用案例选择和管理合适的工作团队。
立即创建免费账户,开始在 AWS 上使用人机协同机器学习。
Browse all cloud computing concepts
Browse all cloud computing concepts content here:
Did you find what you were looking for today?
Let us know so we can improve the quality of the content on our pages