跳至主要内容

什么是 AI 安全 (AI Safety)?

帮助人工智能系统在可靠、可控、合规的边界内运行的原则与技术实践,覆盖内容安全、隐私保护和输出可信

什么是 AI 安全?

AI 安全是指确保人工智能系统在可靠、可控和合规的边界内运行的一系列原则、方法和技术实践。随着生成式 AI在企业中广泛落地,模型可能生成有害内容、泄露敏感信息或产生与事实不符的回答,AI 安全旨在识别和防范这些风险,让人工智能应用值得用户信任。

AI 安全既包含模型层面的对齐和价值观训练,也包含应用层面的输入输出防护。在生产环境中,企业需要在用户与模型之间建立防护层,过滤有害请求、屏蔽不当内容、保护隐私数据并验证输出的真实性,使人工智能应用在开放场景中保持稳定和可控。

AI 安全不是一次性的配置,而是贯穿人工智能应用全生命周期的持续实践。从模型选择、应用设计到上线运营,企业需要在每个环节考虑安全边界,并根据实际使用中出现的新风险持续调整防护策略,形成动态的安全保障体系。

为什么 AI 安全很重要?

维护用户信任与品牌声誉

人工智能应用一旦生成有害、歧视或错误的内容,会直接损害用户信任和企业声誉。AI 安全通过内容过滤和输出验证,确保应用在面向用户时保持稳定可靠的表现,是企业规模化部署人工智能的前提。

满足合规与监管要求

各行业对数据保护和内容合规有明确的法规要求。AI 安全帮助企业在使用人工智能的同时满足隐私保护、内容审核和行业监管的要求,为受监管行业的人工智能落地提供合规基础。

防范内容与隐私风险

生成式 AI 可能在输出中泄露训练数据中的敏感信息,或被恶意用户诱导生成有害内容。AI 安全通过敏感信息编辑和内容过滤机制,降低数据泄露和内容滥用的风险。

保障输出的真实可信

模型可能生成看似合理但实际错误的内容,即幻觉现象。在人力资源、财务、法律等对准确性要求高的场景中,AI 安全通过事实核查机制验证输出的真实性,确保关键决策基于可靠信息。

抵御新型攻击手段

人工智能应用面临提示注入、越狱等新型攻击,攻击者试图绕过模型的安全限制。AI 安全通过专门的防护机制识别和阻断这些攻击,保护应用不被恶意操纵。

AI 安全有哪些核心维度?

内容安全过滤

对用户输入和模型输出进行实时评估,检测并过滤仇恨言论、侮辱性内容、暴力和不当行为等有害信息。内容过滤支持可配置的阈值,企业可以根据业务场景调整过滤强度,也能防范提示注入和越狱等攻击。

隐私与敏感信息保护

检测用户输入和模型响应中的个人身份信息,根据使用场景选择拒绝包含敏感信息的请求或对响应中的敏感内容进行编辑。企业可以从预定义的信息类型中选择,也能用正则表达式定义自有的敏感信息类型。

幻觉检测与事实核查

通过情境化基础检查验证模型响应是否与源信息一致,检测偏离来源、编造信息的幻觉现象。这一维度在检索增强生成、摘要和对话应用中尤为重要,源信息可用作验证模型响应的参考依据。

话题边界控制

通过自然语言描述定义应用需要回避的话题,检测并屏蔽属于受限话题的用户输入和模型响应。例如银行助手可以设计成回避投资建议相关话题,使应用的对话范围与业务定位保持一致。

模型对齐与价值观

在模型训练阶段通过指令微调和人类反馈优化,使模型学会遵循指令、拒绝有害请求并生成有帮助的回答。对齐是 AI 安全在模型层面的基础,为应用层的防护提供起点。

AI 安全有哪些应用场景?

面向公众的智能助手

电商、政务和金融等面向公众的智能助手需要在开放对话中保持稳定。AI 安全过滤不当语言、屏蔽受限话题并保护用户隐私,确保助手在大规模用户交互中表现可控。

企业知识问答系统

基于知识库构建的问答系统需要确保回答基于可信来源。AI 安全通过事实核查验证回答与源文档的一致性,避免系统生成偏离企业实际情况的错误信息。

受监管行业应用

金融、医疗和法律等受监管行业对内容合规和数据保护有严格要求。AI 安全帮助这些行业的人工智能应用满足监管标准,编辑敏感信息并验证输出的准确性,降低合规风险。

内容生成与审核平台

内容创作平台使用人工智能生成文案和素材,需要确保产出内容符合平台规范。AI 安全在生成环节过滤有害内容,在发布前完成合规审核,保障平台内容生态的健康。

智能体与自动化流程

在人工智能代理自主执行任务的场景中,AI 安全为代理的输入输出提供防护层,确保代理在授权边界内操作,避免自主决策带来的失控风险。

AI 安全是如何实现的?

AI 安全的实现机制包含输入防护、输出验证和策略管理三个层面:

输入防护层

在用户请求到达模型前进行评估,检测提示注入、越狱尝试和包含敏感信息或受限话题的输入。对于不符合安全策略的请求,系统在进入模型前予以拦截或改写,防止恶意输入影响模型行为。

输出验证层

对模型生成的响应进行检查,包括内容安全过滤、敏感信息编辑和事实一致性验证。机器学习技术用于识别有害内容和幻觉,只有通过验证的响应才会返回给用户。

策略管理层

企业根据业务场景定义安全策略,包括过滤阈值、受限话题列表、敏感信息类型和事实核查规则。策略以统一标准应用于不同模型,企业可以持续调整策略以应对新出现的风险。

这三个层面形成完整的防护闭环:输入防护阻断风险请求,输出验证把关生成内容,策略管理提供可配置的控制手段。随着应用运营中新风险的出现,企业不断优化策略,使 AI 安全防护持续适应变化的威胁环境。

AI 安全与传统信息安全有什么区别?

AI 安全与传统信息安全在防护对象和方法上存在差异:

防护对象

传统信息安全保护系统、网络和数据免受未授权访问;AI 安全在此基础上还需要防范模型生成的内容风险和输出的不可信问题。

风险来源

传统安全应对外部攻击和漏洞利用;AI 安全还需处理模型自身的幻觉、偏见和被诱导等内生风险。

防护方法

传统安全依赖访问控制、加密和防火墙;AI 安全需要内容过滤、事实核查和话题控制等针对生成内容的专门机制。

评估标准

传统安全关注机密性、完整性和可用性;AI 安全还需评估输出的真实性、无害性和合规性。

两者相辅相成。AI 安全建立在传统信息安全的基础之上,企业在保障基础设施和数据安全的同时,还需要为人工智能应用增加专门的内容和输出防护,形成覆盖全栈的安全体系。

AI 安全面临哪些挑战?

风险的动态演变

人工智能面临的攻击手段和风险类型持续变化,新的越狱方法和滥用方式不断出现。企业需要建立持续监测和响应机制,及时更新安全策略以应对新出现的威胁。

安全与体验的平衡

过于严格的安全过滤可能误伤正常请求,影响用户体验;过于宽松则难以防范风险。企业需要通过可配置的阈值找到适合业务场景的平衡点,在保障安全的同时维持应用的可用性。

多模态内容的防护

随着人工智能应用扩展到图像、音频和视频,安全防护需要覆盖多种内容形式。多模态内容的风险识别比纯文本更复杂,对防护技术提出更高要求。

跨模型的一致防护

企业往往使用多个不同来源的模型。如何在不同模型上应用一致的安全标准,避免因模型切换导致防护缺口,是企业构建统一安全体系需要解决的问题。

AWS 如何为您的 AI 安全需求提供支持?

Amazon Web Services (AWS) 提供覆盖内容安全、隐私保护和输出验证的能力,帮助企业为生成式 AI 应用构建安全保障。

Amazon Bedrock Guardrails 提供可配置的安全保障措施,支持内容过滤、敏感信息编辑、话题屏蔽、情境化基础检查和自动推理检查,在多种基础模型上采用一致的标准方法,帮助降低幻觉并过滤有害内容。通过 ApplyGuardrail API,防护措施还可应用于托管模型和第三方模型。

Amazon Bedrock 提供对多种高性能基础模型的统一访问,并内置安全与隐私控制,是构建安全生成式 AI 应用的基础平台。

Amazon SageMaker AI 为需要自定义模型的场景提供训练与部署能力,支持在模型开发阶段引入对齐和安全评估,从源头提升模型的安全性。

AWS Step Functions 提供可视化的工作流编排,将安全检查嵌入人工智能应用的处理流程,使防护步骤成为可靠、可审计的执行环节。

立即探索 AWS AI 安全相关服务,了解如何在 AWS 上为您的生成式 AI 应用构建安全保障。

Browse all cloud computing concepts

Browse all cloud computing concepts content here:

正在加载
正在加载
正在加载
正在加载
正在加载

Did you find what you were looking for today?

Let us know so we can improve the quality of the content on our pages