什么是网络运行中心(NOC)?
什么是网络运营中心(NOC)?
网络运营中心(NOC)是一个集中式中心,人员可在其中监控和管理组织的网络基础设施和 IT 资源。NOC 使运营商能够查看和分析当前网络运行状态及历史运行状况、实时查看警报、规划容量调整并响应事件。安全运营中心是组织数字安全的核心,而 NOC 则是网络可用性和性能的核心。
NOC 的关键功能是什么?
作为监控网络运营和性能的中心枢纽,网络运营中心(NOC)具有许多不同的功能,可提供全天候连接。
网络监控和警报
NOC 使用一系列硬件和软件来监控组织整个环境中的网络性能。网络管理系统(NMS)和应用程序性能监控(APM)平台可提供有关网络连接、吞吐量、数据包丢失、延迟和抖动数据的信息,以反映当前的性能状态。NOC 还会在内部和外部网络的边缘进行监控。
除了收集和显示这些数据外,NOC 还会部署警报系统,以便在任何性能指标降至可接受的基准水平以下时发出警报。
事件管理和响应
如果 NOC 发现系统存在中断或异常,则事件管理和响应组件将会激活以处理问题。这些组件首先尝试确定问题所在以及可能导致问题的原因,并在需要时将工单上报给网络工程师。
NOC 工程师根据严重程度对工单做出响应。一级工单用于处理次要且不太紧急的问题,例如新用户无法访问电子邮件。四级工单需要立即响应,以修复威胁网络正常运行时间的关键问题。NOC 技术人员将借助网络数据日志进行根本原因分析,以确定可能出现的问题并着手修复。
部分响应是自动化的,可自动重启某些失败的进程,或在网络编排工具中触发自动回滚,以恢复到先前的正常工作状态。
网络性能优化
NOC 还致力于持续提升性能,确保网络资源以最优方式交付,并将延迟降至最低。工程师可查阅历史性能数据,衡量一段时间内的性能改进情况,并观察性能如何响应服务质量(QoS)调整等变化。
容量规划
容量规划是通过趋势分析、预测建模和场景模拟,评估网络能否应对潜在流量激增或未来持续增长的过程。这些测试旨在确保网络基础设施能够承受高工作负载。
如果上述任一场景测试失败,网络运营中心(NOC)将考虑引入支撑技术或新的基础设施,以提升网络的潜在容量。
NOC 的工作原理是什么?
在网络运营中心中,多个不同的技术层协同工作。
收集层
NOC 的收集层涵盖网络生成或接收的所有信息和日志数据。网络中的系统日志、数据流模式和遥测源将数据传送到该层,流式管道和消息队列有助于确保这些消息以最低延迟到达。
除了收集数据外,收集层还负责数据规范化和数据丰富化。它旨在通过附加元数据,将原始数据转化为有用的信息,以便下游分析引擎能够更好地进行处理。
分析层
分析层专注于将收集层接收并标记的数据转化为洞察,供工程师用于诊断问题或了解网络性能问题。该层具备事件关联引擎、高级分析系统和依赖关系图,用于追踪某一位置发生的事件可能如何影响网络的其余部分。
在此阶段,工程师可以利用这些数据进行根本原因识别,检测性能数据中的异常模式,并将数据转化为切实可行的洞察。
AIOps 一直是 NOC 技术栈的重要补充,因为机器学习可以帮助检测异常和识别威胁,使 NOC 工程师能够更快地做出响应。
响应层
NOC 系统中的响应层是根据所有前期分析采取行动的环节。操作可以简单到触发自动响应,也可以紧急到通过设备灯光和声音直接向 NOC 工程师发出警报,提示其需要处理网络问题。在许多情况下,NOC 使用 IT 服务管理平台来生成新工单并跟踪这些工单直至问题解决。
即使在具有复杂自动化流程的高性能 NOC 系统中,人工监督仍然至关重要。
上报与沟通
如果响应层将上报确定为适当的响应措施,则问题将被移交至最终操作层。该层级旨在汇总有关事件的已知详情,并将其传达给公司内所有相关方。具体细节取决于内部政策和组织架构。例如,一些公司设有一级、二级和三级工程师,分别负责处理各自类别的工单。
如果 NOC 工程师无法解决其工单中的问题,则会将其移交给下一级别的工程师。沟通还包括记录事件并生成事后响应报告。
NOC 模型有哪些类型?
NOC 模型共有四种类型,每种类型均提供不同的优势和运营用途。
内部 NOC
内部 NOC 是指贵公司的 NOC 完全由本公司自行托管、管理和配备人员。您将在一个集中位置管理 NOC 结构的每个部分,包括事件检测和响应,从而实现对内部流程的完全可见性并拥有完整的数据主权。
内部 NOC 对于监管严格的行业,以及内部基础设施复杂且拥有技术娴熟员工的公司尤为适用。
外包 NOC
外包 NOC 是指将所有 NOC 业务移交给第三方公司负责。与您合作的提供商将使用其自有员工和技术栈对您的 NOC 进行远程管控。
对于不具备内部基础设施或技能能力来自行托管 NOC 的企业而言,此选项最为常见。此外,由于许多外包 NOC 在 SLA 框架下运营,此选项对于需要保证响应时间和网络可靠性的公司同样非常实用。
混合网络运营中心(NOC)
混合 NOC 是指贵公司负责管理与 NOC 相关的部分职责(可能包括较低级别的 1 级或 2 级工单),同时将更复杂的功能外包给第三方。第三方将监控您的网络系统,并可帮助防止网络故障,但仅限于其所分配的职责范围内。
为了支持业务连续性并有效应对任何网络中断,选择此选项的公司需要明确界定各方应承担哪些职责。责任共担模式有助于防止因双方均认为这是对方职责而导致网络问题持续存在。

云原生 NOC
云原生 NOC 使用基于云的工具来管理云中的所有 NOC 功能。服务提供商将提供完整的可观测性平台,通过 API 收集数据并在控制面板中提供概览。云模型可由贵公司自行管理,也可采用混合合同配置。对于前者,您将运行所有 NOC 功能,但会借助基于云的工具来完成。
有哪些网络运营中心(NOC)最佳实践?
企业可以遵循这些网络运营中心最佳实践,确保其网络系统保持可用性和弹性。
制定明确的上报程序和网络管理操作手册
NOC 将传入的事件划分为不同级别,以便由相应的员工来处理事件。组织应确保其上报程序以及每种情况下的具体操作手册均有明确定义。概述在特定情况下应通知哪些团队、上报机制的触发方式,以及分步骤的案例管理操作手册。
实施自动告警与自动修复
自动化减少了管理和维护 NOC 运营所需的人工工作量。借助阈值设置和智能触发器,团队可以创建自动化的行动路径。例如,自动修复工作流可以在节点离线时尝试重新启动该节点。自动化是帮助减轻 NOC 工程师工作负担的关键工具。
维护详细的资产与依赖项清单
NOC 旨在监管公司的整个网络。如果缺乏对网络的全面可见性,工程师就无法准确了解网络状况、其性能以及应管理的内容。自动发现工具和依赖关系映射工具有助于实现对网络环境的全面可见性。
使用集中式日志记录和关联
将网络监控和事件日志记录集中到统一位置,可将所有传入的指标、日志和遥测数据汇总到一处。在需要标记和分析数据时,将数据集中存放在一处可以更便于进行关联分析。集中管理数据还有助于履行合规义务,并促进更有效的分析。
定义 SLA 和 KPI
定义服务级别协议(SLA)和 KPI 至关重要,尤其是在与外部服务提供商合作时。SLA 通常涵盖正常运行时间、平均检测时间和平均解决时间,将为您的合作伙伴设定必须达到的响应准则。KPI 是需要实现的更宏观的目标,例如告警转工单的转化率。同时拥有这两项指导方针,有助于确保您的 NOC 策略尽可能全面。
定期进行事件审查
事件发生后,您应进行事后审查(PIR),以更好地了解事件经过,并确定所概述的流程是否运作良好。确定根本原因并将新信息添加到运行手册中,有助于在未来更快地解决该问题。
投资工具
由于 NOC 涉及范围广泛,有几类不同的工具可以提升各运营环节的效率。例如:
- 监控和可观测性工具
- 知识管理和沟通工具
- ITSM 和工单工具
- 用于分析和检测的 AI 和 AIOps
NOC 与安全运营中心(SOC)有何不同?
NOC 侧重于监控和改善网络结构。另一方面,安全运营中心则侧重于以下任务:通过安全分析识别安全威胁、提供反恶意软件和防病毒支持,以及保护数据免遭未经授权的访问。在某些方面存在重叠之处,但 SOC 和 NOC 从根本上使用不同的技术,并且具有各自独立的升级路径。
AWS 如何满足您的 NOC 需求?
AWS 提供一系列服务,可直接集成到您的网络运营中心,帮助您充分利用云基础设施:
- Amazon CloudWatch 是一项智能可观测性服务,能够为应用程序和基础设施提供切实可行的见解。CloudWatch 允许您监控和优化整个技术堆栈。
- AWS Config 可帮助您持续评估、监控和记录资源配置更改,从而简化变更管理。
- AWS Systems Manager 为贵组织的账户和区域中的节点提供集中统一的视图。AWS Systems Manager 允许您预置、配置和自动化部署计算资源。
立即创建免费账户,开始在 AWS 上执行 NOC 运营。
Browse all cloud computing concepts
Browse all cloud computing concepts content here:
Did you find what you were looking for today?
Let us know so we can improve the quality of the content on our pages