算力下沉时代,如何攻克“边缘”与“雾”计算的监控难题?

在高度互联的世界中,边缘计算与雾计算这两项技术创新正在日益受到重视。边缘计算因贴近数据源头,能够以极快的速度实现数据的收集与处理。

不同于将所有数据经由互联网传输至存在延迟的远程云端,边缘设备可以在本地存储和处理大部分数据,仅将繁重的工作交付给中央云,从而实现最快的响应速度。在某种程度上,边缘计算就像人体的脊髓,无需将信号传递至大脑即可直接处理紧急反应。研究机构 IDC 预测,到 2025 年,全球在边缘解决方案上的支出将快速增长,达到约 2740 亿美元。

边缘计算有助于实现前所未有的响应速度、上下文数据处理能力、带宽节省、极低延迟以及极高的可用性。通过在设备内部集成智能与存储能力,边缘计算构建了一个分布式、去中心化且功能强大的环境,即使在网络发生故障时也不会停止运行。

什么是雾计算?

作为边缘计算的扩展,雾计算是介于边缘层与云端之间的中间阶段,兼具两者的优势。正如薄雾紧贴地面飘浮一样,"雾计算"这一名称形象地指代了一种更靠近设备的去中心化 IT 架构,能够提供出色的"最后一公里"连接性与自治能力。

雾计算通过将云端的算力在物理层面上尽可能拉近到设备端,从而提升了边缘设备的能力;它在贴近边缘的同时,能够处理额外的计算、存储和应用需求,从而弥补了云端存在的容量限制和技术约束。

监控需求

在后疫情时代,企业需要集成计算层的低延迟、高速商业网络,以支持强健的协同应用。在混合办公与协同作业的背景下,边缘与雾服务已成为"工业4.0"(即高度互联、兼具高度灵活性与强大能力的制造业)取得成功的关键要素。

数据表明,2021 年全球安装了超过 50 万台工业机器人,比 2020 年增长了 31%,是六年前的两倍。随之而来的是,随着边缘和雾计算市场的增长,新的挑战也逐渐显现,其中首要解决的就是如何对它们进行有效监控。

尽管前景广阔且备受推崇,但仍有一些重大障碍阻碍着边缘和雾计算模式的大规模应用。这些障碍包括:缺乏成熟的软件系统、缺乏演进完善的边缘和雾计算架构,以及缺乏能够在大规模场景下应对各类新兴边缘与雾复杂性的强大监控解决方案。

独特挑战

根据所服务的端点类型,边缘主要分为三种形态:客户端边缘、网络边缘,以及数据中心或云服务边缘。

客户端边缘是指 IT 域或网络接口之间的边缘;网络边缘是不同 IT 域之间的边缘;而数据中心或云服务边缘则是最先接收客户端流量的应用服务器。在所有这些边缘形态中,边缘监控都至关重要,它能确保在发生宕机故障时具备最佳的可视性与排障能力。

与较容易监控的集中式 IT 基础设施相比,边缘和雾计算基础设施由于其端点多种多样且高度分散,加上可观测性中可能存在盲区,因此更难进行观察、监控和管理。哪怕只有一个未被监控的边缘节点出现故障,都可能导致远程员工、购物者甚至是依赖该节点数据转发的关键系统中断访问。

此外,由于边缘和雾计算设备在物理空间上的分散分布,黑客很有可能将其作为入侵入口来攻击中央系统。专家指出,必须制定健全的监控策略,并辅以及时的修复和信息转发机制,才能确保边缘与雾设备获得最佳的安全性。

突破局限

监控边缘节点是一项复杂的挑战。由于边缘节点通常不允许安装外部软件,传统的基于 Agent(代理)的监控方式在此难以奏效。此外,部分边缘节点过于微型(例如采用树莓派或 Arduino 等处理器的设备),无法支持传统的监控 Agent。这些节点往往也不符合作为传统监控 Agent 基石的 TCP/IP 协议。

为了解决这些挑战,部分边缘计算提供商开始自行管理和监控边缘节点。这些提供商直接输出遥测数据,供监控解决方案直接调取使用。例如,AWS CloudFront 提供了可用于监控边缘节点的遥测数据流;内容分发网络(CDN)服务如 Cloudflare 也提供可用于挖掘遥测数据的日志。

目前针对边缘节点监控的新兴思路包括:在雾计算集群上编排监控 Agent。雾计算集群是比传统云计算基础设施更靠近网络边缘的分布式计算架构。通过在雾计算集群上编排监控 Agent,可以更加高效、精准地实现对边缘节点的监控。

除了集群编排外,未来的监控解决方案预计还将进一步演进,以应对网络端点的异构性以及设备方案的高速变化。这些解决方案还必须具备过滤噪音和误报的能力,从而获取高质量的监控数据。所有这些新兴的监控解决方案都必须重新审视传统的云监控方法,以适应雾计算与边缘计算领域的独特特征。

巨大潜力

雾计算编排需要通过监控来获取具备可操作性的数据,并经由恰当渠道反馈给决策者。由于雾环境可能缺乏专用的数据处理设施,IT 团队应当打破传统的基于 Agent 的监控思维,探索更新的技术方法,以全面掌握雾系统与边缘设备的可用状态、运行状况及安全性。

当前最核心的监控挑战包括:

故障告警将如何发送?

哪些指标最值得追踪?

监控每台边缘与雾设备需要消耗多少算力?

所有实时信息应如何传输(采用 Push 还是 Pull 机制)?

边缘计算和雾计算在推动医疗系统、智慧城市、工业园区和军事应用等广泛行业的转型方面蕴含着巨大潜力。如今,开放雾联盟(OpenFog Consortium)等行业组织正在积极制定边缘和雾计算部署的参考架构。

随着边缘与雾计算的持续演进,深入探索并研发符合其特定需求的定制化监控方案显得至关重要。唯有跨越当前的监控瓶颈,我们才能真正确保边缘与雾计算架构的部署实现高可靠、高效率与高安全。

相关推荐
龙智DevSecOps解决方案2 天前
ITSM选型指南 | Jira Service Management Standard vs Cloud Premium 版本对比与升级指导
atlassian·devops·aiops·jira·itsm·智能运维
Miao121312 天前
工程交付指标入门:如何重新掌控软件交付
大数据·运维·devops
DLYSB_2 天前
DevOps 运维实战:基于 CI/CD 流水线 Webhook 的构建状态物理现场声光反馈架构
运维·ci/cd·devops·报警灯
砍材农夫3 天前
运维|devops|jenkins构建分支选择及执行日志展示
运维·jenkins·devops
龙智DevSecOps解决方案4 天前
Perforce Delphix测试数据管理平台:每月实现数百万次 CI/CD 运行,更快交付高质量软件
ci/cd·devops·tdm·perforce·delphix·企业级数据管理
易筋紫容4 天前
为什么做了 DevOps,你还是管不好开源依赖?
运维·开源·devops
砍材农夫5 天前
运维|devops|jenkins构建应用发布
运维·jenkins·devops
AOwhisky5 天前
云原生 DevOps 工具链从入门到实战(第二期)——Jenkins安装与基础配置——CICD核心引擎
linux·运维·ci/cd·云原生·jenkins·devops
行者-全栈开发7 天前
TIG 监控体系搭建:Telegraf + InfluxDB + Grafana 全链路实战
grafana·influxdb·服务器监控·tig·docker部署·监控系统·telegraf