2026年09月16日
Agentic Ops五层架构:运维智能体从感知到决策的完整技术栈
【智能运维平台】
数字化时代企业IT架构日趋复杂,混合云环境、信创替代浪潮和海量终端设备带来了运维数据分散、故障定位困难和重复工作繁多等一系列难题。传统监控系统只能完成告警推送无法做智能研判,CMDB资产信息依赖人工维护导致数据失效,自动化脚本只能执行预设指令没有自主思考能力。监控平台、CMDB配置管理和自动化运维工具各自独立形成数据孤岛,故障发生时海量告警风暴来袭,运维人员需要切换多套系统排查,故障根因定位全靠个人经验。
运维智能体作为下一代智能运维的核心形态,正在打破传统AIOps只告警不决策、只采集不行动的局限。以乐维运维智能体为代表的新一代方案提出了业界首创的五层架构设计,分别是感知层、规划层、记忆层、大脑层和行动层,对应智能发现、全栈监控、业务解构、智能分析和决策执行五步递进工作流程,打通大模型能力与运维工具链,真正实现Agentic Ops自主运维能力。
感知层是运维智能体的眼睛,负责完成全域资源自动发现与全栈监控。该层支持数十种采集协议,覆盖VMware、Cloud API、SNMP、eBPF、Redfish和OpenTelemetry等主流协议,适配500多家厂商和8000多种设备型号,兼容信创与非信创软硬件环境,覆盖IaaS、PaaS、SaaS和IoT全技术栈。通过Perseus采集技术和基因技术自动适配,完成在网资产一键自动发现,精准识别设备厂商型号。同时具备业务洞察能力,自动生成业务拓扑开展业务仿真拨测,监测SLO服务质量指标。
规划层承担梳理、建模和规划的核心职能,依托CMDB完成全域资产建模。该层自动同步监控采集到的资产信息,维护资产属性和变更审计,解决传统CMDB数据过期失效的难题。支持3D机房可视化展示机柜U位容量和设备位置告警状态,自动构建应用系统拓扑理清业务之间和业务与底层硬件的依赖关系。面对跨地域复杂网络环境,自动解析LLDP和CDP等协议生成全网网络拓扑,支持从全国到总部到园区的逐层下钻。
记忆层是运维智能体的大脑记忆中枢,存储多维度运维数据,包括图数据、时序监控指标、向量文档和故障历史案例。该层将历史故障工单、处置SOP和运维文档向量化存入知识库,形成RAG检索增强知识库。记忆层分为短期会话记忆、长期业务记忆和用户画像记忆三个维度,既保存当前多轮运维对话上下文,又沉淀历史故障处理经验。当再次遇到同类告警时,智能体可以调取过往处置经验辅助分析,实现运维经验的持续沉淀和复用。
大脑层是运维智能体的推理决策中心,接入主流大语言模型,结合RAG检索增强、CoT思维链和Skill运维技能库完成故障研判和根因分析。该层不再只是简单输出告警信息,而是对海量告警进行收敛降噪定位故障根因并输出处置建议。内置丰富的CoT运维场景广场,覆盖主机巡检、数据库故障诊断、容量风险分析和中间件隐患排查等大量开箱即用的智能分析场景,支持用户自定义上传和共享运维场景模板。
行动层打通了完整的工具链闭环。该层集成网管平台、自动化运维平台和ITSM柔性工作流引擎,形成完整的执行出口。自动化平台提供海量脚本库、流程编排、文件分发和高危命令分级审核管控。智能体输出处置方案之后,经过权限和风险管控可完成巡检、信息采集、故障自愈和工单创建等操作,做到发现、分析、建议、执行和审计的完整闭环。所有操作全程留痕可审计,有效规避AI执行带来的安全风险。
运维智能体的核心价值在于将IT运维从被动救火模式转变为主动预防模式。传统运维模式下故障平均修复时间MTTR通常在小时级别,而智能体通过全域感知、智能分析和自动处置将MTTR压缩到分钟级别。在信创与非信创混合运行的复杂场景下,统一运维管理能力尤为关键。运维智能体不仅缩短了故障响应时间,更重要的是将运维经验从个人能力转化为组织能力,降低了对资深运维工程师个人经验的依赖,为企业IT运维的可持续发展奠定了基础。
来源:腾讯云开发者社区 查看原文
扫码关注金支点公众号,获取每日行业报告
京公网安备 11010802036102号北京金支点技术服务有限公司保留所有权利 | Copyright © 2005-2026 Beijing Golden Point Outsourcing Service Co., Ltd. All Rights Reserved.