ZWOPS ZWOPS 智维运维管理平台

智维运维管理平台 · 安装与使用手册

适用版本:3.0.2 及以上(zwops-install-20260926)

文档性质:交付版 · 面向平台使用人员与运维值班人员

最后更新:2026-09-30

本文档分两部分:第一部分是给实施与运维人员看的安装部署;第二部分是日常使用指引,只讲在界面上怎么点、怎么填、会看到什么结果。

第一部分 安装部署

1. 配置需求

操作系统

安装 openEuler 24.03 SP3(其他主流 Linux 发行版亦可)。

硬件建议

监控主机数 CPU 内存 硬盘
100 台以内 8 核 16 GB 500 GB
200 台以内 16 核 32 GB 1000 GB
500 台以内 24 核 64 GB 2000 GB
1000 台以内 32 核 128 GB 3000 GB

建议按未来三年的纳管规模选型;数据盘单独挂载,并预留 30% 以上余量。平台默认只保留 31 天的明细数据,更早的数据以报表归档形式留存,因此月报、季报需要从「报表归档」获取。

2. 安装步骤

  1. 把安装包上传到服务器任意目录,例如 /opt
  2. 解压安装包
  3. 进入解压后的目录
  4. 执行一键安装
  5. 全程无报错即安装完成,脚本会自动启动全部服务
unzip zwops-install-2026*.zip
cd zwops-install
bash install-all.sh

安装过程中如中断,重新执行 bash install-all.sh 会从断点继续,不会重复安装已完成的部分。

3. 安装后的三项检查

  1. 服务可访问:浏览器打开 http://<服务器IP>,能看到登录页。
  2. 能正常登录:用交付时提供的管理员账号登录,能看到「监控中心 → 首页」。
  3. 改掉初始密码:首次登录后立即到「系统管理 → 用户管理」修改管理员密码。

第二部分 平台使用

4. 快速上手

4.1 登录

浏览器打开 http://<服务器IP>,输入用户名 / 密码 / 图形验证码即可进入平台。登录状态保持 24 小时,超时后需要重新登录。

4.2 界面总览

区域 说明
顶部 平台名称、全局搜索、告警铃铛(显示未处理告警数)、个人入口
左侧 主导航菜单,按你的角色权限自动显示
主区 当前页面的内容
右上角个人入口 个人信息、授权信息、版本更新、退出登录

4.3 菜单地图

平台共 7 个一级模块、80 个菜单,按角色权限显示:

一级模块 二级菜单
监控中心 首页、预警问题、网络拓扑、监控大屏、综合监控
告警管理 实时告警、全部告警、触发器动作、通知配置
数据采集 模板管理、主机管理、Agent 管理、模板配置、自动发现
资产中心 资产列表、模型配置、变更记录、机柜管理
运维审计 设备列表、远程连接、设备授权、设备账号、运维记录、运维审计配置
报表中心 报表中心、报表归档、订阅任务、巡检中心、发送记录、日报周报
系统管理 用户管理、角色管理、菜单管理、分组管理、监控类型管理、代理管理、系统审计

4.4 新手上路五步

步 做什么 在哪儿做
1 确认要用的监控模板已启用 数据采集 → 模板配置
2 新建主机并绑定模板 数据采集 → 主机管理,或首页「添加监控」
3 在目标机安装采集程序 数据采集 → Agent 管理 → 手动安装
4 等几分钟,确认出数据 监控中心 → 综合监控
5 配置通知,让告警能找到人 告警管理 → 通知配置

5. 添加监控(纳管设备)

5.1 采集方式怎么选

对象类型 首选方式 备选 说明
Linux 服务器 Agent SNMP、SSH 能装 Agent 就装,指标最全
Windows 服务器 Agent(Windows 安装包) SNMP、WinRM 进程/端口数据由配套脚本提供
网络设备 / 安全设备 SNMP v2c / v3 SNMP Trap 只需要一个只读团体名
服务器带外管理 SNMP(iDRAC / iLO / XCC / iBMC / IPMI) Redfish 硬件健康、风扇、电源、RAID
数据库 外部脚本采集 Agent 本地采集 Oracle 需开启 Thick 模式
中间件 JMX HTTP、Agent Tomcat / WebLogic / Kafka 等
存储 SNMP / SMI-S 外部脚本 容量、LUN、RAID
虚拟化 / 云 API SNMP VMware、超融合、公有云
容器 Docker 插件 / kube-state-metrics — Docker、K8s

通用前提:先在设备侧准备好只读采集通道(SNMP 只读团体名、API 只读账号、SSH 只读用户),再到平台上纳管。不要使用管理账号或读写账号。

5.2 三种添加监控的方式

平台右上角的「添加监控」提供三种方式:

方式 适用场景
手动新增 零散几台设备,逐台添加
批量导入 按 Excel 模板一次导入多台
自动发现 给一个网段,平台自己扫描并列出可纳管设备

5.3 操作示例:纳管一台交换机

第 1 步 进入「监控中心 → 综合监控 → 资源列表」,点右上角「添加监控」。

img01.png

图 1 在「资源列表」右上角点「添加监控」

第 2 步 在弹窗里选「手动新增」,在「网络设备」分类下点选对应模板卡片,例如「03-H3C 交换机监控」。

img02.png

图 2 「添加监控」弹窗中选中对应模板

第 3 步 在主机详情页填写参数后保存。

img03.png

图 3 填写主机地址并在「模板与主机接口」里配置 SNMP

项 填什么
主机名称 设备的可识别名称,例如「核心交换机-01」
IP 地址 设备管理地址
模板 已自动带入上一步选择的模板
主机接口 类型选 SNMP;端口 161;SNMP 版本选 v2c;团体名填只读团体名

第 4 步 等 1 至 2 个采集周期(约 5 分钟),到「监控中心 → 综合监控 → 网络设备」就能看到数据。

看不到数据怎么查:① 在主机列表确认设备已创建且状态为「启用」;② 到「主机管理」点开这台设备,用「测试连接」确认 SNMP 是否能通;③ 到「监控中心 → 最新数据」搜这台设备,看有没有采集到值。

5.4 各类对象的纳管要点

对象 纳管前需要准备
服务器带外管理 BMC 管理口地址与只读 SNMP 账号;建议同时配置 SNMP Trap,硬件告警可实时上报
存储 管理地址与只读账号;重点关注容量类指标,存储写满是最常见的高优先级故障
虚拟化 / 超融合 只读 API 账号;一个管理端会带出几百台虚机,务必限定采集范围
云平台 只读 AccessKey;云监控需调用公网 API,要保证平台服务器能出网
数据库 只读连接账号;重点关注表空间、会话数、慢查询、主从延迟
中间件 需先在中间件侧开启远程监控端口,需重启生效,请走变更窗口
容器 Docker / K8s 只读接口;宿主机上看到的是代理进程,属正常现象
链路 拨测目标地址;带宽质量类模板可查看带宽与丢包
动环与安防 只读 SNMP;市电、UPS、温湿度这类告警直接关系设备安全,务必配置通知

6. 主机、模板与分组

6.1 主机管理

位置:数据采集 → 主机管理

  • 新建、编辑、启用、停用、删除主机
  • 给主机增加或移除监控模板
  • 查看某台主机的采集是否正常

6.2 模板管理

位置:数据采集 → 模板管理

  • 导入模板:把模板文件导入平台
  • 导出模板:选中模板导出,用于备份或迁移到其他环境

导入模板有先后顺序:被其他模板引用的模板必须先导入,否则会报错。请按随包的导入顺序清单操作。

6.3 模板配置

位置:数据采集 → 模板配置

这里决定「哪些模板会出现在添加监控向导里」。每个要用的模板都要登记:

要填的 说明
分类 / 子类型 例如「操作系统 / Linux」
是否显示 勾上才会出现在添加监控向导中
支持的接口 Agent / SNMP / IPMI / JMX 等

没有登记的模板,在添加监控向导里是选不到的。

6.4 Agent 管理

位置:数据采集 → Agent 管理

  • 查看已安装采集程序的机器
  • 「手动安装」里可以复制一条安装命令,在目标机上执行即可完成安装
  • Agent 管理里只显示 Linux / AIX 主机,Windows 主机请到「主机管理」查看
  • 新安装的机器需要等一轮同步(约 30 分钟)才会出现在列表里

6.5 分组管理

位置:系统管理 → 分组管理(主机组 / 模版组)

主机组决定三件事:报表的统计范围、告警的分派对象、角色的数据权限。

建议按「客户 / 项目」或「机房 / 机柜」或「业务系统」其中一个维度划分,不要混着来。

从上线第一天就要把分组定好。平台只保留 31 天明细,分组错了历史数据无法回溯重算。

7. 告警管理

7.1 实时告警与全部告警

  • 实时告警:当前还没有恢复的问题
  • 全部告警:历史告警,用于统计与追溯
  • 两者都支持按严重级别、主机、时间范围筛选

7.2 触发器动作

位置:告警管理 → 触发器动作

配置告警触发后要做什么:发送通知、执行远程命令、转工单。

7.3 通知配置

位置:告警管理 → 通知配置

步 内容
1 选择通知媒介:邮件 / Webhook / 短信 / 企业微信 / 钉钉
2 填写收件人与用户组(用户需先在用户管理里配好手机号与邮箱)
3 设置动作条件:哪些严重级别、哪些主机组走哪条通知
4 点「发送测试」验证

「发送测试」这一步一定要做。邮件通知失败绝大多数是邮件服务器参数填错,现场调一次比事后排查省事得多。报表中心的订阅邮件走同一套邮件配置。

7.4 告警处理闭环建议

  • 严重及以上(4 级及以上)走即时通知
  • 一般级别走汇总通知,避免告警风暴
  • 计划内变更提前设置维护窗口,维护期内的告警不计入可用率
  • 告警处理完成后要「确认」或「关闭」,否则会一直挂在未处理列表里

8. 监控中心

8.1 综合监控

左侧「综合监控」按对象类型分 13 个视图:

视图 看什么
资源列表 全部纳管主机与可用性
最新数据 任意监控项的最新值查询
操作系统 Linux / Windows 主机
云平台 虚拟化与云资源
中间件 Tomcat / MQ 等
网络设备 交换机 / 路由器 / 防火墙
数据库 Oracle / MySQL / PostgreSQL 等
服务器 带外硬件(风扇、电源、RAID)
存储 磁盘阵列 / 分布式存储
安全设备 防火墙 / WAF / 堡垒机
容器 Docker / K8s
链路 专线 / 网络质量
WEB 监测 Ping / TCP / UDP / Traceroute 拨测

8.2 服务端口与应用进程卡片

在列表页点任意一台主机,可进入它的详情页,其中两张卡片最常用:

  • 服务端口:这台机器上正在监听的端口
  • 应用进程:这台机器上的进程及其网络连接

卡片为空通常有两个原因:这台机器还没安装采集程序,或者采集项没有开启。先到「数据采集 → 主机管理」确认这台机器的采集状态。

8.3 最新数据

位置:监控中心 → 综合监控 → 最新数据

可以查任意一台设备、任意一个监控项的最新值。这是排查「平台到底有没有收到数据」的第一入口。

8.4 网络拓扑

位置:监控中心 → 网络拓扑

自动发现式拓扑,连线依赖设备的邻居信息。端口显示的名称取决于设备侧接口描述是否配置了友好名称,建议在设备侧把接口描述配上业务含义(例如「上联-核心SW-G1/0/1」),否则拓扑图上只能看到端口编号。

8.5 监控大屏

位置:监控中心 → 监控大屏

值班室投屏用的总览大屏,可直接全屏展示。

8.6 预警问题与 WEB 监测

  • 预警问题:探测类问题汇总
  • WEB 监测:Ping / TCP / UDP / Traceroute 四类拨测,支持用 Excel 模板批量导入监测目标

9. 资产中心

位置:资产中心

菜单 用途
资产列表 全部 IT 资产台账,可按模型、机房、业务筛选
模型配置 定义资产类型及其属性字段、资产之间的关系、属性单位
变更记录 谁在什么时候改了什么,等保与内审会查看
机柜管理 机房与机柜视图及配置,可查看资产在机柜中的位置

纳管的主机会自动进入资产台账,资产也可以反向关联到监控主机。资产数量较多时,先把机房与机柜建好,再批量导入资产并绑定位置。

10. 运维审计

位置:运维审计

平台内置堡垒机能力,用于远程运维与操作留痕。

菜单 用途
设备列表 已在堡垒机登记的设备
设备账号 纳管的运维账号(含特权账号)
设备授权 把「资产 + 账号」授权给用户或用户组,可限定时间段
远程连接 通过 Web 终端直接连接设备,免装客户端
运维记录 操作日志与会话回放
运维审计配置 会话录制策略、命令过滤、高危命令告警

页面点击后若出现空白,刷新一次即可,通常是浏览器缓存了旧地址导致的。

11. 报表中心

位置:报表中心

11.1 报表清单

序号 报表 面向谁 说明
1 设备可用性报表 技术 按主机或主机组统计可用率
2 告警统计分析报表 技术 告警量、级别分布、TOP 主机、趋势
3 资源容量报表 技术 CPU、内存、磁盘的容量与增长趋势
4 日报月报(运维服务报告) 客户领导 系统稳不稳、我们做了什么、需要客户决策什么

可用率是怎么算的(平台口径):

规则 说明
只统计严重及以上 只有严重级别 4 级及以上的告警才计入不可用
合并重叠区间 同时发生的多条告警只扣一次
排除维护窗口 维护窗口内的不可用不计入
目标值 默认 99.5%

11.2 生成报表

在「报表中心」选择报表与统计范围,生成后可在「报表归档」下载 Word 或 PDF。

如果 PDF 里中文显示成方块,是服务器缺少中文字体,请联系实施人员安装字体包,不是内容问题。

11.3 订阅任务与发送

位置:报表中心 → 订阅任务、发送记录

配置项 说明
任务名 便于识别,例如「某某医院-月度运维报告」
报表类型 四选一
周期 日 / 月 / 自定义
统计范围 主机组多选
收件人 可从平台用户里选,也可手动输入外部邮箱
格式 Word / PDF
启用开关 可随时暂停

现场必做:配置好订阅后先点「立即执行一次」,再用真实邮箱完整走一遍,最后到「发送记录」确认状态。失败时可以看到失败原因并重发。邮件附件多数网关限制在 10 至 20 MB,月报过大时可改用「正文摘要 + 平台下载链接」。

11.4 巡检中心与日报周报

  • 巡检中心:可以人工填写服务内容(例如「现场更换硬盘一块」),这些内容会汇入日报月报
  • 日报周报:定期服务报告的查看入口

巡检中心是把「技术数据」变成「服务工作量证明」的关键入口,建议值班或巡检当天就登记。

12. 系统管理

12.1 用户管理

位置:系统管理 → 用户管理

新建用户:填写用户名、姓名、手机、邮箱、所属角色;支持重置密码、启用与停用。

用户必须配好手机号和邮箱,否则收不到告警通知与报表订阅。

12.2 角色管理

位置:系统管理 → 角色管理

按最小权限原则建角色,可参考:

角色 建议权限
超级管理员 全部
运维主管 监控中心、告警、报表、资产,不含系统管理
值班人员 监控中心、告警(只读与确认)
客户查看 监控中心、报表(只读),限定主机组

12.3 菜单管理

位置:系统管理 → 菜单管理

用于调整角色能看到哪些菜单。修改之后如果页面权限没有变化,在「菜单管理」里保存一次即可生效。

12.4 监控类型管理

位置:系统管理 → 监控类型管理

维护「类型与子类型」「模板扩展配置」「模板附加说明」「模板图片资源」四块。

  • 模板附加说明:给模板写运维说明,会显示在添加监控页面上
  • 模板图片资源:给厂商或设备类型配图标,用于拓扑图与列表

12.5 代理管理

位置:系统管理 → 代理管理

当被监控对象分散在多个网段、或平台到设备的链路受限时,用代理就近采集,避免跨网段拉取。

12.6 系统审计

位置:系统管理 → 系统审计

查看操作日志、动作日志、登录日志,并配置审计策略。

审计日志默认保留 31 天;等保检查常要求更长,需要在部署时单独调整。

12.7 授权管理与版本更新

在右上角个人入口里,登录后可直接访问:

  • 授权信息:查看授权状态、到期时间与主机数余量
  • 版本更新:查看平台版本与升级包说明

交付前务必核验授权余量。授权到期后立即失效,主机数超限会影响新主机的纳管。

13. 日常运维与常见问题

13.1 每日与每周检查表

频率 检查什么 在哪儿看
每日 未处理告警是否清零 告警管理 → 实时告警
每日 有无主机长时间不可用 监控中心 → 综合监控 → 资源列表
每日 填写值班记录 报表中心 → 巡检中心
每周 磁盘与容量趋势 监控中心 → 综合监控 → 存储、操作系统
每周 报表是否正常发送 报表中心 → 发送记录
每月 授权余量与到期时间 右上角 → 授权信息
每月 用户与权限复查 系统管理 → 用户管理、角色管理

13.2 常见问题

Q1 添加了主机但一直没有数据?

依次确认:① 主机是「启用」状态;② 已关联监控模板;③ 接口里填的是设备真实 IP;④ 到「最新数据」搜这台主机,看有没有监控项。若是 Agent 方式,还要确认目标机上采集程序已安装并在运行。

Q2 主机在「Agent 管理」里找不到?

Agent 管理只显示 Linux 与 AIX 主机,Windows 主机不会出现在这里,请到「主机管理」查看。此外新安装的机器要等一轮同步(约 30 分钟)才会显示。

Q3 服务端口或应用进程卡片是空的?

先确认这台机器的采集项已经开启,再到「最新数据」搜索对应的监控项。Windows 主机需要先安装配套的采集脚本。

Q4 Windows 服务项很多,Linux 却没有?

这是模板能力差异,不是故障。可以在模板里用过滤规则只保留关心的服务,通常能从几十项压缩到几项。

Q5 取消注册后主机看不见了,重新添加又提示已存在?

这是主机的归属信息被清空了。请联系实施人员处理,不要删除后重建,删除会一并丢失历史数据。

Q6 报表里中文显示成方块?

服务器缺少中文字体,联系实施人员安装字体包即可,不是数据问题。

Q7 报表数字对不上?

依次确认:① 统计范围(主机组)是否选对;② 查询时间范围是否正确;③ 是否看的是最新值而不是历史值;④ 数据是否已超过 31 天(超过后只能看报表归档)。

Q8 页面打不开或显示空白?

先按 Ctrl + F5 强制刷新,仍不行则退出后重新登录。若整个平台都打不开,请联系实施人员检查服务状态。

Q9 改了配置不生效?

菜单权限、授权信息这类平台配置保存后即时生效;涉及服务端的改动需要联系实施人员执行部署操作。

Q10 邮件通知或报表收不到?

① 用户是否配置了邮箱;② 通知配置里是否点过「发送测试」并通过;③ 到「报表中心 → 发送记录」查看失败原因;④ 检查是否被对方邮件网关拦截。

智维运维管理平台 · 使用帮助手册
本页由构建脚本自动生成,请勿直接编辑 HTML。