智维运维管理平台 · 安装与使用手册
适用版本:3.0.2 及以上(zwops-install-20260926)
文档性质:交付版 · 面向平台使用人员与运维值班人员
最后更新:2026-09-30
本文档分两部分:第一部分是给实施与运维人员看的安装部署;第二部分是日常使用指引,只讲在界面上怎么点、怎么填、会看到什么结果。
第一部分 安装部署
1. 配置需求
操作系统
安装 openEuler 24.03 SP3(其他主流 Linux 发行版亦可)。
硬件建议
| 监控主机数 | CPU | 内存 | 硬盘 |
|---|---|---|---|
| 100 台以内 | 8 核 | 16 GB | 500 GB |
| 200 台以内 | 16 核 | 32 GB | 1000 GB |
| 500 台以内 | 24 核 | 64 GB | 2000 GB |
| 1000 台以内 | 32 核 | 128 GB | 3000 GB |
建议按未来三年的纳管规模选型;数据盘单独挂载,并预留 30% 以上余量。平台默认只保留 31 天的明细数据,更早的数据以报表归档形式留存,因此月报、季报需要从「报表归档」获取。
2. 安装步骤
- 把安装包上传到服务器任意目录,例如 /opt
- 解压安装包
- 进入解压后的目录
- 执行一键安装
- 全程无报错即安装完成,脚本会自动启动全部服务
unzip zwops-install-2026*.zip
cd zwops-install
bash install-all.sh
安装过程中如中断,重新执行 bash install-all.sh 会从断点继续,不会重复安装已完成的部分。
3. 安装后的三项检查
- 服务可访问:浏览器打开 http://<服务器IP>,能看到登录页。
- 能正常登录:用交付时提供的管理员账号登录,能看到「监控中心 → 首页」。
- 改掉初始密码:首次登录后立即到「系统管理 → 用户管理」修改管理员密码。
第二部分 平台使用
4. 快速上手
4.1 登录
浏览器打开 http://<服务器IP>,输入用户名 / 密码 / 图形验证码即可进入平台。登录状态保持 24 小时,超时后需要重新登录。
4.2 界面总览
| 区域 | 说明 |
|---|---|
| 顶部 | 平台名称、全局搜索、告警铃铛(显示未处理告警数)、个人入口 |
| 左侧 | 主导航菜单,按你的角色权限自动显示 |
| 主区 | 当前页面的内容 |
| 右上角个人入口 | 个人信息、授权信息、版本更新、退出登录 |
4.3 菜单地图
平台共 7 个一级模块、80 个菜单,按角色权限显示:
| 一级模块 | 二级菜单 |
|---|---|
| 监控中心 | 首页、预警问题、网络拓扑、监控大屏、综合监控 |
| 告警管理 | 实时告警、全部告警、触发器动作、通知配置 |
| 数据采集 | 模板管理、主机管理、Agent 管理、模板配置、自动发现 |
| 资产中心 | 资产列表、模型配置、变更记录、机柜管理 |
| 运维审计 | 设备列表、远程连接、设备授权、设备账号、运维记录、运维审计配置 |
| 报表中心 | 报表中心、报表归档、订阅任务、巡检中心、发送记录、日报周报 |
| 系统管理 | 用户管理、角色管理、菜单管理、分组管理、监控类型管理、代理管理、系统审计 |
4.4 新手上路五步
| 步 | 做什么 | 在哪儿做 |
|---|---|---|
| 1 | 确认要用的监控模板已启用 | 数据采集 → 模板配置 |
| 2 | 新建主机并绑定模板 | 数据采集 → 主机管理,或首页「添加监控」 |
| 3 | 在目标机安装采集程序 | 数据采集 → Agent 管理 → 手动安装 |
| 4 | 等几分钟,确认出数据 | 监控中心 → 综合监控 |
| 5 | 配置通知,让告警能找到人 | 告警管理 → 通知配置 |
5. 添加监控(纳管设备)
5.1 采集方式怎么选
| 对象类型 | 首选方式 | 备选 | 说明 |
|---|---|---|---|
| Linux 服务器 | Agent | SNMP、SSH | 能装 Agent 就装,指标最全 |
| Windows 服务器 | Agent(Windows 安装包) | SNMP、WinRM | 进程/端口数据由配套脚本提供 |
| 网络设备 / 安全设备 | SNMP v2c / v3 | SNMP Trap | 只需要一个只读团体名 |
| 服务器带外管理 | SNMP(iDRAC / iLO / XCC / iBMC / IPMI) | Redfish | 硬件健康、风扇、电源、RAID |
| 数据库 | 外部脚本采集 | Agent 本地采集 | Oracle 需开启 Thick 模式 |
| 中间件 | JMX | HTTP、Agent | Tomcat / WebLogic / Kafka 等 |
| 存储 | SNMP / SMI-S | 外部脚本 | 容量、LUN、RAID |
| 虚拟化 / 云 | API | SNMP | VMware、超融合、公有云 |
| 容器 | Docker 插件 / kube-state-metrics | — | Docker、K8s |
通用前提:先在设备侧准备好只读采集通道(SNMP 只读团体名、API 只读账号、SSH 只读用户),再到平台上纳管。不要使用管理账号或读写账号。
5.2 三种添加监控的方式
平台右上角的「添加监控」提供三种方式:
| 方式 | 适用场景 |
|---|---|
| 手动新增 | 零散几台设备,逐台添加 |
| 批量导入 | 按 Excel 模板一次导入多台 |
| 自动发现 | 给一个网段,平台自己扫描并列出可纳管设备 |
5.3 操作示例:纳管一台交换机
第 1 步 进入「监控中心 → 综合监控 → 资源列表」,点右上角「添加监控」。

图 1 在「资源列表」右上角点「添加监控」
第 2 步 在弹窗里选「手动新增」,在「网络设备」分类下点选对应模板卡片,例如「03-H3C 交换机监控」。

图 2 「添加监控」弹窗中选中对应模板
第 3 步 在主机详情页填写参数后保存。

图 3 填写主机地址并在「模板与主机接口」里配置 SNMP
| 项 | 填什么 |
|---|---|
| 主机名称 | 设备的可识别名称,例如「核心交换机-01」 |
| IP 地址 | 设备管理地址 |
| 模板 | 已自动带入上一步选择的模板 |
| 主机接口 | 类型选 SNMP;端口 161;SNMP 版本选 v2c;团体名填只读团体名 |
第 4 步 等 1 至 2 个采集周期(约 5 分钟),到「监控中心 → 综合监控 → 网络设备」就能看到数据。
看不到数据怎么查:① 在主机列表确认设备已创建且状态为「启用」;② 到「主机管理」点开这台设备,用「测试连接」确认 SNMP 是否能通;③ 到「监控中心 → 最新数据」搜这台设备,看有没有采集到值。
5.4 各类对象的纳管要点
| 对象 | 纳管前需要准备 |
|---|---|
| 服务器带外管理 | BMC 管理口地址与只读 SNMP 账号;建议同时配置 SNMP Trap,硬件告警可实时上报 |
| 存储 | 管理地址与只读账号;重点关注容量类指标,存储写满是最常见的高优先级故障 |
| 虚拟化 / 超融合 | 只读 API 账号;一个管理端会带出几百台虚机,务必限定采集范围 |
| 云平台 | 只读 AccessKey;云监控需调用公网 API,要保证平台服务器能出网 |
| 数据库 | 只读连接账号;重点关注表空间、会话数、慢查询、主从延迟 |
| 中间件 | 需先在中间件侧开启远程监控端口,需重启生效,请走变更窗口 |
| 容器 | Docker / K8s 只读接口;宿主机上看到的是代理进程,属正常现象 |
| 链路 | 拨测目标地址;带宽质量类模板可查看带宽与丢包 |
| 动环与安防 | 只读 SNMP;市电、UPS、温湿度这类告警直接关系设备安全,务必配置通知 |
6. 主机、模板与分组
6.1 主机管理
位置:数据采集 → 主机管理
- 新建、编辑、启用、停用、删除主机
- 给主机增加或移除监控模板
- 查看某台主机的采集是否正常
6.2 模板管理
位置:数据采集 → 模板管理
- 导入模板:把模板文件导入平台
- 导出模板:选中模板导出,用于备份或迁移到其他环境
导入模板有先后顺序:被其他模板引用的模板必须先导入,否则会报错。请按随包的导入顺序清单操作。
6.3 模板配置
位置:数据采集 → 模板配置
这里决定「哪些模板会出现在添加监控向导里」。每个要用的模板都要登记:
| 要填的 | 说明 |
|---|---|
| 分类 / 子类型 | 例如「操作系统 / Linux」 |
| 是否显示 | 勾上才会出现在添加监控向导中 |
| 支持的接口 | Agent / SNMP / IPMI / JMX 等 |
没有登记的模板,在添加监控向导里是选不到的。
6.4 Agent 管理
位置:数据采集 → Agent 管理
- 查看已安装采集程序的机器
- 「手动安装」里可以复制一条安装命令,在目标机上执行即可完成安装
- Agent 管理里只显示 Linux / AIX 主机,Windows 主机请到「主机管理」查看
- 新安装的机器需要等一轮同步(约 30 分钟)才会出现在列表里
6.5 分组管理
位置:系统管理 → 分组管理(主机组 / 模版组)
主机组决定三件事:报表的统计范围、告警的分派对象、角色的数据权限。
建议按「客户 / 项目」或「机房 / 机柜」或「业务系统」其中一个维度划分,不要混着来。
从上线第一天就要把分组定好。平台只保留 31 天明细,分组错了历史数据无法回溯重算。
7. 告警管理
7.1 实时告警与全部告警
- 实时告警:当前还没有恢复的问题
- 全部告警:历史告警,用于统计与追溯
- 两者都支持按严重级别、主机、时间范围筛选
7.2 触发器动作
位置:告警管理 → 触发器动作
配置告警触发后要做什么:发送通知、执行远程命令、转工单。
7.3 通知配置
位置:告警管理 → 通知配置
| 步 | 内容 |
|---|---|
| 1 | 选择通知媒介:邮件 / Webhook / 短信 / 企业微信 / 钉钉 |
| 2 | 填写收件人与用户组(用户需先在用户管理里配好手机号与邮箱) |
| 3 | 设置动作条件:哪些严重级别、哪些主机组走哪条通知 |
| 4 | 点「发送测试」验证 |
「发送测试」这一步一定要做。邮件通知失败绝大多数是邮件服务器参数填错,现场调一次比事后排查省事得多。报表中心的订阅邮件走同一套邮件配置。
7.4 告警处理闭环建议
- 严重及以上(4 级及以上)走即时通知
- 一般级别走汇总通知,避免告警风暴
- 计划内变更提前设置维护窗口,维护期内的告警不计入可用率
- 告警处理完成后要「确认」或「关闭」,否则会一直挂在未处理列表里
8. 监控中心
8.1 综合监控
左侧「综合监控」按对象类型分 13 个视图:
| 视图 | 看什么 |
|---|---|
| 资源列表 | 全部纳管主机与可用性 |
| 最新数据 | 任意监控项的最新值查询 |
| 操作系统 | Linux / Windows 主机 |
| 云平台 | 虚拟化与云资源 |
| 中间件 | Tomcat / MQ 等 |
| 网络设备 | 交换机 / 路由器 / 防火墙 |
| 数据库 | Oracle / MySQL / PostgreSQL 等 |
| 服务器 | 带外硬件(风扇、电源、RAID) |
| 存储 | 磁盘阵列 / 分布式存储 |
| 安全设备 | 防火墙 / WAF / 堡垒机 |
| 容器 | Docker / K8s |
| 链路 | 专线 / 网络质量 |
| WEB 监测 | Ping / TCP / UDP / Traceroute 拨测 |
8.2 服务端口与应用进程卡片
在列表页点任意一台主机,可进入它的详情页,其中两张卡片最常用:
- 服务端口:这台机器上正在监听的端口
- 应用进程:这台机器上的进程及其网络连接
卡片为空通常有两个原因:这台机器还没安装采集程序,或者采集项没有开启。先到「数据采集 → 主机管理」确认这台机器的采集状态。
8.3 最新数据
位置:监控中心 → 综合监控 → 最新数据
可以查任意一台设备、任意一个监控项的最新值。这是排查「平台到底有没有收到数据」的第一入口。
8.4 网络拓扑
位置:监控中心 → 网络拓扑
自动发现式拓扑,连线依赖设备的邻居信息。端口显示的名称取决于设备侧接口描述是否配置了友好名称,建议在设备侧把接口描述配上业务含义(例如「上联-核心SW-G1/0/1」),否则拓扑图上只能看到端口编号。
8.5 监控大屏
位置:监控中心 → 监控大屏
值班室投屏用的总览大屏,可直接全屏展示。
8.6 预警问题与 WEB 监测
- 预警问题:探测类问题汇总
- WEB 监测:Ping / TCP / UDP / Traceroute 四类拨测,支持用 Excel 模板批量导入监测目标
9. 资产中心
位置:资产中心
| 菜单 | 用途 |
|---|---|
| 资产列表 | 全部 IT 资产台账,可按模型、机房、业务筛选 |
| 模型配置 | 定义资产类型及其属性字段、资产之间的关系、属性单位 |
| 变更记录 | 谁在什么时候改了什么,等保与内审会查看 |
| 机柜管理 | 机房与机柜视图及配置,可查看资产在机柜中的位置 |
纳管的主机会自动进入资产台账,资产也可以反向关联到监控主机。资产数量较多时,先把机房与机柜建好,再批量导入资产并绑定位置。
10. 运维审计
位置:运维审计
平台内置堡垒机能力,用于远程运维与操作留痕。
| 菜单 | 用途 |
|---|---|
| 设备列表 | 已在堡垒机登记的设备 |
| 设备账号 | 纳管的运维账号(含特权账号) |
| 设备授权 | 把「资产 + 账号」授权给用户或用户组,可限定时间段 |
| 远程连接 | 通过 Web 终端直接连接设备,免装客户端 |
| 运维记录 | 操作日志与会话回放 |
| 运维审计配置 | 会话录制策略、命令过滤、高危命令告警 |
页面点击后若出现空白,刷新一次即可,通常是浏览器缓存了旧地址导致的。
11. 报表中心
位置:报表中心
11.1 报表清单
| 序号 | 报表 | 面向谁 | 说明 |
|---|---|---|---|
| 1 | 设备可用性报表 | 技术 | 按主机或主机组统计可用率 |
| 2 | 告警统计分析报表 | 技术 | 告警量、级别分布、TOP 主机、趋势 |
| 3 | 资源容量报表 | 技术 | CPU、内存、磁盘的容量与增长趋势 |
| 4 | 日报月报(运维服务报告) | 客户领导 | 系统稳不稳、我们做了什么、需要客户决策什么 |
可用率是怎么算的(平台口径):
| 规则 | 说明 |
|---|---|
| 只统计严重及以上 | 只有严重级别 4 级及以上的告警才计入不可用 |
| 合并重叠区间 | 同时发生的多条告警只扣一次 |
| 排除维护窗口 | 维护窗口内的不可用不计入 |
| 目标值 | 默认 99.5% |
11.2 生成报表
在「报表中心」选择报表与统计范围,生成后可在「报表归档」下载 Word 或 PDF。
如果 PDF 里中文显示成方块,是服务器缺少中文字体,请联系实施人员安装字体包,不是内容问题。
11.3 订阅任务与发送
位置:报表中心 → 订阅任务、发送记录
| 配置项 | 说明 |
|---|---|
| 任务名 | 便于识别,例如「某某医院-月度运维报告」 |
| 报表类型 | 四选一 |
| 周期 | 日 / 月 / 自定义 |
| 统计范围 | 主机组多选 |
| 收件人 | 可从平台用户里选,也可手动输入外部邮箱 |
| 格式 | Word / PDF |
| 启用开关 | 可随时暂停 |
现场必做:配置好订阅后先点「立即执行一次」,再用真实邮箱完整走一遍,最后到「发送记录」确认状态。失败时可以看到失败原因并重发。邮件附件多数网关限制在 10 至 20 MB,月报过大时可改用「正文摘要 + 平台下载链接」。
11.4 巡检中心与日报周报
- 巡检中心:可以人工填写服务内容(例如「现场更换硬盘一块」),这些内容会汇入日报月报
- 日报周报:定期服务报告的查看入口
巡检中心是把「技术数据」变成「服务工作量证明」的关键入口,建议值班或巡检当天就登记。
12. 系统管理
12.1 用户管理
位置:系统管理 → 用户管理
新建用户:填写用户名、姓名、手机、邮箱、所属角色;支持重置密码、启用与停用。
用户必须配好手机号和邮箱,否则收不到告警通知与报表订阅。
12.2 角色管理
位置:系统管理 → 角色管理
按最小权限原则建角色,可参考:
| 角色 | 建议权限 |
|---|---|
| 超级管理员 | 全部 |
| 运维主管 | 监控中心、告警、报表、资产,不含系统管理 |
| 值班人员 | 监控中心、告警(只读与确认) |
| 客户查看 | 监控中心、报表(只读),限定主机组 |
12.3 菜单管理
位置:系统管理 → 菜单管理
用于调整角色能看到哪些菜单。修改之后如果页面权限没有变化,在「菜单管理」里保存一次即可生效。
12.4 监控类型管理
位置:系统管理 → 监控类型管理
维护「类型与子类型」「模板扩展配置」「模板附加说明」「模板图片资源」四块。
- 模板附加说明:给模板写运维说明,会显示在添加监控页面上
- 模板图片资源:给厂商或设备类型配图标,用于拓扑图与列表
12.5 代理管理
位置:系统管理 → 代理管理
当被监控对象分散在多个网段、或平台到设备的链路受限时,用代理就近采集,避免跨网段拉取。
12.6 系统审计
位置:系统管理 → 系统审计
查看操作日志、动作日志、登录日志,并配置审计策略。
审计日志默认保留 31 天;等保检查常要求更长,需要在部署时单独调整。
12.7 授权管理与版本更新
在右上角个人入口里,登录后可直接访问:
- 授权信息:查看授权状态、到期时间与主机数余量
- 版本更新:查看平台版本与升级包说明
交付前务必核验授权余量。授权到期后立即失效,主机数超限会影响新主机的纳管。
13. 日常运维与常见问题
13.1 每日与每周检查表
| 频率 | 检查什么 | 在哪儿看 |
|---|---|---|
| 每日 | 未处理告警是否清零 | 告警管理 → 实时告警 |
| 每日 | 有无主机长时间不可用 | 监控中心 → 综合监控 → 资源列表 |
| 每日 | 填写值班记录 | 报表中心 → 巡检中心 |
| 每周 | 磁盘与容量趋势 | 监控中心 → 综合监控 → 存储、操作系统 |
| 每周 | 报表是否正常发送 | 报表中心 → 发送记录 |
| 每月 | 授权余量与到期时间 | 右上角 → 授权信息 |
| 每月 | 用户与权限复查 | 系统管理 → 用户管理、角色管理 |
13.2 常见问题
Q1 添加了主机但一直没有数据?
依次确认:① 主机是「启用」状态;② 已关联监控模板;③ 接口里填的是设备真实 IP;④ 到「最新数据」搜这台主机,看有没有监控项。若是 Agent 方式,还要确认目标机上采集程序已安装并在运行。
Q2 主机在「Agent 管理」里找不到?
Agent 管理只显示 Linux 与 AIX 主机,Windows 主机不会出现在这里,请到「主机管理」查看。此外新安装的机器要等一轮同步(约 30 分钟)才会显示。
Q3 服务端口或应用进程卡片是空的?
先确认这台机器的采集项已经开启,再到「最新数据」搜索对应的监控项。Windows 主机需要先安装配套的采集脚本。
Q4 Windows 服务项很多,Linux 却没有?
这是模板能力差异,不是故障。可以在模板里用过滤规则只保留关心的服务,通常能从几十项压缩到几项。
Q5 取消注册后主机看不见了,重新添加又提示已存在?
这是主机的归属信息被清空了。请联系实施人员处理,不要删除后重建,删除会一并丢失历史数据。
Q6 报表里中文显示成方块?
服务器缺少中文字体,联系实施人员安装字体包即可,不是数据问题。
Q7 报表数字对不上?
依次确认:① 统计范围(主机组)是否选对;② 查询时间范围是否正确;③ 是否看的是最新值而不是历史值;④ 数据是否已超过 31 天(超过后只能看报表归档)。
Q8 页面打不开或显示空白?
先按 Ctrl + F5 强制刷新,仍不行则退出后重新登录。若整个平台都打不开,请联系实施人员检查服务状态。
Q9 改了配置不生效?
菜单权限、授权信息这类平台配置保存后即时生效;涉及服务端的改动需要联系实施人员执行部署操作。
Q10 邮件通知或报表收不到?
① 用户是否配置了邮箱;② 通知配置里是否点过「发送测试」并通过;③ 到「报表中心 → 发送记录」查看失败原因;④ 检查是否被对方邮件网关拦截。