运维巡检报告,运维巡检检查单,服务器系统及数据库性能检查,日常运维检查记录表格,信息系统日常运维检查(原件)
1 运维巡检表格
1.1 每日巡检记录单
1.2 周巡检报告
1.3 季度巡检报告
1.4 远程服务记录单
1.5 现场维护记录单
1.6 现场运维巡检服务单
1.7 服务器巡检记录
1.8 网络设备巡检记录
1.9 视频会议系统检测表
1.10 机房巡检报告
1.11 运维服务统计表
1.12 运维服务交接单
1.13 运维服务交接单
1.14 运维变更类台帐
文末附服务器检查表:
1、系统资源检查2、K8S集群检查
3、Nginx检查
4、JAVA应用检查
5、RabbitMQ检查
6、Redis检查
7、PostgreSQL检查
8、Elasticsearch检查
9、ELK日志系统检查
10、IDS(入侵检测)完整检查表
11、Linux完整检查表
12、MySQL完整检查表
13、Oracle完整检查表
14、SQL-server完整检查表
15、Tomcat完整检查表
16、WAF完整检查表
17、Weblogic完整检查表
18、windows完整检查表
19、防火墙策略调研表
20、防火墙完整检查表
软件全套资料部分文档清单:
工作安排任务书,可行性分析报告,立项申请审批表,产品需求规格说明书,需求调研计划,用户需求调查单,用户需求说明书,概要设计说明书,技术解决方案,数据库设计说明书,详细设计说明书,单元测试报告,总体测试计划,单元测试计划,产品集成计划,集成测试报告,集成测试计划,系统测试报告,产品交接验收单,验收报告,验收测试报告,压力测试报告,项目总结报告,立项结项审批表,成本估算表,项目计划,项目周报月报,风险管理计划,质量保证措施,项目甘特图,项目管理工具,操作手册,接口设计文档,软件实施方案,运维方案,安全检测报告,投标响应文件,开工申请表,开工报告,概要设计检查表,详细设计检查表,需求规格说明书检查表,需求确认表,系统代码编写规范,软件项目质量保证措施,软件部署方案,试运行方案,培训计划方案,软件系统功能检查表,工程试运行问题报告,软件合同,资质评审材料,信息安全相关文档等。建设方案部分资料清单:
信创云规划设计建设方案,新型智慧城市解决方案,医疗信息化中台技术架构方案,智慧消防建设规划方案,智慧校园技术方案,智慧医疗技术方案,智慧园区管理平台建设方案,智慧政务大数据整体技术解决方案,SRM系统解决方案,固定资产管理系统建设方案,工单管理系统建设方案,大数据管理平台技术方案,GIS地理信息服务平台建设方案,设备管理系统建设方案,远程抄表管理方案,BIM建模建设方案,数字孪生物联网云平台建设方案,仓储管理建设方案,智慧园区整体解决方案 ,智慧工地整体解决方案等等。
全部资料获取:本文末个人名片直接获取。
服务器巡检表
检查项目
检查指标
检查标准
系统资源
CPU 使用率
正常:<70%
低风险:≥ 70%
中风险:≥ 85%
高风险:≥ 95%
内存使用率
正常:<70%
低风险:≥ 70%
中风险:≥ 85%
高风险:≥ 95%
磁盘使用率
正常:<80%
异常:≥ 80%
系统负载
正常:<70%
低风险:≥ 70%
中风险:≥ 85%
高风险:≥ 95%
日志文件是否有异常
正常:日志中风险无 ERROR报错
低风险:日志中风险少量ERROR报错且不影响业务
中风险:日志出现5%以上的ERROR报错且影响非核心业务
高风险:日志中风险出现10%以上的ERROR报错且已经影响核心业务或者集群状态
系统服务是否正常运行
正常:没有Failed和Down状态的服务
低风险:有Failed和Down状态的服务但不影响业务
中风险:有Failed和Down状态的服务且影响非核心业务
高风险:有Failed和Down状态的服务已经影响部分业务或者集群状态
检查系统是否有波峰波谷
正常:指标线没有明显的大波动
低风险:少数波峰波谷,一天2-5次且持续时间不长
中风险:频繁波峰波谷,一天≥5次且持续时间不长
高风险:一直处于波峰波谷,无法提供服务
K8S集群
节点状态
正常:节点状态为 Ready
低风险:出现1台状态为NotReady
中风险:出现2台状态为NotReady
高风险:大于2台状态为NotReady
Pod 状态
正常:所有 Pod 状态为 Running
低风险:Pod状态为Running但出现重启的情况
中风险:非核心业务Pod出现不可用状态
高风险:核心业务Pod不可用
持久卷状态
正常:所有持久卷状态均为 Bound
低风险:持久卷出现异常但不影响业务
中风险:持久卷出现异常且影响非核心业务
高风险:所有持久卷不可用且核心业务受影响
节点资源使用情况
正常:所有节点资源使用率均低风险于 70%
低风险:所有节点资源使用率大于70%且不影响业务
中风险:所有节点资源使用率大于80%且影响非核心业务
高风险:所有节点资源使用率大于95%且影响核心业务
节点间通信是否正常
正常:节点间通信延迟低风险于 50ms,无丢包
低风险:节点间通信延迟大于 50ms但不影响业务
中风险:节点间通信延迟大于 100ms出现丢包,且影响非核心业务
高风险:节点间通信延迟大于 150ms出现丢包,且影响核心业务
Nginx
端口监听
正常:监听端口包含nginx配置文件监听的端口
低风险:监听端口不包含且不影响业务
中风险:监听端口不包含且影响非核心业务
高风险:监听端口不包含且影响核心业务
访问正常
正常:响应状态码为 200
低风险:出现非200但不影响业务
中风险:出现非200影响非核心业务
高风险:出现非200且影响核心业务
日志记录
正常:日志中风险无 ERROR报错
低风险:日志中风险少量ERROR报错,不影响使用
中风险:日志出现2%的ERROR报错,影响非重要业务
高风险:日志中风险出现10%以上的ERROR报错且已经影响部分重要业务
连接数
正常:<1024
低风险:≥ 1024
中风险:≥ 2048
高风险:≥ 4096
JAVA应用
程序运行状态
正常:服务正在运行
低风险:服务实例数<2但不影响业务
中风险:服务不可用数<2影响非核心业务
高风险:应用程序无法正常运行,核心服务不可用
检查Pod是否有波峰波谷
正常:指标线没有明显的大波动
低风险:少数波峰波谷,一天2-5次且持续时间不长
中风险:频繁波峰波谷,一天≥5次且持续时间不长
高风险:一直处于波峰波谷,无法征程提供服务
RabbitMQ
节点状态
正常:所有节点状态为 running
中风险:出现一个节点状态为down
高风险:所有节点状态为down
队列长度
正常:≤ 500
低风险:>500
中风险:>1000
高风险:> 2000
Redis
连接数
正常:<1024
低风险:≥ 1024
中风险:≥ 2048
高风险:≥ 4096
内存使用率
正常:<70%
低风险:≥ 70%
中风险:≥ 85%
高风险:≥ 95%
PostgreSQL
数据库连接数
正常:<1024
低风险:≥ 1024
中风险:≥ 2048
高风险:≥ 4096
磁盘空间使用率
正常:<80%
异常:≥ 80%
Elasticsearch
集群状态
正常:集群status为 green
低风险:集群status为 yellow
高风险:集群status 为 red,出现不可用状态
索引状态
正常:索引status为 open
高风险:索引status为 down
ELK日志系统
日志收集是否正常
正常:应用输出的日志是否与ELK收集的一致
低风险:日志出现不一致,收集不完全
索引状态
正常:索引status为 open
中风险:索引状态status为 down