本文共 4765 字,大约阅读时间需要 15 分钟。
系统监控是运维工作中重要的一环,本文以 atop 工具为例来介绍系统的重要监控项。
atop可以使用yum或apt包管理器进行安装。 中详细说明了 atop 中各监控项含义及atop命令用法。
如上图所示, atop 的界面分为上半部分的系统监控项和下半部分的进程列表。
atop 每10s更新一次系统监控项以及在这段时间内状态发生变化的进程,按下A键可以查看全部进程。
第一行PRC显示总体进程状况:
#proc
为当前总进程数, #trun
表示 running 状态线程数#tslpi
表示 sleeping interruptible 状态的进线程数#tslpu
表示 sleeping uninterruptible 状态线程数#zombie
表示僵尸进程数linux 中进程有两种 sleep 状态:
一个进程使用fork创建子进程,如果子进程退出,而父进程并没有调用wait或waitpid获取子进程的状态信息,那么子进程的进程描述符仍然保存在系统中,这种进程称之为僵尸进程。大量僵尸进程可能会占用进程描述符空间导致无法创建进程。
孤儿进程是容易与僵尸进程混淆的一类进程,孤儿进程是父进程终止的进程,它们会被 init 进程接管并不会产生危害。
在 atop 中每个 CPU 逻辑核心拥有一个 cpu
行表示自身状态, 最前面的 CPU 行则展示系统总览。
CPL 行表示 CPU 负载(CPU Load):
系统负载
CPU 负载或称为系统负载是一个容易被误解的监控项,它的定义为内核运行队列中 running 或 uninterruptible sleep 状态的进程的平均数与CPU计算能力的比值。
系统负载 1.0 说明CPU恰好满载,当系统负载大于1.0时会有进程因为等待CPU而阻塞。在多核系统中,系统负载等于CPU核心数表示恰好满载,如在上图所示双核系统中,load=2说明恰好满载。
上文已经说明,uninterruptible sleep 进程通常是在等待IO, 当网络异常或磁盘故障时会导致大量进程处于 uninterruptible sleep 状态从而导致 Load 急剧上升。
常见的服务器程序大多数为IO密集型程序,常见的CPU密集型任务包括:
当我们发现 CPU 使用率上升时,我们可以优先考虑是否在上述CPU密集型任务。
MEM 行描述内存使用情况:
这里出现了两个两个缓存: cache 和 buffer:
cache 是指 page cache, 是在文件系统级别的缓存。用于缓存从文件中读取的数据,下次读取文件时可以从内存中快速获取,不需要进行磁盘IO。
buffer 是磁盘等块设备的缓存,不经过文件系统直接对磁盘进行读写的数据会缓存在 buffer 中。
文件需要映射到物理磁盘的块上,这层映射关系由文件系统负责维护。没有文件系统支持的数据读写都会使用 buffer 缓存,比如文件系统元数据的缓存,以及 dd 等工具直接对磁盘进行读写时需要的缓存。
cache 和 buffer 两个缓存既会被用在读请求中,也会被用在写请求中。
PAG 行表示页缓存的使用情况:
scan 和 steal 的解释比较难理解,附上 man page 中的原文:
This line contains the number of scanned pages ('scan') due to the fact that free memory drops below a particular threshold and the number times that the kernel tries to reclaim pages due to an urgent need ('stall')
SWP 行表示 Swap 分区使用状态:
当物理内存不足时,内核会将进程内存中不常用的页逐出内存写入磁盘中的 Swap 分区,当进程需要读取这些页时再将它们从磁盘中加载到内存。
DSK 列描述磁盘使用情况:
网络层通常包含 transport、network、 eth 和 lo 行, 分别表示传输层、网络层、以太网(数据链路层)和本地回环的监控指标。
进程列表有多个视图分别展示不同方面的数据:
atop 默认展示过去10s内状态发生变化的进程,按下A键可以查看全部进程。
默认视图展示常用的监控项:
简单介绍一下进程状态
按M键可以进入内存视图查看进程的内存使用情况:
在 Linux 的内存管理系统中需要读取磁盘才能解决缺页中断称为大错误(Major Page Fault), 不需要读取磁盘可以解决的缺页中断被称为小错误(Minor Page Fault)。
一般情况下 MINFLT 是因为频繁分配/回收大内存块导致的,可以考虑使用内存池优化程序来减少缺页错误; MAJFLT 是由于物理内存不足导致。
按S键可以进入调度视图(Scheduling View)查看进程运行和CPU情况:
除了查看当前的状态外,atop 还可以服务方式运行在后台监控并记录系统状态。
使用 service atop start
或 systemctl start atop
命令启动atop监控服务。
atop 默认将数据保存在/var/log/atop
目录下,10 分钟采集一次,保留最近28天的数据。上述配置可以在 /etc/atop/atop.daily
文件中进行修改。
使用 atop -r <filename>
命令读取日志文件。按t键向前翻页,T键向后翻页,b键跳转到指定时间,时间格式为hh:mm。
转载地址:http://uxqzz.baihongyu.com/