运维必懂:服务器监控和告警基础

监控分两步先有数据再告警,盯住CPU内存磁盘网络,告警分级别疲劳
发布于
5

监控不是装个面板就完事

很多新手以为装个监控面板、看个 CPU 曲线就叫运维监控了。其实监控的核心是:在用户投诉之前,你先知道哪里要出问题。它分两步,先有数据,再有告警,缺一不可。

先盯住几个基础指标

指标 看什么 异常信号
CPU 使用率和负载 长期 80% 以上,或者负载远超核数
内存 已用和可用 快吃满开始用 swap,性能会断崖
磁盘 使用率和 IO 空间快满,或者 IO 持续打满
网络 入出带宽和连接数 带宽跑满,或者异常连接暴增

这四个里磁盘最容易被忽视,等根分区写满服务直接起不来,那种半夜被叫起来的经历谁都不想有。

告警得有阈值和分级

监控看完没告警,等于没人盯。告警要设阈值,并且分级:

  • 警告级:比如 CPU 持续 70%,提醒一下,不一定要立刻处理;
  • 严重级:比如磁盘 90%、服务端口不通,马上通知到人;
  • 别什么都报严重,告警疲劳了真出事反而没人看。

通知渠道用你真的会看的,比如直接发到运维群。邮件告警大概率被淹没,关键时刻等于没告。

日志别只存不看的

监控看的是当下,日志看的是过去。出事之后复盘、定位原因全靠日志。关键服务的错误日志、访问日志定期留着,最好能检索。很多面板自带日志聚合,新手用现成的就够,别一上来就折腾复杂的采集栈。

常用的轻量做法

  • 云厂商自带的监控先开起来,零成本覆盖基础指标;
  • 面板(比如宝塔)里的监控模块能用就用,够中小站;
  • 写几个简单的脚本定时查端口和进程,挂了自动重启并通知;
  • 定期看一眼趋势,别等告警响了才关心。

合规提醒

服务器监控与日志管理需遵守网络安全法及数据安全相关要求,日志中不得留存明文密码等敏感信息,不得利用监控从事未授权行为。

常见问题

监控工具越复杂越好吗

不是。中小站把基础指标盯好、告警别疲劳就够,复杂的采集栈反而增加维护负担。

为什么告警没人看

多半是告警太多没分级,或者通知渠道没人盯。分级加有效渠道能解决大部分。

磁盘监控为什么特别重要

根分区写满服务直接起不来,而且往往发生在半夜,提前预警能避免被动救火。

本文由作者原创/授权发布于极跃圈(jiyueip.com)未经许可,禁止转载。题图来自Unsplash,基于CC0协议。

声明:极跃圈(JIYUEIP.com)内网友所发表的所有内容及言论仅代表其本人,并不反映任何极跃圈(JIYUEIP.com)之意见及观点。

0 讨论
热门最新
总结
暂无总结
0 / 600