生产环境故障排查实战

30 节教程 · 点击章节开始阅读

01生产故障排查总纲:先止血再定位开始阅读 ›02排查信息收集与三板斧开始阅读 ›03可观测三件套:指标、日志与链路追踪开始阅读 ›04排查工具箱与命令速查开始阅读 ›05负载与 CPU 判读:load、top、vmstat开始阅读 ›06CPU 飙高定位与火焰图开始阅读 ›07内存问题:free 判读、OOM 与泄漏开始阅读 ›08磁盘与 IO 排查:iostat、inode、句柄开始阅读 ›09网络排查:连接、丢包、重传与 DNS开始阅读 ›10接口慢排查全流程开始阅读 ›11耗时拆分:把 3 秒拆成 30 毫秒开始阅读 ›12线程池与协程泄漏排查开始阅读 ›13JVM 线上排查:GC、线程与 Arthas开始阅读 ›14Go 服务排查:pprof 实战开始阅读 ›15长尾延迟:P99 与 GC 抖动开始阅读 ›16MySQL 排查总览与健康巡检开始阅读 ›17慢 SQL 定位与执行计划开始阅读 ›18锁等待与死锁排查开始阅读 ›19连接数、线程与连接池开始阅读 ›20主从延迟与复制故障开始阅读 ›21表空间、binlog 与在线 DDL开始阅读 ›22Redis 排查总览与巡检清单开始阅读 ›23Redis 阻塞与延迟定位开始阅读 ›24大 key 与热 key 治理开始阅读 ›25内存、淘汰与碎片开始阅读 ›26集群与故障转移排查开始阅读 ›27Nginx 错误码排查:499/502/504开始阅读 ›28消息堆积与依赖超时开始阅读 ›29容器与 K8s 排查:OOMKilled 与重启开始阅读 ›30止血、复盘与高频案例合集开始阅读 ›