换个角度想
可观测性像汽车的仪表盘加行车记录仪:时速、油量、故障灯随时可见,出了事故还能调记录还原过程。没有仪表盘的车也能开——直到抛锚在半路。
术语 · 部署与运行
Observability
通过日志、指标和追踪了解线上系统是否正常以及问题发生在哪里。
给线上系统装上仪表盘
可观测性像汽车的仪表盘加行车记录仪:时速、油量、故障灯随时可见,出了事故还能调记录还原过程。没有仪表盘的车也能开——直到抛锚在半路。
23:58下单 ✓ 200
02:03支付 ✗ 超时
系统健康吗?
不知道,只能「感觉还行」
错误率0.1% → 46%!
响应200ms → 8s
凌晨 2 点支付挂了
没有任何人知道
错误率超过阈值
02:05 报警电话叫醒你
日志记下每件事
报警比用户投诉早十分钟,事故就小十倍。
「昨晚 8 点为什么变慢」——查指标和日志,不靠猜。
新版上线后盯错误率和延迟,确认没引入回归。
用户反馈「昨天下午下单一直失败」,但你的系统什么记录都没有。今天该补什么?
至少三件:给下单链路加日志(谁、何时、失败原因);加错误率指标和报警;最好补上请求追踪。这次只能道歉,补上之后,下次才能在用户开口前发现。
没有可观测性的系统不是「没出过事」,只是出了事你不知道。等用户告诉你的时候,影响已经扩大了。