本层负责什么
应用与运行时层关注进程是否存活、是否还能及时处理请求,以及代码和依赖在什么条件下失败。崩溃、内存耗尽、线程池饱和、事件循环阻塞和外部依赖变慢都可能表现为接口超时。首先要保存失败现场并建立时间关联,再用最小负载验证具体瓶颈。
常见症状
这些现象用于判断排查入口,不代表已经确定根因。先记录原始错误和时间,再执行首轮检查。
- 进程退出、被信号终止,或启动后很快再次失败
- 健康接口超时,但 CPU、线程或事件循环出现持续阻塞
- 内存持续增长、触发 OOM,或垃圾回收停顿显著增加
- 只有特定接口、输入或依赖调用导致错误率和延迟升高
首轮检查清单
按顺序执行并保存输出。每一步只改变一个变量,避免让恢复动作覆盖真正的失败证据。
- 保存失败现场先记录退出码、信号、异常栈、进程启动参数和失败前后的应用日志。
- 关联资源时间线对齐 CPU、内存、线程/句柄、事件循环延迟与请求错误率,确认先后关系。
- 缩小触发条件按接口、输入、版本和依赖逐步收敛,在隔离环境复现而不是直接在线试错。
- 验证恢复标准修复后同时检查错误率、延迟和进程资源稳定性,避免只以“进程在运行”作为结论。
操作边界
采集日志、状态和低开销指标通常可在线执行;堆转储、跟踪器和压力测试可能显著增加负载。未评估磁盘、性能和敏感数据风险前,不应直接在生产进程开启高开销诊断。
何时升级或切换层级
当证据指向其他系统边界,立即带着时间、环境和原始输出交接,避免在当前层重复执行无关操作。
- 进程因容器限制或调度策略被终止:转入容器与编排层。
- 阻塞发生在数据库或缓存调用:携带调用时间线转入数据层。
- 系统级内存、句柄或磁盘耗尽影响多个服务:转入系统与安全层。