1. 项目背景与核心价值
去年处理线上故障时,我经历过最痛苦的一次排查:某个微服务接口超时导致整个订单链路雪崩,但等我们找到根因时,业务损失已超百万。这件事让我意识到,传统的"故障发生→人工排查→修复"的被动模式已经行不通了。我们需要一个能自动追踪故障传播路径、快速定位根因的工具链——这就是"故障追溯节点工具"诞生的背景。
这个工具的核心价值在于构建完整的闭环体系:
- 实时感知:通过埋点自动捕获服务间调用关系
- 智能分析:基于拓扑图谱识别异常传播路径
- 精准定位:结合指标波动与日志特征锁定根因
- 自动处置:根据预设策略执行熔断/降级等操作
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 系统架构设计
2.1 整体技术栈选型
采用分层架构设计,各组件选型考虑如下:
| 层级 | 候选方案 | 最终选择 | 选择理由 |
|---|---|---|---|
| 数据采集 | OpenTelemetry/自研SDK | OpenTelemetry | 社区生态完善,支持自动注入traceID,与主流框架无缝集成 |
| 存储引擎 | ES/ClickHouse/Prometheus | ClickHouse | 百亿级trace数据查询性能优异,压缩比高达10:1 |
| 计算引擎 | Flink/Spark Streaming | Flink | 毫秒级延迟满足实时分析需求,exactly-once语义保证数据准确性 |
| 可视化 | Grafana/Kibana |
