一体化可观测性平台架构师【上海】 — 同星科技 | CodeTrace一体化可观测性平台架构师【上海】
偏后端 · 上海 · 经验门槛偏高(10 年+) · 技能线索 Kubernetes / Python / Kafka
岗位描述
职位描述
- OpenTelemetryPrometheusGrafanaLokiTempoJaegerSkyWalkingELK岗位定位:负责公司自研一体化可观测性平台的技术架构、核心方案设计和关键模块建设。平台基于主流开源系统构建,⾯向云原⽣、微服务、中间件、数据库、主机、容器和业务系统,提供统⼀的指标、日志、链路、告警、Das
岗位职责
- 负责一体化可观测性平台整体架构设计,覆盖 Metrics、Logs、Traces、Events、告警、Dashboard、SLO 等核心能力。
- 负责基于开源系统进行技术选型、集成和二次开发,包括但不限于 OpenTelemetry、Prometheus、Grafana、Loki、ELK、Jaeger、Tempo、ClickHouse、Kafka、VictoriaMetrics、Thanos、Mimir 等。
- 设计统一的数据采集、传输、存储、查询和告警链路,保障平台在大规模场景下的性能、稳定性和可扩展性。
- 推动统一 Agent、SDK、Exporter、Collector 等采集体系建设,规范业务系统、基础设施、中间件和云原生环境的接入方式。
- 负责可观测性数据模型设计,包括指标标签规范、日志字段规范、Trace 关联模型、资源模型和服务拓扑关系。
任职要求
- 8 年以上后端、平台、云原生、监控、日志、APM、SRE、数据平台或中间件研发经验。
- 具备可观测性平台、监控平台、日志平台、链路追踪平台、APM 平台或运维平台架构经验。
想讨论这类机会?
扫码进群,和我们交流方向与市场信号(不是投递表单)。
深入理解 Metrics、Logs、Traces、Events、SLO、告警治理、故障定位等可观测性核心概念。
熟悉至少一种主流可观测性开源体系,例如 Prometheus、OpenTelemetry、Grafana、Loki、ELK、Jaeger、Tempo、SkyWalking、VictoriaMetrics、Thanos、Mimir 等。熟悉 Kubernetes、容器、微服务、云原生基础设施,对云环境下的数据采集、服务发现、资源监控和故障定位有实践经验。加分项
- 主导过企业级可观测性平台、监控平台、APM 平台、日志平台、SRE 平台或云管平台建设。
- 对 OpenTelemetry Collector、Prometheus TSDB、ClickHouse、Elasticsearch、Grafana 插件、Loki、Tempo、SkyWalking 等有源码级理解或二次开发经验。
- 有千万级时间序列、TB/PB 级日志、百万级 Trace、高并发查询或大规模多租户平台经验。
- 有可观测性平台降本经验,例如采样、降采样、冷热分层、索引优化、存储压缩、生命周期管理等。
- 有开源贡献、技术博客、公开分享、专利或社区影响力。
为保护隐私与来源边界,仅展示经过脱敏与结构化整理的公开摘录。