腾讯mini项目-【指标监控服务重构】2023-08-24

今日已办

Jeager

功能

  1. 监控分布式工作流程并排除故障
  2. 识别性能瓶颈
  3. 追踪根本原因
  4. 分析服务依赖关系

部署

yaml 复制代码
version: "3"

services:
  proxy:
    image: traefik:v3.0
    container_name: proxy
    hostname: proxy
    networks:
      - elastic-jaeger
    ports:
      - "80:80"
      - "8080:8080"
    command:
      - --ping=true
      - --api.dashboard=true
      - --api.insecure=true
      - --providers.file.directory=/etc/traefik
      - --providers.file.watch=true
      - --entrypoints.web-entrypoint.address=:80
      - --entrypoints.kafka-entrypoint.address=:9092
      - --accesslog=true
      - --metrics.openTelemetry=true
      - --metrics.openTelemetry.address=jaeger-collector:4317
      - --metrics.openTelemetry.grpc=true
      - --metrics.openTelemetry.insecure=true
      - --tracing.openTelemetry=true
      - --tracing.openTelemetry.address=jaeger-collector:4317
      - --tracing.openTelemetry.grpc=true
      - --tracing.openTelemetry.insecure=true
      - --log.level=WARN # DEBUG, INFO, WARN, ERROR, FATAL, PANIC
    healthcheck:
      test: [ "CMD-SHELL", "traefik healthcheck --ping" ]
      interval: 5s
      timeout: 3s
      retries: 3
    volumes:
      - ./config/traefik:/etc/traefik

  elasticsearch:
    image: elasticsearch:7.17.12
    container_name: elasticsearch
    networks:
      - elastic-jaeger
    ports:
      - "127.0.0.1:9200:9200"
      - "127.0.0.1:9300:9300"
    restart: on-failure
    environment:
      - cluster.name=jaeger-cluster
      - discovery.type=single-node
      - http.host=0.0.0.0
      - transport.host=127.0.0.1
      - ES_JAVA_OPTS=-Xms512m -Xmx512m
      - xpack.security.enabled=false
    volumes:
      - esdata:/usr/share/elasticsearch/data

  jaeger-collector:
    container_name: jaeger-collector
    image: jaegertracing/jaeger-collector
    ports:
      - "14269:14269"
      - "14268:14268"
      - "14267:14267"
      - "14250:14250"
      - "9411:9411"
      - "4317:4317"
    networks:
      - elastic-jaeger
    restart: on-failure
    environment:
      - SPAN_STORAGE_TYPE=elasticsearch
    command: [
      "--es.server-urls=http://elasticsearch:9200",
      "--es.num-shards=1",
      "--es.num-replicas=0",
      "--log-level=error"
    ]
    depends_on:
      - elasticsearch

  jaeger-agent:
    container_name: jaeger-agent
    image: jaegertracing/jaeger-agent
    hostname: jaeger-agent
    command: [ "--reporter.grpc.host-port=jaeger-collector:14250" ]
    ports:
      - "5775:5775/udp"
      - "6831:6831/udp"
      - "6832:6832/udp"
      - "5778:5778"
    networks:
      - elastic-jaeger
    restart: on-failure
    environment:
      - SPAN_STORAGE_TYPE=elasticsearch
    depends_on:
      - jaeger-collector

  jaeger-query:
    container_name: jaeger-query
    image: jaegertracing/jaeger-query
    environment:
      - SPAN_STORAGE_TYPE=elasticsearch
      - no_proxy=localhost
    ports:
      - "16686:16686"
      - "16687:16687"
    networks:
      - elastic-jaeger
    restart: on-failure
    command: [
      "--es.server-urls=http://elasticsearch:9200",
      "--span-storage.type=elasticsearch",
      "--log-level=debug"
    ]
    depends_on:
      - jaeger-agent

volumes:
  esdata:
    driver: local

networks:
  elastic-jaeger:
    driver: bridge

可以看到指标了

jaeger的 trace 展示与 grafana,signoz 不一致

出现异常,为修改相关代码,先前可以在Prometheus观测到traefik的指标【已修复】

Otel-collector 的 Pipeline

理解了整个 otel-collector 的 Pipeline 的流程和各个组件的功能

  • spanmetrics 是一个 connector
  • 它可以作为一个 receiver 【可以接收上游 trace pipeline 的 spanmetrics - 它作为一个 exporter】来开启一个metric 的 pipeline
  • 它可以作为一个 exporter 【存储 trace pipeline 的 span 指标】
  • spanmetrics 定义为 processer,可以在 trace 的 pipeline 中将 span的指标导出到 Prometheus 里

可以观测到 traefik、venus、profile 上报的 metrics!

明日待办

  1. 压测 jaeger
  2. 测试替换 jaeger 的数据库为 es
相关推荐
说私域1 小时前
社群经济下开源链动2+1模式AI智能名片S2B2C商城小程序的信任重构机制研究
人工智能·小程序·重构
GM_82810 小时前
从0开始在Go当中使用Apache Thrift框架(万字讲解+图文教程+详细代码)
rpc·go·apache·thrift
天若有情67314 小时前
新闻通稿 | 软件产业迈入“智能重构”新纪元:自主进化、人机共生与责任挑战并存
服务器·前端·后端·重构·开发·资讯·新闻
BJ_Bonree14 小时前
圆桌论坛精华实录 | AI是重构运维逻辑的颠覆性革命?博睿数据与行业大咖亲授“AI+可观测性”的破局之道
运维·人工智能·重构
终端域名14 小时前
从 Grok 4 多智能体协同到 RAG 范式革命:2025 年 AI 工作流的技术重构生成
人工智能·重构
Kratos开源社区16 小时前
别卷 LangChain 了!Blades AI 框架让 Go 开发者轻松打造智能体
go·agent·ai编程
Kratos开源社区16 小时前
跟 Blades 学 Agent 设计 - 01 用“提示词链”让你的 AI 助手变身超级特工
llm·go·agent
Mxsoft61920 小时前
电力系统数字孪生驱动的拓扑重构与自愈控制策略
重构
百锦再1 天前
第10章 错误处理
java·git·ai·rust·go·错误·pathon
yangrenrui1 天前
Sleeping Cup:重构OI竞技生态的公益编程乐园
重构