langfuse测试实战(一): 配置一个简单的项目快速落地

文章目录

前言

好久没写博客📚了,懈怠了~

接下来会加油💪

简介

langfuse是什么:

Langfuse 是一个开源的 AI/LLM 工程平台(Open Source LLM Engineering Platform),专门帮团队协作调试、分析、评估和持续迭代 LLM 应用与 AI Agent。

langfuse在日常的测试工作中可以做些什么:

开发在代码中部署langfuse后,测试人员可通过api key来追踪AI智能体的一些关键指标如首token响应时长,Token 用量、成本等,对采购或者自研的智能体进行测试。

实战

此次项目以快速落地实现为主,目的是上手掌握langfuse的一些基本功能

  1. 使用Langfuse Cloud 免费版
    👉Langfuse Cloud欧洲区
    添加LLM连接:点击Settings - API Keys - Create new API keys,创建一个用于测试的API key
  2. 使用Python编写测试代码
    我用的Juypter notebook
python 复制代码
from langfuse.openai import openai
from langfuse import get_client
import os

# ========== 请替换成你自己的真实 Key ==========
os.environ["LANGFUSE_PUBLIC_KEY"] = ""
os.environ["LANGFUSE_SECRET_KEY"] = ""
os.environ["LANGFUSE_BASE_URL"] = "https://cloud.langfuse.com"   # 如果你用的是日本区就改成 https://jp.cloud.langfuse.com

# ========== 请替换成你自己的真实的调用的模型API的Key,我用的grok ==========
XAI_API_KEY = ""
# ========================================

# 初始化
langfuse = get_client()

client = openai.OpenAI(
    api_key=XAI_API_KEY,
    base_url="https://api.x.ai/v1"
)

print("开始调用模型并上报 Trace...")

response = client.chat.completions.create(
    model="grok-4.6",
    messages=[
        {"role": "system", "content": "你是一个专业的需求分析助手。"},
        {"role": "user", "content": "请简单分析一下:用户希望系统支持上传Excel需求文档,并自动生成测试用例。"}
    ],
    name="需求分析测试-手动脚本"
)

print("\n模型返回内容:")
print(response.choices[0].message.content)

# 强制把数据发送出去
langfuse.flush()
print("\n✅ Trace 已发送!请到 Langfuse 的 Tracing 页面刷新查看。")
  1. Tracing
    运行测试脚本,Langfuse Cloud 页面,进入 Tracing 菜单查看结果
  1. 手动进行打分

Settings - Scores Configs - Add new score config建评分标准(Score Config)

回到 Tracing 里那条「需求分析测试-手动脚本」,点 Annotate:

选下面的 TRACE SCORES,因为上面 OBSERVATION SCORES是某一个具体步骤(这次就是那次模型调用)先不用。下面 TRACE SCORES整条会话/整次分析的好坏。

  • 点 TRACE SCORES 下面那个 Select
  • 列表里选 correctness
  • 出现 True / False 后:结论没理解错、没编造 → True;有明显事实错误 → False。
  • 等右上角出现 Score data saved
  • 保存后关掉侧栏,应能看到 correctness。

问题

自动打分标准:

  • 自动打分要再配模型、写评测提示词,比手动复杂
  • 现在 Hobby 项目、样本很少,先手动定标准更值
  • 公司内网业务暂时没接 Langfuse,自动评估也评不到真实页面

总结

文章介绍了开源 LLM 工程平台 Langfuse 在测试工作中的应用。通过实战演示了如何注册 Langfuse Cloud、配置 API Key、编写 Python 脚本调用模型并上报 Trace,以及如何在 Tracing 页面手动打分评估 AI 智能体。

相关推荐
一位正在转型AI全栈的前端工程师1 小时前
AI 全栈学习之旅 -Week 8:从单 Agent 到多 Agent 协作:LangGraph 实战与记忆持久化
前端·python
长江后浪博客1 小时前
Python + YOLOv8 疲劳驾驶 AI 视觉检测入门:从模型训练到 ONNX 实时摄像头检测完整实战
人工智能·python·yolo·疲劳驾驶检测·onnx·yolov8
hhzz2 小时前
【OpenCV 入门到精通 01】认识 OpenCV 与计算机视觉:从零建立全局认知
人工智能·python·opencv·计算机视觉·开源
一马平川的大草原2 小时前
如何实现SVG转Mermaid图
python·svg·格式转换·mermaid
PFFstronger2 小时前
基于 Dify 知识库 + Ollama 大模型,自动生成测试用例并导出 XMind 的完整方案
人工智能·python·测试用例·xmind
SomeBottle3 小时前
【小记】图片托管从又拍云迁移到腾讯云 EO + COS(兼容图片处理参数)
python·计算机网络·学习笔记·对象存储·cdn·折腾
cts6183 小时前
FDE架构师前端选型指南
python
2601_962293794 小时前
【Python教程:自动化处理文件】
python·自动化·编程·文件处理·os模块
禹凕4 小时前
快速幂算法详解与实战
python·算法