文章目录
前言
好久没写博客📚了,懈怠了~
接下来会加油💪
简介
langfuse是什么:
Langfuse 是一个开源的 AI/LLM 工程平台(Open Source LLM Engineering Platform),专门帮团队协作调试、分析、评估和持续迭代 LLM 应用与 AI Agent。
langfuse在日常的测试工作中可以做些什么:
开发在代码中部署langfuse后,测试人员可通过api key来追踪AI智能体的一些关键指标如首token响应时长,Token 用量、成本等,对采购或者自研的智能体进行测试。
实战
此次项目以快速落地实现为主,目的是上手掌握langfuse的一些基本功能
- 使用Langfuse Cloud 免费版
👉Langfuse Cloud欧洲区
添加LLM连接:点击Settings - API Keys - Create new API keys,创建一个用于测试的API key
- 使用Python编写测试代码
我用的Juypter notebook
python
from langfuse.openai import openai
from langfuse import get_client
import os
# ========== 请替换成你自己的真实 Key ==========
os.environ["LANGFUSE_PUBLIC_KEY"] = ""
os.environ["LANGFUSE_SECRET_KEY"] = ""
os.environ["LANGFUSE_BASE_URL"] = "https://cloud.langfuse.com" # 如果你用的是日本区就改成 https://jp.cloud.langfuse.com
# ========== 请替换成你自己的真实的调用的模型API的Key,我用的grok ==========
XAI_API_KEY = ""
# ========================================
# 初始化
langfuse = get_client()
client = openai.OpenAI(
api_key=XAI_API_KEY,
base_url="https://api.x.ai/v1"
)
print("开始调用模型并上报 Trace...")
response = client.chat.completions.create(
model="grok-4.6",
messages=[
{"role": "system", "content": "你是一个专业的需求分析助手。"},
{"role": "user", "content": "请简单分析一下:用户希望系统支持上传Excel需求文档,并自动生成测试用例。"}
],
name="需求分析测试-手动脚本"
)
print("\n模型返回内容:")
print(response.choices[0].message.content)
# 强制把数据发送出去
langfuse.flush()
print("\n✅ Trace 已发送!请到 Langfuse 的 Tracing 页面刷新查看。")
- Tracing
运行测试脚本,Langfuse Cloud 页面,进入 Tracing 菜单查看结果


- 手动进行打分
Settings - Scores Configs - Add new score config建评分标准(Score Config)

回到 Tracing 里那条「需求分析测试-手动脚本」,点 Annotate:
选下面的 TRACE SCORES,因为上面 OBSERVATION SCORES是某一个具体步骤(这次就是那次模型调用)先不用。下面 TRACE SCORES整条会话/整次分析的好坏。

- 点 TRACE SCORES 下面那个 Select
- 列表里选 correctness
- 出现 True / False 后:结论没理解错、没编造 → True;有明显事实错误 → False。
- 等右上角出现 Score data saved
- 保存后关掉侧栏,应能看到 correctness。


问题
自动打分标准:
- 自动打分要再配模型、写评测提示词,比手动复杂
- 现在 Hobby 项目、样本很少,先手动定标准更值
- 公司内网业务暂时没接 Langfuse,自动评估也评不到真实页面
总结
文章介绍了开源 LLM 工程平台 Langfuse 在测试工作中的应用。通过实战演示了如何注册 Langfuse Cloud、配置 API Key、编写 Python 脚本调用模型并上报 Trace,以及如何在 Tracing 页面手动打分评估 AI 智能体。