langfuse测试实战(一): 配置一个简单的项目快速落地

文章目录

前言

好久没写博客📚了,懈怠了~

接下来会加油💪

简介

langfuse是什么:

Langfuse 是一个开源的 AI/LLM 工程平台(Open Source LLM Engineering Platform),专门帮团队协作调试、分析、评估和持续迭代 LLM 应用与 AI Agent。

langfuse在日常的测试工作中可以做些什么:

开发在代码中部署langfuse后,测试人员可通过api key来追踪AI智能体的一些关键指标如首token响应时长,Token 用量、成本等,对采购或者自研的智能体进行测试。

实战

此次项目以快速落地实现为主,目的是上手掌握langfuse的一些基本功能

  1. 使用Langfuse Cloud 免费版
    👉Langfuse Cloud欧洲区
    添加LLM连接:点击Settings - API Keys - Create new API keys,创建一个用于测试的API key
  2. 使用Python编写测试代码
    我用的Juypter notebook
python 复制代码
from langfuse.openai import openai
from langfuse import get_client
import os

# ========== 请替换成你自己的真实 Key ==========
os.environ["LANGFUSE_PUBLIC_KEY"] = ""
os.environ["LANGFUSE_SECRET_KEY"] = ""
os.environ["LANGFUSE_BASE_URL"] = "https://cloud.langfuse.com"   # 如果你用的是日本区就改成 https://jp.cloud.langfuse.com

# ========== 请替换成你自己的真实的调用的模型API的Key,我用的grok ==========
XAI_API_KEY = ""
# ========================================

# 初始化
langfuse = get_client()

client = openai.OpenAI(
    api_key=XAI_API_KEY,
    base_url="https://api.x.ai/v1"
)

print("开始调用模型并上报 Trace...")

response = client.chat.completions.create(
    model="grok-4.6",
    messages=[
        {"role": "system", "content": "你是一个专业的需求分析助手。"},
        {"role": "user", "content": "请简单分析一下:用户希望系统支持上传Excel需求文档,并自动生成测试用例。"}
    ],
    name="需求分析测试-手动脚本"
)

print("\n模型返回内容:")
print(response.choices[0].message.content)

# 强制把数据发送出去
langfuse.flush()
print("\n✅ Trace 已发送!请到 Langfuse 的 Tracing 页面刷新查看。")
  1. Tracing
    运行测试脚本,Langfuse Cloud 页面,进入 Tracing 菜单查看结果
  1. 手动进行打分

Settings - Scores Configs - Add new score config建评分标准(Score Config)

回到 Tracing 里那条「需求分析测试-手动脚本」,点 Annotate:

选下面的 TRACE SCORES,因为上面 OBSERVATION SCORES是某一个具体步骤(这次就是那次模型调用)先不用。下面 TRACE SCORES整条会话/整次分析的好坏。

  • 点 TRACE SCORES 下面那个 Select
  • 列表里选 correctness
  • 出现 True / False 后:结论没理解错、没编造 → True;有明显事实错误 → False。
  • 等右上角出现 Score data saved
  • 保存后关掉侧栏,应能看到 correctness。

问题

自动打分标准:

  • 自动打分要再配模型、写评测提示词,比手动复杂
  • 现在 Hobby 项目、样本很少,先手动定标准更值
  • 公司内网业务暂时没接 Langfuse,自动评估也评不到真实页面

总结

文章介绍了开源 LLM 工程平台 Langfuse 在测试工作中的应用。通过实战演示了如何注册 Langfuse Cloud、配置 API Key、编写 Python 脚本调用模型并上报 Trace,以及如何在 Tracing 页面手动打分评估 AI 智能体。

相关推荐
默_笙6 天前
🍙 给每个请求过安检:FastAPI 是怎么把校验写进类型注解的
python
qq_426003966 天前
启动playwright录制codegen生成自动化测试脚本
python·自动化
虎头金猫6 天前
4K 视频总卡在公网带宽?用 N1 + OpenList 把网盘播放链路重新理顺
运维·服务器·网络·python·容器·beautifulsoup·pandas
长沙三为智能科技6 天前
家政小程序开发从0到上线:五阶段交付流程与验收清单
python
伞伞悦读6 天前
【第38期】Python 模块与包详解:import、from、模块搜索路径、包结构和 __init__
开发语言·python
只睡四小时6 天前
Canvas 弹道联机实战:700 行 + 固定时间步长
python·websocket·html5·游戏开发·canvas
奇思妙想聪明勤奋的小羊6 天前
DeepAgents第5章:子Agent 与上下文隔离—让 Agent学会委派
人工智能·python·学习·语言模型
lpfasd1236 天前
2026年第38周GitHub趋势周报
python·科技·github
IZero076 天前
Jev 与 Laya
python·语言模型