opik

oscar9993 天前
opik
用 Opik 串起智能体开发全流程:提示词管理、试跑调试与版本发布假设你正在维护一个 AI 智能体,它需要调用大模型、使用几个工具函数、按照固定的系统提示词来回答问题。某天产品经理说,希望智能体的回答风格更简洁一点。你打开代码,找到那段写死的系统提示词,改了几个字,提交、构建、部署、等生效。然后测试同学跑了一轮,说效果不太好,还是原来的好。你只好再把代码改回去,再走一遍发布流程。
oscar99910 天前
opik·export data
Opik 数据导出实践:SDK、REST API、UI 与命令行怎么选用 Opik 记录了一段时间的 trace、span 和反馈之后,很多团队会开始考虑一个问题:这些数据能不能拿出来?答案是可以的。不管是做离线分析、备份、迁移环境,还是把数据同步到另一个工作区,Opik 都提供了对应的导出方式。官方文档里列了四种主要途径:SDK、REST API、UI 和命令行工具。每种方式适合的场景不太一样,选对了能省不少事,选错了可能会被速率限制卡住,或者导出到一半发现数据不完整。
oscar99912 天前
opik
用 Opik 追踪 LLM 应用成本:从仪表盘到自动补算的完整思路很多团队在做 LLM 应用时,前期注意力都放在效果上:回答准不准、工具调用顺不顺、用户体验好不好。等到项目慢慢跑起来,调用量上去了,才突然发现账单涨得比预期快。这时候再回头看,很难说清楚钱到底花在哪个模型、哪条链路、哪次请求上。成本问题表面看是财务问题,实际上更像个工程可观测性问题:如果没有把成本拆到每次调用、每条 trace、每个项目上,优化就无从下手。
oscar99912 天前
opik
用好 Opik 记录用户反馈:从手动标注到在线评估的一套实践在 AI Agent 的评测里,用户反馈往往是最容易被低估的一环。很多人会把注意力放在模型本身、提示词、工具调用链上,却忘了:一个 Agent 到底好不好,最终还是要看它在真实交互里有没有解决问题。用户说“这个回答不错”,或者用户默默点了个差评,背后都藏着可以拿来改进系统的信息。
oscar99913 天前
opik
用 Opik 可视化 Agent 执行图:让复杂流程一目了然如果你开发过基于 LLM 的 agent,大概率经历过这样的时刻:agent 的行为变得难以预测,它可能调用了错误的工具,或者在多个步骤之间反复横跳,又或者本该并行的操作却串行执行了。你打开追踪记录,看到一堆 span 和嵌套调用,虽然信息很全,但要在脑子里还原出整个执行流程,依然费劲。这时候,一张清晰的执行图往往胜过千言万语。
oscar99914 天前
多模态·opik
用 Opik 记录多模态追踪:图像、视频、音频附件的完整指南如果你正在开发 LLM 应用,可能已经习惯了记录文本输入输出。但现实世界中的 AI 应用远不止文字。用户可能会上传一张图片让模型分析,或者你的 agent 会生成一份图表报告,又或者语音助手的对话需要保存音频。这些多模态数据如果不能被追踪,调试和评估就会留下巨大的盲区。Opik 支持多模态追踪,让你不仅能记录文本,还能记录图像、视频、音频以及任何其他媒体文件。这篇文章会详细介绍如何在 Opik 中记录和管理这些附件,包括大小限制、代码示例、最佳实践和程序化管理。
oscar99915 天前
opik
给 LLM 应用加上追踪:Opik 日志记录实战指南如果你正在开发基于大语言模型的应用,可能已经发现一个现象:模型调用本身只是整个系统的一小部分。一个典型的 LLM 应用往往包含检索、预处理、后处理、工具调用等多个步骤。当用户反馈“回答不对”时,你很难一眼看出是检索环节没找到相关文档,还是提示词组装出了问题,又或者是模型本身在胡编。这时候,追踪就成了必不可少的工具。
oscar99921 天前
人工智能·opik·ollie
Ollie:Opik 内置的 AI 助手,让 Agent 调试从“看”变成“修”如果你正在开发 AI Agent,大概经历过这样的场景:线上跑得好好的,突然某个问题答错了,你打开日志平台,看到一堆 trace,却不知道从哪下手。想改代码,又得切到编辑器,改完再跑,再回来对比。来回折腾,时间全花在切换工具上。
我是有底线的