AI 应用评测平台

本次搭建的AI 应用自动化评测平台采用界面、接口、业务逻辑、数据存储完全解耦的四层架构,如图1所示,各层独立迭代、高效协同,实现模块解耦与功能复用,提升平台的扩展性与迭代效率,各层技术实现与功能定位如下:

  1. 前端展示层:基于 React+Vite+TypeScript+TanStack Router+TanStack Query 实现,包含智能体注册、评测集、评估器、实验管理、运行实验、日志界面 6 大功能模块,提供可视化操作入口;
  2. API 网关层:依托 FastAPI 实现 RESTful API,结合 WebSocket 完成实时通信,通过 JWT/OAuth2 实现认证授权,为前后端交互提供标准化、安全化接口;
  3. 核心服务层:基于 Python+FastAPI+Langfuse SDK+SqlModel 实现,采用多 Agent 协作架构,包含智能体 / 评测集 / 评估器管理、生成评测集、评估器、生成评测报告四大核心模块,是平台智能化能力的核心载体;
  4. 数据存储层:采用异构存储方案,MySQL 存储核心业务数据、RAG 存储业务知识库、ClickHouse 存储时序分析数据,实现不同类型数据的高效管理与检索。

实现效果:

新建评测集页

评测集列表页

评估器详情页

评估器列表页

实验管理页面

实验详情页面

实验日志界面

评测报告页面

相关推荐
阿里云大数据AI技术1 小时前
光轮智能 × 阿里云:共建 Physical AI 云上数据、评测与持续学习基础设施
人工智能·机器学习
机器之心1 小时前
实锤了:Claude Code偷查用户,时区、中国AI实验室全是关键词
人工智能·openai
网易云信1 小时前
Cursor点燃个人开发者,企业级AI为何频频受挫?Agent工厂从提效工具到AI员工的跃迁
人工智能·开源
网易云信1 小时前
解锁触手可及的温暖:网易智企 x Wander Puffs AI 云游泡芙
人工智能
转转技术团队1 小时前
从 PRD 到可验证代码:AI 需求开发闭环实践
人工智能
机器之心1 小时前
飞书让表格变成「AI同事」加入群聊,不打开表就能用表
人工智能·openai
Bigfish_coding2 小时前
前端转agent-【python】-15 AI Agent 可观测性入门:LangFuse 链路追踪、Token 监控与 LLM 质量评估
人工智能
我唔知啊2 小时前
我把 Claude Code 拆成了一间餐厅:从一句话到一次回复,中间到底发生了什么
人工智能
Harry技术2 小时前
02 · Codex 核心概念:代理、沙箱、审批和项目说明书
人工智能
阿里云大数据AI技术3 小时前
Agentic Memory Extension 支持对接主流Agent - 适用于 Claude Code、CodeX等
人工智能·agent