一篇搞定:用 curl 测试私有部署模型联通性

在私有部署模型环境里,最常见的排查动作就是先看服务是否存活,再分别验证对话模型和向量模型是否能正常收发请求。下面这组命令可以直接作为联通性测试模板使用。

01 | 先检查服务健康状态

笔者通常会先访问健康检查接口,确认两个服务端口是否可达:

bash 复制代码
curl -i http://[已脱敏IP]:8000/health
curl -i http://[已脱敏IP]:8002/health

这里可以先把关注点放在两件事上:一是地址 http://[已脱敏IP] 是否能访问,二是端口 80008002 是否分别有服务响应。

02 | 分别验证对话与向量接口

健康检查通过后,就可以继续发起实际请求。对话模型测试命令如下:

bash 复制代码
curl http://[已脱敏IP]:8000/v1/chat/completions \
 -H "Authorization: Bearer sk-xxxxxxxxxxxxxxxxxxxxxx" \
 -H "Content-Type: application/json" \
 -d '{
 "model": "qwen3.6-35b",
 "messages": [{"role": "user", "content": "你好,简单介绍自己"}],
 "temperature": 0.1
 }'

这条命令对应的是 8000 端口,对应模型为 qwen3.6-35b。如果接口联通,通常就能直接拿到一次对话返回。

向量模型测试命令如下:

bash 复制代码
curl http://[已脱敏IP]:8002/v1/embeddings \
 -H "Authorization: Bearer sk-xxxxxxxxxxxxxxxxxxxxxx" \
 -H "Content-Type: application/json" \
 -d '{
 "model": "qwen3-embedding",
 "input": ["测试文本,用于向量生成"]
 }'

这条命令对应的是 8002 端口,请求模型为 qwen3-embedding,输入是一段测试文本,用来验证向量生成接口是否可用。

03 | 一次排查的推荐顺序

如果只是想快速判断链路是否通,顺序可以很简单:

① 先测健康接口

先执行两个 /health 请求,确认基础服务在线。

② 再测业务接口

分别测试 /v1/chat/completions/v1/embeddings,确认聊天能力和向量能力都能正常接入。

③ 按端口区分问题

8000 主要看对话模型,8002 主要看向量模型。这样排查时更容易定位是哪一路服务异常。

关注我,和AI一起成长~

相关推荐
Sophnet云平台2 小时前
从 IT 自嗨到业务可用,制造企业 AI 平台的落地实践
大数据·人工智能·llm·制造·token·云平台
JouYY3 小时前
大模型底层学习(四)- 混合精度训练与分布式训练
架构·llm·agent
今天AI了吗3 小时前
Codex 配置自定义 AI API 完整指南:从零到一接入你的专属模型
java·人工智能·python·数据分析·embedding
桃西西呀5 小时前
9月1日起AI图要被标记了,机器怎么一眼认出哪张是 AI 画的?
人工智能·机器学习·llm
流浪0015 小时前
大模型技术全景(四):国内外大语言模型格局,技术路线与能力图谱
人工智能·llm
二进制漫游记17 小时前
FastAPI项目集成 Qdrant向量数据库+阿里云Embedding完整实战(工具封装+业务调用)
数据库·python·阿里云·embedding
武子康1 天前
机器人策略 90% 与 92%:为什么两个百分点通常不足以证明更
人工智能·llm·agent
阿里云大数据AI技术1 天前
PAI支持一键部署Qwen3.8-Flash-Next、GLM-5.3等最新开源模型
人工智能·开源·llm
吴佳浩1 天前
企业如何把通用大模型训练成行业模型:Continued Pre-Training实战指南
人工智能·神经网络·llm