技术栈

glm-5.3-flash

论文复现现场
1 小时前
python·rag·企业知识库·大模型api·glm-5.3-flash
企业知识库 RAG 用什么模型便宜?GLM-5.3-Flash 长文本 API 实测先给结论:如果 RAG 已经完成检索和重排,需要一个模型读长检索结果、回答问题并返回证据 ID,GLM-5.3-Flash 可以进入低成本 PoC 候选。本次在 15.9K、63.4K 和 127.1K Token 三档输入中,6 次有效响应全部找全 3 个答案和 3 个证据 ID;但 7 次请求里出现了 1 次 HTTP 200 但正文为空,上线前必须加响应校验和有界重试。
我是有底线的