一、对话式助手定位(先对齐认知)
对话式助手 ≠ 简单聊天机器人
在企业里的定位是:
基于私有大模型的自然语言交互入口,承接问答、办事、分析三类能力
典型形态:
-
企业内部:IT/HR/财务/数据助手
-
对外客服:售前咨询、售后排障
-
业务助手:CRM 侧边栏、ERP 智能录入
核心价值:
-
知识统一出口(替代零散文档)
-
业务流程入口(一句话办事)
-
降低系统使用门槛
二、整体落地架构(推荐)
架构总览(文字版)
用户端
│(Web / App / 企微 / 钉钉 / 电话)
▼
接入层(Gateway)
│ 限流 · 鉴权 · 会话ID · 审计日志
▼
对话管理层(Dialog Manager)
│ 多轮对话状态 · 意图追踪 · 上下文记忆
▼
智能体核心(Agent Core)
├── NLU(意图识别 / 实体抽取)
├── RAG(知识问答)
├── Tool Calling(业务动作)
├── Reasoning(复杂问题拆解)
└── LLM(私有化模型:DeepSeek / Qwen)
▼
能力层
├── 知识库(向量库 + 图库)
├── 工具集(API / 函数调用)
└── 工作流引擎(审批 / 通知 / 查询)
▼
数据层
├── 业务系统(CRM / ERP / OA / DB)
├── 日志 & 监控 & 画像
▼
运维层
安全 · 权限 · 审计 · 评测
三、核心模块实现方案(工程视角)
1. 私有化 LLM 接入
模型选择
-
DeepSeek / Qwen(72B / 32B / 14B,视机器配置)
-
推理框架:vLLM / TGI / TensorRT-LLM
-
接口规范:OpenAI-compatible API
关键点
-
统一 LLM Client(支持多模型 fallback)
-
temperature:问答 0.1--0.3,创意 0.7+
-
system prompt 统一管理(版本化)
2. RAG:知识问答能力(最核心)
知识范围
-
产品手册、SOP、FAQ
-
制度规范(HR/财务)
-
故障排查手册
-
历史工单(脱敏)
文档处理 Pipeline
原始文档
→ 格式清洗(PDF/Word/HTML)
→ 切片(Chunking:512--1024 token)
→ 元数据标注(来源 / 部门 / 版本 / 有效期)
→ Embedding(bge-large / gte)
→ 向量入库(Milvus / Elasticsearch / PGVector)
检索策略(强烈推荐)
-
混合检索:向量 + 关键词(BM25)
-
Rerank:用 Cross-Encoder 重排序
-
多路召回:FAQ 优先 → 文档 → 数据库
Prompt 示例(精简)
你是企业智能助手。
请基于以下参考内容,回答用户问题。
如果参考内容不足,请明确说"暂无相关信息",不要编造。
【参考内容】
{{context}}
【问题】
{{question}}
3. Tool Calling:业务办事能力
这是"助手"和"聊天机器人"的分水岭。
工具定义(JSON Schema)
{
"name": "query_order",
"description": "根据订单号查询订单详情",
"parameters": {
"order_id": {"type": "string", "description": "订单号"}
}
}
常见工具类型
-
查询类:订单 / 客户 / 库存 / 工单
-
操作类:创建工单 / 发起审批 / 发送通知
-
计算类:价格计算 / 指标统计
-
系统类:重启服务 / 查询日志
执行流程
用户:帮我查一下订单 A12345
↓
LLM 判断需要调用 query_order
↓
Agent 执行工具(带权限校验)
↓
将结果回填给 LLM
↓
LLM 生成自然语言回复
4. 多轮对话管理(Dialog Management)
问题
-
用户:"帮我查订单"
-
助手:"请问订单号是多少?"
-
用户:"A12345"
解决方案
-
显式状态机(适合流程类)
-
隐式上下文(LLM 记忆)
-
混合模式(推荐)
记忆机制
-
Short-term:当前会话上下文(最近 K 轮)
-
Long-term:用户画像 / 历史偏好(向量库)
-
Summary:长对话压缩成摘要
5. 多 Agent 协作(复杂场景)
单一 Agent 难以支撑复杂业务。
用户:分析华东区上月销售下滑原因
↓
Planner Agent(拆解问题)
├─ Data Agent(查销售数据)
├─ CRM Agent(查客户变动)
├─ News Agent(查市场事件)
↓
Summarizer Agent(综合结论)
技术选型:
-
LangChain / LlamaIndex Agents
-
AutoGen / LangGraph
-
Semantic Kernel(微软系)
6. 系统集成(JD 重点)
CRM / ERP / OA
-
统一 API Gateway
-
OAuth2 / JWT 鉴权
-
行级权限(RLS):只看自己数据
-
操作审计:谁在什么时间调用了什么工具
消息通道
-
WebSocket(实时对话)
-
Webhook(事件驱动)
-
MQ(异步任务)
7. 安全与合规(企业必做)
-
敏感信息识别(正则 + LLM)
-
输入输出脱敏(手机号、身份证)
-
Prompt 防火墙(防注入)
-
权限最小化(工具级 ACL)
-
全链路审计日志
-
数据不出域(私有化)
四、落地实施路线(可按季度推进)
阶段一:MVP(第1个月)
-
单模型接入
-
FAQ + 简单文档问答
-
基础 Web UI
-
人工审核答案
阶段二:可用(第2--3个月)
-
RAG 全流程上线
-
Tool Calling 接入核心系统(CRM/ERP)
-
多轮对话
-
权限 & 审计
阶段三:好用(第4--6个月)
-
多 Agent 协作
-
用户画像 & 个性化
-
主动推荐(猜你想问)
-
自动评测 & 持续优化
阶段四:智能化(长期)
-
自我反思(Self-Correction)
-
自动工具生成
-
跨系统流程编排
-
语音 / 多模态接入
五、技术栈建议(可直接写进方案)
后端
-
Python + FastAPI
-
LangChain / LlamaIndex
-
vLLM / TGI
-
Redis(缓存 / 会话)
存储
-
Milvus / Elasticsearch(向量)
-
MySQL / PostgreSQL(结构化)
-
MinIO(文件)
前端
-
React + Next.js
-
Ant Design
-
WebSocket
运维
-
Docker / Kubernetes
-
Prometheus + Grafana
-
ELK
六、效果评估体系(很重要)
| 维度 | 指标 |
|---|---|
| 准确性 | 回答准确率、幻觉率 |
| 效率 | 首字响应时间、P95延迟 |
| 体验 | 多轮完成率、用户满意度 |
| 安全 | 敏感信息泄露次数 |
| 成本 | Token 消耗、QPS |
七、总结(直接用)
负责企业级对话式助手的架构设计与落地,基于私有化大模型(DeepSeek/Qwen)构建 RAG 知识问答与 Tool Calling 业务执行能力;通过多轮对话管理、多 Agent 协作及 CRM/ERP 系统集成,实现"问答+办事"一体化智能助手,已在内部 IT/HR/客服场景上线,日均调用量 XXXX,用户满意度 XX%。