每日一个开源项目(第164篇):毕昇(BISHENG)- 面向企业的开源 LLM DevOps 平台

引言

"毕昇,活字印刷术的发明者。BISHENG,帮助企业把大模型的能力'活字排版'进自己的业务流程里。"

这是"每日一个开源项目"系列的第164篇文章 。今天的主角是 毕昇(BISHENG)------DataElem 开源的企业级 LLM 应用 DevOps 平台。

企业引入 LLM 的时候往往会遇到一个困境:单一工具只解决一个点------有的专注 RAG、有的专注 Workflow、有的专注模型管理------但真实的企业场景需要这些能力全部打通,还要有权限管理、审计日志、高可用部署。把这些工具拼在一起,维护成本极高。

BISHENG 的定位是一站式解决:从文档解析、知识库构建、RAG 检索,到可视化工作流编排、多 Agent 协作、模型微调管理、企业级权限治理,全部在同一个平台里完成。

你将学到什么

  • AGL(Agent Guidance Language)框架:如何把领域专家的经验编码给 AI Agent
  • 可视化工作流编排的 Human-in-the-Loop 设计
  • 高精度文档解析:5 年私有数据训练的 OCR 能力
  • 企业 RAG 的典型场景:从政策比对到简历筛选
  • 毕昇的技术架构:Milvus + Elasticsearch + OnlyOffice + LLaMA-Factory
  • v2.6.0 的 Linsight Task Mode 新能力

前置知识

  • 了解企业 LLM 应用的基本概念(RAG、Agent、工作流)
  • 有企业内部 AI 系统建设需求或经验
  • Docker 基础(用于本地部署)

项目背景

为什么叫"毕昇"

项目以北宋毕昇(活字印刷术发明者)命名,隐喻很贴切:活字印刷把固定的雕版印刷变成了灵活可重组的活字------BISHENG 希望把同样的灵活性带给企业的 AI 能力建设,不是固定流程的硬编码,而是可重组、可编排、可迭代的模块化能力。

作者/团队介绍

  • 公司: DataElem(上海数巧信息技术有限公司)
  • License: Apache-2.0
  • 版本: v2.6.0(2026 年 7 月)
  • 用户群: 财富 500 强和行业头部机构

项目数据

  • ⭐ GitHub Stars: 11,600+
  • 🍴 Forks: 1,900+
  • 📦 Release: 73 个版本
  • 📄 License: Apache-2.0
  • 💻 语言: Python ~50% + TypeScript ~47.5%

核心功能

Linsight Agent(AGL 框架)

AGL(Agent Guidance Language)是 BISHENG 独有的 Agent 指导框架,解决的是一个企业 AI 的核心问题:如何把特定领域专家的经验、偏好和业务逻辑编码进 AI,让它在专业场景里像专家一样工作

普通 LLM 做财务分析,可能会给出技术上正确但业务上不合规的结论。AGL 框架允许你把财务合规专家的判断逻辑、常见的业务边界条件、行业特定的分析视角,显式地嵌入 Agent 的决策过程。

v2.6.0 引入的 Linsight Task Mode:Agent 不再只是回答问题,而是可以主动规划和执行多步骤任务,输出符合企业要求的格式化报告。

可视化工作流编排

这是 BISHENG 区别于很多同类产品的核心能力:

单一框架覆盖所有任务类型。很多平台把"对话流"和"工作流"分成两个独立模块,接口不统一,用起来割裂。BISHENG 用一套可视化工作流引擎处理所有场景。

支持的流程控制

  • 循环(Loop):让 Agent 重复执行直到满足条件
  • 并行(Parallelism):多个分支同时运行,提升处理效率
  • 批量处理(Batch):对列表里的每个元素执行相同流程
  • 条件分支(Conditional):根据中间结果走不同路径

Human-in-the-Loop(人工介入)

这是企业场景里不可或缺的能力:

erlang 复制代码
工作流运行中...
    ↓
执行到"合同风险评估"节点
    ↓
法务 Agent 输出初步评估
    ↓
[暂停,等待人工确认]
    ↓ 人工审核,批准/修改/拒绝
    ↓
继续执行后续步骤

这种设计允许在高风险决策点插入人工判断,而不是让 AI 从头到尾全自动执行。对于合规要求严格的企业场景(金融、法律、医疗),这是刚需。

高精度文档解析

BISHENG 在文档解析上有独特优势------这不是集成的第三方工具,而是 DataElem 基于5 年以上私有数据训练的专有模型:

能力覆盖

  • 印刷体文字识别(常用字 + 生僻字)
  • 手写体识别(包括中文手写)
  • 复杂表格识别(含跨行跨列合并单元格)
  • 文档版面分析(多栏布局、嵌入图片、页眉页脚分离)
  • 公章/印章识别
  • 图表识别

部署方式:完全私有化部署,无需连接外部 API,数据不出内网。

这个能力在中国企业的文档处理场景里特别有价值:大量纸质单据扫描件、手写审批单、印章文件,是传统 OCR 工具的老大难问题,BISHENG 的模型在这类数据上有专项优化。

企业 RAG 知识库

完整的企业知识库建设流程:

markdown 复制代码
原始文档(PDF/Word/Excel/扫描件)
        ↓
文档解析(高精度 OCR + 版面分析)
        ↓
文本分块 + 向量化(Milvus)
        ↓
混合检索(向量相似度 + 全文检索 Elasticsearch)
        ↓
知识库问答 / 引用溯源

典型企业场景

场景 描述
政策比对 新版本政策和旧版本的差异逐条对比,生成变更报告
合同审查 合同条款和公司标准条款自动比对,标出风险点
会议纪要 会议录音/视频 → 结构化纪要,动作项自动跟踪
简历筛选 候选人简历和岗位要求多维度匹配,生成评分
电话记录分析 客服通话内容结构化分析,提取关键信息
非结构化数据治理 企业历史文档分类、标签、知识图谱构建

统一模型管理

从模型选型到上线运营的完整生命周期管理:

  • 模型接入:OpenAI 兼容 API / 本地部署(llama.cpp、vLLM 等)
  • 数据集管理:标注数据的版本管理和质量控制
  • SFT 微调:集成 LLaMA-Factory,在私有数据上微调模型
  • 评测:构建评测集,量化模型在业务场景上的表现
  • 上线管理:不同部门用不同模型版本,流量控制和 A/B 测试

企业级功能

权限和安全

  • RBAC(基于角色的访问控制)
  • 用户组管理(不同部门不同权限)
  • SSO 单点登录(支持 LDAP)
  • 每组独立的流量控制配额

运维和合规

  • 高可用部署方案
  • 漏洞扫描和安全补丁
  • 使用统计和审计日志
  • 可观测性监控

文档编辑

  • 集成 OnlyOffice,支持在线协作编辑 Word/Excel/PPT
  • 适合"AI 生成草稿 → 人工在线编辑 → 最终输出"的工作流

快速部署

系统要求

  • CPU:≥ 4 核(推荐 18 vCPU)
  • 内存:≥ 16 GB(推荐 48 GB)
  • Docker 19.03.9+,Docker Compose 1.25.1+
bash 复制代码
git clone https://github.com/dataelement/bisheng.git
cd bisheng/docker
docker compose -f docker-compose.yml -p bisheng up -d

访问 http://IP:3001,第一个注册用户自动成为系统管理员。


技术架构

markdown 复制代码
前端(React + TypeScript)
    ↓
后端(Python + FastAPI)
    ├── 工作流引擎(基于 LangChain/Langflow 定制)
    ├── 文档解析(私有 OCR 模型)
    ├── Agent 框架(AGL 框架)
    └── 模型管理(LLaMA-Factory 集成)
    ↓
数据层
    ├── Milvus(向量存储)
    ├── Elasticsearch(全文检索)
    ├── MySQL(元数据)
    └── MinIO/S3(文件存储)

致谢:项目基于 LangChain、Langflow、Unstructured、LLaMA-Factory 构建,在这些基础上添加了大量企业场景的定制化能力。


项目地址与资源


总结

BISHENG 的核心价值是减少企业 AI 建设的集成复杂度

一个企业要建设 LLM 应用,通常需要分别选型文档解析工具、RAG 框架、工作流编排平台、Agent 框架、模型管理工具、权限系统------然后把这些东西接在一起,这个过程本身就要消耗大量工程资源。BISHENG 把这些全部集成进一个平台,用统一的数据模型、统一的权限体系、统一的监控视图管理。

高精度文档解析是一个被低估的差异化能力。在中国企业场景里,大量关键信息仍然存在于扫描文档、手写单据、印章文件里,这类数据的处理质量直接决定了知识库的可用性。DataElem 5 年的私有训练数据在这个维度上有真实优势。

AGL 框架和 Human-in-the-Loop 工作流,说明这个项目认真考虑过企业场景的特殊性:不是所有决策都可以全自动化,需要在合适的节点保留人工介入的空间。

11.6k Stars 和财富 500 强的生产使用记录,说明这不只是技术验证项目,而是有实际交付价值的产品。


探索 PrimeSkills ------ 精选 AI Agent 与技能的市场,每一个都经过真实企业工作流验证,去掉浮夸,留下真正有用的。

欢迎访问我的个人主页,发现更多有价值的见解和有趣的产品。

相关推荐
CCPC不拿奖不改名4 小时前
大模型推理架构与开源生态知识整理
数据库·windows·python·架构·langchain·开源·github
声讯电子4 小时前
录音笔AI降噪方案:从录得到到听得清的听觉革命
人工智能·语音识别
小小测试开发4 小时前
Playwright vs Selenium vs Cypress:从浏览器协议到 API 设计的全面对比与实测
人工智能·selenium·测试工具
Ai_easygo4 小时前
AI Agent开发入门——从ReAct到Tool Calling,拆解Agent的底层运行逻辑
前端·人工智能·react.js
字节跳动开源5 小时前
30 分钟搞定个人情报站:Viking AI 搜索让前沿资讯实时推到面前
数据挖掘·开源·agent
IT_陈寒5 小时前
Redis的持久化配置把我坑惨了:你以为数据安全了?
前端·人工智能·后端
miaowu3575 小时前
AI智能体推动数字化转型:从流程自动化到决策辅助的完整路线图
大数据·人工智能·自动化
阿里云大数据AI技术5 小时前
阿里云 Elasticsearch 日志采集与加工服务:让日志链路少一串组件,多一份稳定
人工智能·elasticsearch
ksueh5 小时前
AI写小说长篇创作中的上下文局限与外部记忆系统实践
人工智能