从MaxKB说起:活字格 + ikkyu-kb 探索企业知识库的另一种路径

引言

智能知识库正在成为企业数字化转型中的关键基础设施。无论是内部员工自助查询制度文档、客服人员快速检索产品信息,还是管理层从海量资料中获取决策支持,一个高效、智能的知识库都能显著提升组织效能。

近年来,诸如MaxKB等一批优秀的开源产品让企业能够快速拥有开箱即用的RAG(检索增强生成)问答能力,极大降低了知识库的建设门槛。然而随着应用深入,另一个需求也逐渐浮现:如何将知识能力更深度地嵌入企业现有的业务系统------与OA流程打通、与CRM系统联动、按企业VI定制交互界面、与现有用户权限体系无缝对接?

本文分享一种面向深度集成与定制场景的技术组合探索:活字格低代码平台 + ikkyu-kb(知识库伴侣) 。

案例可以参考AI智能体示例:RAG知识库(向量+BM25)

第一部分:ikkyu-kb------企业级知识库的开源"引擎"

1.1 项目定位

ikkyu-kb(知识库伴侣)是一个面向知识库构建场景的后台API服务,提供知识领域、资源文件管理、向量+BM25混合查询的标准化实现,并内置API token鉴权和基于tag的访问权限过滤。项目底层基于MarkItDown和本地AI模型,提供文档转Markdown、图片识别、智能切块、文本向量化和语义重排序等能力,可单独调用,也可组合为完整的知识资源入库与检索链路。

简单来说,ikkyu-kb扮演的是知识库"后端引擎"的角色------它不提供开箱即用的前端界面,而是将专业的RAG能力封装为清晰的API接口,供开发者按需调用和集成。

1.2 核心设计概念

ikkyu-kb在设计上把知识库拆成业务概念和存储概念两层,开发时优先面向业务概念建模:

  • 知识领域(domain) :业务上的查询边界和配置边界,通常对应一个部门、制度域、产品线、项目空间或租户内的知识主题。例如,你可以为"研发部"创建一个知识领域,为"销售部"创建另一个,彼此隔离互不干扰。
  • 向量集合(vector collection) :每个知识领域对应一个底层向量集合,用于存放该领域内chunk的embedding和检索索引。向量集合是内部实现细节,调用方通常只需要关心知识领域。
  • 资源(resource) :属于某个知识领域的源文档或知识文件。新增、编辑重建或手动重建资源时,会自动完成转换、切块、检索扩增、向量化和入库。
  • 权限标签(tag) :知识领域和资源的tag用于访问权限控制。采用 RBAC 时,可把有权访问该领域或资源的角色填入 tag。查询时传入调用者有权使用的角色,私有对象要求权限标签相交。
  • 切片(chunk) :实际参与向量召回、BM25召回和语义重排序的最小检索单元。

这种设计的好处是:业务代码只需要关心"知识领域"和"资源"。底层的向量存储、索引构建等复杂逻辑被完全封装。同时,基于tag的权限控制为多部门、多租户场景提供了精细化的访问管理能力。

1.3 技术特性一览

ikkyu-kb在文档处理和检索能力上覆盖了企业知识库所需的完整技术栈:

文档处理能力:支持 PDF、Word、Excel、PowerPoint、图片、HTML、文本等格式转 Markdown。图片识别方面,PDF、Office、HTML、Markdown等文档中的嵌入图片统一支持OCR、OpenAI兼容Vision API或跳过处理;PDF额外支持VL-Page页面识别。

智能切块:基于BERT Chunker Chinese 2进行语义切分,支持自定义切块大小。相比固定长度切分,语义切块能更好地保持文本的连贯性和完整性。

混合检索引擎:默认在单个知识领域内检索,结合向量召回、BM25召回和语义重排序返回结果。内部使用multilingual-e5-small构建语义向量,支持本地FAISS或Qdrant作为向量存储;语义重排序则使用Alibaba GTE multilingual reranker对候选文档排序。三阶段检索策略兼顾了语义理解与关键词匹配。

检索扩增(核心特色) :项目把入库阶段基于chunk生成问题或问答对的能力称为检索扩增。目前支持三种策略:

  • none:不做检索扩增,直接用原始chunk建索引
  • t2q(Text to Questions) :基于chunk生成检索问题,推荐作为通用知识库的首选扩增策略
  • t2qa(Text to QA Pairs) :基于chunk生成受原文约束的问答对,适合FAQ、制度条款、操作手册等边界清楚的内容

这一设计的核心思想是:不是改变原文,也不是让生成内容成为新知识,而是把"用户可能会怎么问"补充到索引文本中,缓解查询表达和文档原文之间的词汇不匹配。扩增文本只用于提升向量召回和BM25召回,查询结果、重排序候选和最终证据仍以原始chunk为准,避免把LLM生成内容误当成事实来源。

Agent友好接口:提供ls、cat、sed、grep、find、stat、tree、head、tail、wc等类文件只读操作接口,方便AI Agent直接定位和引用Markdown资源。这意味着外部AI应用可以像操作文件系统一样浏览和检索知识库内容。

标准化MCP 2.0接口:通过/mcp提供Streamable HTTP工具,复用API Bearer token。这使ikkyu-kb可以无缝接入支持MCP协议的AI应用生态。

1.4 性能与运维

  • 4C8G配置下可支撑100万向量规模
  • 持久化处理队列:资源入库和领域索引重建异步执行,支持状态查询、中止、恢复、失败诊断和任务移除
  • 灵活的部署方式:支持Docker运行、Mac/Windows本地无Docker启动、离线模型和本地开发热重载
  • 完善的数据备份与恢复机制

第二部分:活字格------AI驱动的企业级低代码开发平台

2.1 活字格是什么

活字格是葡萄城推出的AI驱动型企业级低代码开发平台。活字格以全栈可视化开发为核心,采用数据模型驱动架构与开放集成设计,实现多终端一致体验,助力开发者敏捷构建大型复杂企业级应用及AI智能体。活字格的核心功能覆盖企业级应用开发全流程核心能力,为复杂系统的全生命周期构建提供有力支撑。可视化开发后端逻辑将可视化开发技术延伸至业务逻辑开发,内建图灵完备的逻辑机制及表达式引擎,支持执行SQL,事务,计划任务,自动生成WebAPI,提升开发效率。数据模型驱动可视化DA操作组件,提供完整的ORM能力和快速统计等高阶功能,兼容主流关系型数据库,可快速整合多系统数据。开放性集成架构兼容WebAPIWebSocketMQTTMCP等协议,提供前后端编程接口,可轻松实现 AI 智能体与企业软硬件集成,实现编码与可视化混合开发。开箱即用的Web 控制台,可集中管理系统与应用配置用户权限日志,且内置多重安全防护机制,满足等保与信创合规要求。

2.2 活字格在AI应用中的独特价值

活字格将AI能力深度集成至其低代码开发平台,提供一站式智能开发与部署方案,既兼容主流AI模型的本地及云端部署,又让开发者能延续熟悉的拖拽式操作来配置AI智能体,从而显著降低开发门槛;在开发提效方面,AI可解析自然语言需求,自动生成应用框架、数据模型乃至SQL语句与校验规则,加速从设计到落地的全过程;同时,平台提供可视化智能体编排环境,使AI智能体继承活字格原有的事务回滚、数据校验和权限控制等机制,保障业务的一致性与安全性,并构建了包含知识库与意图过滤、模型组合交叉验证及人工审核在内的多重防护体系,确保企业级应用的可靠合规;基于这些能力,活字格可支撑智能填报助手、智能客服、智能审批、智能导医台和智能周报助手等典型场景,帮助企业高效地将AI融入核心业务流程,实现安全、可控的智能化转型。

2.3 企业系统集成的"连接器"角色

活字格的核心优势之一在于其强大的系统集成能力:

  • 数据层:原生支持与各类数据库(SQL Server、MySQL、Oracle、PostgreSQL等)的对接
  • 服务层:支持WebService、REST API、消息队列等多种集成方式
  • 用户层:可与企业现有AD/LDAP、钉钉、企业微信等用户体系打通
  • 流程层:内置BPMN 2.0标准流程引擎,可编排复杂的业务流程

这使得活字格天然适合充当企业IT架构中的"连接器"------将分散的业务系统、数据源和AI能力整合为统一的企业应用。

第三部分:活字格 + ikkyu-kb 的组合价值

3.1 分工清晰、各司其职

这一组合的核心思路是专业分工:

  • ikkyu-kb:专注于做好"知识引擎"这一件事------文档处理、向量化、混合检索、RAG能力输出
  • 活字格:负责"应用构建"------可视化界面设计、业务流程编排、系统集成、用户权限统一管理

两者通过标准的HTTP API和MCP协议进行通信,互不侵入、松耦合。

3.2 组合方案的核心优势

深度定制能力:借助活字格的可视化设计器,知识库前端界面可以完全按企业需求定制------从对话样式、品牌配色到复杂的交互逻辑,不受任何框架限制。活字格的"类Excel"设计器大幅降低了界面开发门槛。

业务流程融合:知识问答不再是一个"孤立页面"。通过活字格的BPMN 2.0流程引擎,知识检索结果可以自动触发工单创建、审批流转、通知推送等业务动作。例如:员工在知识库中查询休假政策后,可直接在对话界面发起休假申请流程。

企业系统打通:统一对接企业现有的用户体系(AD/LDAP/钉钉/企微)、业务数据库和外部系统,知识库真正融入企业IT生态,而非成为一个信息孤岛。

统一运维管理:应用与知识引擎可在同一技术栈下统一部署、监控与运维。ikkyu-kb支持Docker容器化部署,活字格应用也支持容器化交付,整体运维复杂度可控。

自主可控:开源知识引擎 + 可授权低代码平台,不绑定特定云厂商。企业可根据数据安全和合规要求,灵活选择公有云、私有云或本地部署。

3.3 适用的典型场景

  • 企业级智能员工助手:融合制度问答、流程发起、个性化界面与统一权限管理
  • 智能客服系统:需与CRM/工单系统深度集成,将知识检索结果自动转化为服务工单
  • 多部门/多租户知识管理:利用ikkyu-kb的tag机制实现精细化权限隔离
  • 产品文档智能检索:需定制化展示与交互逻辑,嵌入现有产品官网或客户端
  • 合规与制度审查:将知识检索嵌入合规审查流程,自动匹配相关制度条款

更多案例可以参考

结语

企业知识库建设没有"一招鲜"的解决方案------不同场景有不同的最优选择。MaxKB等产品在标准化快速交付场景中的价值毋庸置疑,也极大推动了RAG技术的普及,让知识库建设不再遥不可及。

而活字格与ikkyu-kb的组合,则为那些需要深度集成与定制能力的企业场景,提供了一条值得探索的技术路径。ikkyu-kb以扎实的文档处理、混合检索和检索扩增能力,充当了专业的知识引擎;活字格则以低代码的开发效率和强大的系统集成能力,将知识能力融入企业业务的血脉之中。

期待更多企业根据自身实际需求,找到最适合的知识库建设方案,让知识真正成为驱动业务增长的引擎。

相关推荐
SL-staff4 小时前
JVS模板化开发实战:3天上线HR/OA/仓储类系统的技术实现路径
低代码·流程引擎·企业数字化·配置即代码·jvs·模板化开发·架构设计力
HAHAXX81 天前
低代码 & 无代码 RPA 项目实施:对接大模型接口的部署与运维要点
运维·低代码·rpa
iori97king1 天前
织信开发日志 18:从 informat-skills 看织信如何把平台能力交给 AI Agent
人工智能·低代码·织信
许彰午1 天前
08-条件拼接规则
java·低代码·架构
程序员吕洞宾1 天前
开源多维表格SmartTable v1.6.5 —— 国际化、开放性与安全易用性增强
低代码·开源·自动化·软件构建·多维表格·飞书多维表
许彰午2 天前
06-EaEngine调度器
java·低代码·架构
低代码布道师3 天前
从0到1做一个软件外包数字化管理平台
低代码
qq407855604 天前
面向智能补货需求的进销存系统盘点
大数据·人工智能·低代码·制造
易番番ERP4 天前
以销定采模式下,ERP如何帮助贸易企业管住订单真实利润
大数据·低代码·微服务·云原生·成本核算·易番番erp·以销定采