local llm

wish3669 天前
人工智能·语言模型·自然语言处理·local llm
LiteLLM 部署实战:Docker 环境LiteLLM 是一个开源的 LLM 网关,它提供统一的 API 接口,让开发者可以用一套代码接入 OpenAI、Anthropic、Azure OpenAI、Google Gemini 等多家大模型服务。通过 LiteLLM,你可以实现模型路由、负载均衡、成本追踪、限流和密钥管理等功能,从而简化多模型接入的复杂度。
wish3669 天前
人工智能·语言模型·自然语言处理·local llm
EmployeeAssistant 智能问答服务:基于 pgvector 与 LLM 的企业知识库助手EmployeeAssistant 是一个面向企业员工的智能问答服务,采用原生 HTML/CSS/JavaScript 前端与 ASP.NET Core .NET 10 后端,结合 EF Core、PostgreSQL/pgvector 以及本地或组织批准的 LLM 服务,实现基于知识库的语义检索问答。系统根据员工提出的问题生成 embedding,从 PostgreSQL/pgvector 中检索最相关的知识库切块,并将检索内容、问题与引用来源一并发送给 chat 模型,通过 SSE 流式返回回答。服务
wish3661 个月前
人工智能·云原生·容器·kubernetes·local llm
K8S 免镜像部署:通过 API 上传文件动态创建服务(以 Ollama 为例)在 Kubernetes (K8S) 环境中,为满足临时需求而新增一个服务,传统流程通常需要:这个过程耗时较长,尤其在快速验证、临时调试或部署一次性任务时显得笨重。用户希望找到一种更简便的方法:避开创建 Docker 镜像的步骤,直接通过一个 API 上传文件(如可执行文件、模型文件、配置文件),就能在 K8S 的某个容器(Container)上动态创建并运行服务,例如快速部署一个 Ollama 服务来加载上传的模型。
wish3662 个月前
人工智能·语言模型·自然语言处理·local llm
使用 Chainlit 调用 TextGen API + 本地 LLM 实现 RAG Chatbot 应用随着大语言模型(LLM)的快速发展,检索增强生成(RAG)已成为构建知识密集型应用的主流架构。然而,在实际部署中,我们常常面临两个核心挑战:如何快速构建一个交互式的演示界面,以及如何将 RAG 系统与本地部署的 LLM 高效集成。
我是有底线的