开源实力派,给本地 AI 装上深度调研能力,一张 3090 跑到 95.7 分!

OpenAI 的 Deep Research 我一直想正经用用,但它绑在 Pro 订阅里卖,一个月 200 美元,功能是好功能,但这个价格我是真下不去手啊。

昨天在 GitHub 上翻到 Local Deep Research,8700 多 Star。它干的事说白了就一件:把 Deep Research 那套东西搬到我们自己电脑上跑,模型可以用 Ollama 挂本地的,搜索走 arXiv、PubMed 这些学术源。社区里有人拿一张 3090 显卡,在 SimpleQA 基准上跑到了 95.7 分。

我把它装下来摸了一圈,这篇说说它到底能干什么。

这个项目是什么

Local Deep Research 是一个放在自己电脑上的 AI 研究助手。我们丢给它一个问题,它自己去拆问题、调搜索引擎、读网页和论文,最后整理出一份报告,每个结论后面都带着引用来源。 模型可以全程在本地跑,数据不出我们自己的机器。

我写文章这天仓库还有新提交,不是那种火一把就没人管的项目。Reddit 的 r/LocalLLaMA 板块里,它的跑分帖有 16 万浏览,Hacker News 上拿了 190 多个赞,LangChain 官方账号也推过它。

来看看它的实力

一张 3090 跑到 95.7 分

先说成绩,这也是它最近火起来的直接原因。

社区跑分用的是 Qwen3.6-27B,模型拿 Ollama 装在本机,策略选 langgraph-agent。SimpleQA 一共 300 道题,答对了 287 道,95.7%。另一个 xbench-DeepSearch 基准拿了 77 分。小一号的 Qwen3.5-9B 也有 91.2 分,gpt-oss-20B 是 85.4 分。

作者自己也说了,样本量不大,评分有噪音,没拿这个数吹。跑分榜放在 Hugging Face 上,CSV 谁都能下载,自己跑了成绩也可以传上去。

二十多种研究策略,重点说 langgraph-agent

平时用得多的就几档,赶时间用 Quick Summary,三十秒到三分钟出结果,引用都带。想挖深一点用 Detailed Research,要交东西给别人看,用 Report Generation,生成带目录的完整报告,能导出 PDF 和 Markdown。

95.7 分是 langgraph-agent 这个策略跑出来的,值得单独说两句。开了这个模式以后,搜什么、用哪个引擎、搜到什么时候算完,都是模型自己拿主意。搜的过程中发现新线索,它会顺着换引擎接着挖,最后收集到的信源比固定流程那种玩法多不少。想用的话,在设置里选 langgraph-agent 就行。

十几个搜索引擎随便搭

免费能用的一串:arXiv、PubMed、Semantic Scholar、Wikipedia、GitHub、Wayback Machine,连卫报和 Wikinews 都在里面。愿意花钱买 API 的,Tavily、Brave、Google(走 SerpAPI)也支持。

自己电脑里的文档也能当搜索源,它兼容 LangChain 的 retriever,FAISS、Chroma、Pinecone 这些向量库都能接,等于我们手头随便哪个向量数据库,都能挂上来当搜索引擎用。

还有个小事我印象挺深,它抓网页的时候会遵守 robots.txt,人家不让抓就不抓,也不伪装成浏览器混进去。作者的意思是宁可少抓一个页面也认了,这个做法非常值得表扬。

研究顺手变成知识库

每次研究搜到的论文和网页,看完了别扔,可以一键存进本地资料库。它会帮我们抽正文、建索引、做向量化,下回再做研究的时候,可以让它把自己的文档库和网上的实时内容放在一起搜。

这个库是越用越厚的,攒得久了,它就不只是个问答工具,更像一个跟着我们攒了很多资料的老助手。

加密这块做得比一般开源项目认真

每个用户单独一个 SQLCipher 数据库,AES-256 加密,密钥从我们的登录密码里推出来。密码本身不保存,登录的过程实际上就是拿密码去试解密,密码不对,库就打不开。每个人的模型 API key 也是加密之后存在自己库里的。

项目里没有任何遥测和统计代码,除了我们自己发起的搜索请求和模型调用,它不会往外发任何东西。Docker 镜像还用 Cosign 做了签名,带 SBOM 清单。镜像是不是官方构建的,里面装了哪些包,都能自己查。

自带期刊质量评分

它内置了 21.2 万个期刊源的质量数据,数据来自 OpenAlex、DOAJ,还有一份掠夺性期刊黑名单。查医学问题的时候,它会自动给引用的期刊打声誉分,碰上掠夺性期刊直接标出来。经常做文献调研的人,应该知道这能省多少事。

能挂进 Claude Code

项目自带 MCP server,装好以后,Claude Code 和 Claude Desktop 里可以直接调它的工具,quick_researchdetailed_researchgenerate_report 都有。平时写代码写到一半要查点资料,让 Claude Code 顺手跑一轮带引用的调研就行,不用再切窗口开浏览器。

订阅功能,自动盯进展

订阅一个主题,它按天或者按周自动跑一轮研究,把不相关的内容筛掉,整理成 markdown 报告推给我们。盯某个方向的新论文、新动态,设置一次就不用管了,适合懒人。

快速开始

推荐 Docker Compose,一条命令的事:

bash 复制代码
curl -O https://raw.githubusercontent.com/LearningCircuit/local-deep-research/main/docker-compose.yml && docker compose up -d

等 30 秒左右,我们在浏览器打开 http://localhost:5000 就能用。compose 文件会把 Ollama 和 SearXNG 一起拉起来,进设置页选一个模型就行,比如 gpt-oss:20b。有 N 卡的话多下一个 gpu override 文件,README 里有现成命令。

不想碰 Docker 的话,pip 也可以:

lua 复制代码
pip install local-deep-research
python -m local_deep_research.web.app

有个坑提前说:CPU 得支持 AVX 指令集。2011 年以后的 Intel 和 AMD 都没问题,再老的机器会直接报 Illegal instruction,别在上面浪费时间。

什么场景适合用它

我写技术文章之前经常要翻一堆资料,用它一次把 arXiv 和公网网页一起搜完,每条结论后面都带着出处,不用我再逐条回去核对。

想盯某个领域的进展,交给订阅功能,每周收一份汇总,比自己天天刷信息流全。

团队内部文档多的,可以把文档接进它的本地搜索。查问题的时候,公司资料和网上的结果一起出来。

做学术调研的更合适,PubMed 加上期刊质量评分,一篇论文靠不靠谱,扫一眼就有数。

最硬的需求还是对数据敏感的场景,模型全程本地,数据库本地加密,搜索请求只发给我们自己配置的引擎,中间没有第三方经手。

我的看法

这项目最打动我的地方不是跑分,是它把研究这件事的主动权给了用的人。模型自己挑,数据存在自己机器上,报告里每个结论后面都挂着来源,我随时可以点回去看它有没有瞎编。

门槛也得说清楚,想拿 3090 跑 27B 模型,不是人人都有这个条件,95 分那个成绩对硬件和模型都有要求。纯 CPU 或者显存小的机器,体验肯定要打折。我的建议是先挂个小模型跑起来试试,实在不行,就在设置里换成云端模型。

8.7K Star 放在研究类工具里不算特别爆,但文档写得全,更新一直没断,社区也活跃。这种项目我一般是先点个 Star 放着,指不定哪天就派上用场了。

开源地址:

github.com/LearningCir...

相关推荐
努力的小雨2 小时前
把 Windows 桌面图标做成一个会自己运转的小世界
后端
武子康2 小时前
Search Console Platform Properties 扩大 SEO 资产边界:从 Page Ranking 到 Topic Coverage(5 类误读边界 + 3 表数据层设计)
前端·人工智能·后端
腾渊信息科技公司3 小时前
Spring Boot对接MES实战:视觉检测数据自动同步方案
java·人工智能·spring boot·后端·计算机视觉·ai·软件需求
IT_陈寒4 小时前
Vue这个特性差点让我加班到凌晨,谁懂啊
前端·人工智能·后端
段一凡-华北理工大学4 小时前
向量数据库实战:选型、调优与落地~系列文章12:文本分块策略实战:chunk_size 怎么选?重叠多少?
开发语言·数据库·后端·oracle·rust·工业智能体·高炉智能化
码事漫谈5 小时前
1999年的电商前夜和2026年的AI前夜 历史押韵但从不重复
后端
Conan在掘金5 小时前
鸿蒙报错速查:arkts-strict-typing Property does not exist on type 'object',object 装函数就炸,根因 + 真解法
后端
颜酱5 小时前
01 | 骨架搭建:FastAPI + Vue 跑通第一个 SSE 流式问答
前端·人工智能·后端
程序员cxuan6 小时前
Grok Build 被众人唾骂,结果老马把它开源了
人工智能·后端·程序员