检索

XLYcmy5 天前
llm·sft·强化学习·多模态·苹果·rag·检索
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search论文分享今天分享的论文是《DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search》
东莞市云毅网络有限公司10 天前
python·rag·检索·企业知识库·评测集
企业知识库问答的自动化评测:构建 golden set 与回归脚本做企业 RAG 的人都会遇到一个共同的问题:模型升级一次、切分参数改一下、Embedding 换一版,回答就漂了。原来答得对的问题,这次开始答错;原来答错的问题,这次又"修"过头了。
ShallWeL22 天前
人工智能·agent·知识库·rag·检索
RAG 文档变更后的检索回归清单摘要:本地知识库把前三条检索命中率与引用信封跑通之后,文档一改又容易悄悄退化:文件名换了、字段名改了,文档指纹清单能检出变更,但没人重跑固定问题集,上线后才发现旧问法命不中。本文给出 RAG 文档变更后的检索回归清单:文档指纹清单、固定评测集对比、退步问题列表与发布闸门;以支付回调文档改版为例,本机用标准库脚本可一键跑通,并在闸门处拦住 REGRESSION_BLOCKED(回归未通过,不得发布索引)。
Tbisnic1 个月前
python·ai·rag·检索
从算法到工程:构建企业级RAG系统的混合检索实践TF-IDF的致命缺陷:词频线性增长:认为"违约"出现10次,相关性是1次的10倍,不合理。实际上出现3-5次后信息已饱和。
山顶夕景2 个月前
大模型·音视频·多模态·audio·检索·全模态
【Audio】Audio encoder相关BenchmarkHEAR 的目标就是评估“什么 audio embedding 能泛化到多种下游音频任务”,覆盖 speech、environmental sound、music,并且是 NeurIPS 2021 shared challenge 发展出来的 benchmark。
山顶夕景2 个月前
算法·动态规划·检索·模式识别·相似度
【DWT】计算两不等序列相似度:DWT论文:Dynamic Programming Algorithm Optimization for Spoken Word Recognition 作者:Hiroaki Sakoe, Seibi Chiba 会议/期刊:IEEE Transactions on Acoustics, Speech and Signal Processing 年份:1978 是语音识别领域中关于动态时间规整(DTW/DP‑matching)的经典文献,系统提出了带斜率约束的对称型DP算法并验证其优越性
weigangwin2 个月前
python·ai·agent·rag·检索·llamaindex·观测性
LlamaIndex 第一次试用:别先写 RAG Demo,先验上下文合同LlamaIndex 不适合用“5 行代码做一个 RAG demo”来判断好坏。那个 demo 只能证明框架能跑通一次,不证明你的数据进入系统后仍然可追踪,不证明检索结果能解释,不证明 Agent 的记忆边界正确,也不证明生产环境里能审计每一次工具调用。
Samooyou3 个月前
人工智能·python·ai·全文检索·检索
RAG项目案例--02在线检索&过滤流水线为了确保整体流程设计的科学性与执行连贯性,采用 "Top-Down"(自顶向下)的开发模式,以 “总指挥部” 的全局视角统筹推进,具体实施步骤如下:
梁萌4 个月前
ai·知识库·rag·检索·问答
LightRAG知识库https://github.com/HKUDS/LightRAGhttps://www.cnblogs.com/JentZhang/p/18801719
qq_283720054 个月前
向量数据库·检索·私有rag
私有知识库 RAG 搭建:内网文档智能问答解决方案在数字化办公普及的当下,企业内网沉淀了海量文档:产品手册、技术方案、合同文件、运维手册、会议纪要、规章制度等。这些文档分散存储在共享盘、Wiki、OA 系统、本地文件夹中,存在三大核心痛点:
学术小白人5 个月前
运维·服务器·检索·rdlink研发家·见刊
【见刊通知】ICGEM E2025、IPAT 2025、AISNS 2026、IEAS 2025、BTFM 2026 等数个会议已见刊见刊通知尊敬的投稿作者:您好!我们很高兴通知您,ICGEME 2025、IPAT 2025、AISNS 2026、IEAS 2025、BTFM 2026等数个会议所录用论文已经见刊。相关的见刊链接已经发送给作者,请查收。如需查询相关论文进度情况,可联系组委会。
山顶夕景5 个月前
大模型·llm·agent·检索·记忆体
【Agent】Long-horizon task的memory系统Deep Research 是 2025 年的一个重点,2026年重点是long-horizon task。 Agent 就是一个 Loop,在三个状态之间循环:Search、Read、Reason
deephub7 个月前
人工智能·python·rag·检索
向量搜索系统的三个核心优化维度:速度、精度与规模当数据集膨胀到数百万甚至数十亿量级的向量时,怎么让搜索在这种规模下依然又快又准就成了一个实实在在的工程难题。这篇文章要聊的就是向量搜索系统的三个核心优化方向——性能调优、混合搜索和可扩展架构。
deephub7 个月前
人工智能·大语言模型·rag·检索
RAG 中分块重叠的 8 个隐性开销与权衡策略RAG 分块重叠提升了召回率但增加了隐藏成本,比如说索引膨胀、Embedding 开销、延迟、重排序负载和评估漂移。
XLYcmy7 个月前
ai·chatgpt·llm·prompt·检索·gpt-4o·doi
chatgpt数据库检索文献 上请帮助我进行文献检索,请协助完成以下步骤:第一步:主题可行性验证请先帮我评估"数字经济赋能城市低碳治理路径研究"这个主题的:
XLYcmy7 个月前
ai·chatgpt·llm·prompt·agent·检索·多轮对话
chatgpt数据库检索文献 下以下是关于“数字经济赋能城市低碳治理路径研究”的第一批高质量文献(共6篇),符合您提出的时间范围、文献类型和质量标准。每篇文献均标注了DOI,您可通过DOI链接或所在期刊的官方网站获取原文。
XLYcmy7 个月前
数据库·ai·llm·prompt·agent·检索·万方
智能体大赛 目录目 录... I一 开发背景... 11.1选题背景... 11.1.1 背景介绍... 11.1.2 现有解决方案的不足... 2
XLYcmy7 个月前
ai·llm·app·prompt·agent·检索·万方数据库
智能体大赛 总结与展望 未来展望“智研星图”智能体的当前版本,标志着我们向着人机协同科研新范式迈出了坚实的第一步。然而,这绝非终点,而是一个充满潜力的起点。展望未来,我们将以现有核心功能为基石,围绕技术纵深、功能广度、模式创新与生态构建四大维度进行持续迭代与战略布局,旨在将“智研星图”从一个卓越的工具,演进为一个开放的、进化的、全球领先的科研智能基础设施。
XLYcmy7 个月前
ai·llm·json·prompt·api·检索·万方数据库
智能体大赛 实现逻辑 大容量数据预处理机制在实际的学术研究场景中,用户发起的检索请求往往范围广泛,万方数据库作为涵盖海量学术资源的平台,其API返回的文献列表可能包含数百甚至上千条记录。这些结果通常以结构化的JSON格式返回,包含每条文献的标题、作者、摘要、关键词、发表年份、来源出版物和DOI等丰富元数据。当直接将这些完整的JSON数据作为上下文注入到LLM的Prompt中时,极其容易超出智能体开发平台对单次请求输入字符串的长度限制,从而导致请求失败、处理中断或生成质量显著下降。为解决这一严峻的技术瓶颈,我们设计并实现了一套高效、鲁棒的大容量数据