Azure AI Search 探索总结

Azure AI Search 原名 Azure Cognitive Service,是Azure中用来给AI项目构建知识库的组件。

知识库本质和数据库很像,但是内部的存储结构和检索算法不一样。

比如并不是知识库的每一列都可以用来过滤、检索或group by,而是要根据实际情况配置。

Azure AI Search几个基本概念介绍:

  1. Index就是类似数据库的一张表,里面可以存放被检索的信息集合。
  2. Indexer索引生成器,从数据源读取并生成Index的生成器。
  3. 数据源,可以是Blob,Database
  4. Skillset,这个很有意思叫技能包,默认的索引生成器功能很简单,对于复杂文档,比如有大量图片的文档,视频或音频,在生成index时要动用到一些独特的技能包即Skillset

在Azure Portal里AI Search提供了Index的在线查询,使用的是它自己定义的一套JSON查询语法,这里给到几个经典查询介绍:

javascript 复制代码
// 查询某个可以facet的字段,有哪些distinct值
{
  "search": "*",          // 或空字符串
  "top": 0,               // 不返回具体文档
  "facets": ["category,count:1000"]  // 你想看 distinct 值的字段,默认显示10条,通过count指定数量上限
}


//限制返回字段content的上下文
{
  "search": "机器学习",
  "highlight": "content-40",   // 40=返回前/后各 40 个字符
  "select": "title,url"        // 不返回整段 content
}

//根据某个字段过滤,类似SQL中的where
{
  "filter": "category eq 'Electronics'",
  "select": "id,name,price"
}

最后补充两点:

  1. Azure AI Search Free-tier 只支持16MB以下的文档。

  2. Azure Portal里的操作方式: 不支持自定义index结构,复杂场景还是要写代码导入。

  3. Storage Blob里配置文件的元属性,AI Search也能自动读到。

相关推荐
赋范大模型技术社区2 天前
LangChain1.0 搭建法务合同审核 Agent(附源码)
langchain·ocr·agent·rag·文档审核·langchain1.0
Sindy_he2 天前
2025最新版微软GraphRAG 2.0.0本地部署教程:基于Ollama快速构建知识图谱
python·microsoft·大模型·知识图谱·rag
Lethehong2 天前
openGauss在教育领域的AI实践:基于Java JDBC的学生成绩预测系统
java·开发语言·人工智能·sql·rag
我很哇塞耶2 天前
从 “检索知识” 到 “会用知识”:西安交大 + 华为 2025 EMNLP 新方案RAG+
人工智能·ai·大模型·rag·检索增强生成
阿杰学AI2 天前
AI核心知识26——大语言模型之Embedding与Vector Database (简洁且通俗易懂版)
人工智能·语言模型·aigc·embedding·向量数据库·rag·vector database
kaozhengpro2 天前
微軟 AZ-204 認證考試介紹|Developing Solutions for Microsoft Azure 完整指南
microsoft·azure
m0_488913012 天前
小白也能懂!RAG技术让AI告别知识滞后,收藏学习
人工智能·学习·langchain·大模型·ai大模型·rag·大模型学习
AI-Frontiers3 天前
RAG评测完整指南:指标、测试和最佳实践
rag
阿杰学AI3 天前
AI核心知识25——大语言模型之RAG(简洁且通俗易懂版)
人工智能·机器学习·语言模型·自然语言处理·aigc·agi·rag
Azure DevOps3 天前
Azure DevOps Server:允许讨论但不允许修改工作项
运维·microsoft·azure·devops