第一阶段 01.Elasticsearch 核心概念与 PostgreSQL 对照

01 · Elasticsearch 核心概念与 PostgreSQL 对照

阶段:第一阶段 / 核心概念

目标:用 PostgreSQL 的心智模型快速建立 Elasticsearch 的世界观。


1. 概念

Elasticsearch(下称 ES)是一个分布式搜索与分析引擎 ,底层是 Lucene 的倒排索引。

它不是关系型数据库,但很多概念可以和 PostgreSQL 一一对应,帮你快速上手。

术语对照表

Elasticsearch PostgreSQL 说明
Index(索引) Table(表) 一类文档的集合,如 orders_idx
Document(文档) Row(行) 一条 JSON 记录
Field(字段) Column(列) JSON 里的 key
Mapping(映射) Table Schema / DDL 定义字段类型
_id 主键 文档唯一标识
Shard(分片) 表分区(近似) 索引水平切分,分布到多节点
Replica(副本) 流复制/备库(近似) 分片的冗余拷贝,用于高可用与读扩展
倒排索引 B-Tree / GIN 索引 ES 默认所有字段都建索引
Node / Cluster 实例 / 集群 多节点组成集群

关键差异:在 PostgreSQL 里「先建表,数据默认没索引,需要时才 CREATE INDEX」;

在 ES 里「几乎所有字段默认就是可检索的」,因为它的定位就是搜索。


2. PostgreSQL 对照

一张销售数据表在 PG 里是这样的:

sql 复制代码
CREATE TABLE salesdata_master_info (
    record_id      bigint PRIMARY KEY,
    invoice_number varchar(64),
    material       varchar(64),
    net_amount     numeric(18,2),
    invoice_dt     date
);

INSERT INTO salesdata_master_info
VALUES (1001, 'INV-2026-001', 'ThinkPad-X1', 8999.00, '2026-07-01');

在 ES 里,同样一条数据是一个 JSON 文档:

json 复制代码
{
  "record_id": 1001,
  "invoice_number": "INV-2026-001",
  "material": "ThinkPad-X1",
  "net_amount": 8999.00,
  "invoice_dt": "2026-07-01"
}
  • PG 的「表结构」= ES 的 mapping
  • PG 的「一行」= ES 的 一个 document
  • PG 的「主键」= ES 的 _id

3. ES DSL(在 Kibana Dev Tools 里跑)

查看集群健康(相当于「数据库还活着吗」):

复制代码
GET _cluster/health

查看索引列表(相当于 \dt 列出所有表):

复制代码
GET _cat/indices?v

查看某个索引的 mapping(相当于查看表结构 \d salesdata_master_info):

复制代码
GET salesdata_idx/_mapping

查一条文档(相当于 SELECT * FROM t WHERE id = 1001):

复制代码
GET salesdata_idx/_doc/1001

查全部(相当于 SELECT * FROM t LIMIT 10):

复制代码
GET salesdata_idx/_search
{
  "query": { "match_all": {} },
  "size": 10
}

4. Spring Boot 实现

通过 ElasticsearchClient(官方 co.elastic.clients 客户端)访问 ES,

把它声明为 Spring Bean(见第 04 篇),直接注入即可。

java 复制代码
@Slf4j
@Component
public class ClusterInfoDemo {

    @Autowired
    private ElasticsearchClient elasticsearchClient;

    /** 相当于 SELECT * FROM salesdata_idx WHERE _id = ? */
    public Map<String, Object> getById(String indexName, String id) throws IOException {
        GetResponse<Map> resp = elasticsearchClient.get(
                g -> g.index(indexName).id(id), Map.class);
        return resp.found() ? resp.source() : null;
    }

    /** 相当于 SELECT * FROM salesdata_idx LIMIT 10 */
    public List<Map> matchAll(String indexName) throws IOException {
        SearchResponse<Map> resp = elasticsearchClient.search(s -> s
                .index(indexName)
                .query(q -> q.matchAll(m -> m))
                .size(10), Map.class);
        return resp.hits().hits().stream()
                .map(Hit::source)
                .collect(Collectors.toList());
    }
}

生产落地:用 SearchRequest.of(req -> ...) 构建请求,Query.of(q -> q.matchAll(...))

兜底空条件(完整骨架见第 42 篇)。


5. 坑与最佳实践

  1. ES 不是事务型数据库 :没有 PG 那样的 ACID 多行事务,别拿它当主库写业务。
    典型模式是:数据先落 PostgreSQL,再同步写入 ES 供查询(批量 bulk 写,见 31/42 篇)。
  2. 近实时(NRT) :写入后默认 1s 才可被搜索到(refresh_interval),不是立即可见。
  3. 分片数创建后不可改:类似 PG 分区策略要提前规划。副本数可以动态调整。
  4. 不要把 ES 当唯一数据源:它是查询/分析加速层,权威数据仍在 PG。

下一篇

02-Mapping与数据类型.md:重点讲 text vs keyword------这是从 SQL 转 ES 最容易踩的坑。

相关推荐
柒和远方5 小时前
NestJS + TypeORM 学习笔记:语法和类型不绕了
postgresql·orm·nestjs
明月_清风5 小时前
数据进入平台后怎么处理?一文搞懂 ETL
大数据·后端·数据分析
Elasticsearch5 小时前
使用 NVIDIA cuVS 在 Elasticsearch 中实现 GPU 加速的向量索引:在 10 分钟内处理 1.38 亿个向量
elasticsearch
Flynt5 小时前
"MySQL搜不动就上ES"?我先在50万行数据上测了它自带的ngram全文索引
mysql·elasticsearch·搜索引擎
明月_清风5 小时前
数据处理完放在哪里?一文搞懂数据仓库与数据湖
大数据·后端·数据分析
Y005 小时前
PostgreSQL 的锁:为什么你的 ALTER TABLE 会卡住,以及怎么查
数据库·postgresql
大大大大晴天5 小时前
每天认识一个组件:向量化计算加速Apache Auron
大数据
明月_清风5 小时前
数据平台到底是什么?一篇文章搞懂数据平台开发
大数据·后端·数据分析
明月_清风5 小时前
数据是怎么进入数据平台的?一文搞懂数据采集与数据同步
大数据·后端·数据分析
柒和远方5 小时前
混合检索 RAG 全链路:查询增强、双路召回与重排——向量库和搜索引擎联手补齐召回
elasticsearch·langchain·llm