NoSQL,全称 Not Only SQL,意为不仅仅是 SQL,泛指非关系型数据库。NoSQL 是基于键值对的,而且不需要经过 SQL 层的解析,数据之间没有耦合性,性能非常高。
非关系型数据库又可细分如下:
- 键值存储数据库:其代表有 Redis、Voldemort 和 Oracle BDB 等。
- 列存储数据库:其代表有 Cassandra、HBase 和 Riak 等。
- 文档型数据库:其代表有 CouchDB 和 MongoDB 等。
- 图形数据库:其代表有 Neo4J、InfoGrid 和 Infinite Graph 等。
对于爬虫的数据存储来说,一条数据可能存在某些字段提取失败而缺失的情况,而且数据可能随时调整。另外,数据之间还存在嵌套关系。如果使用关系型数据库存储,一是需要提前建表,二是如果存在数据嵌套关系的话,需要进行序列化操作才可以存储,这非常不方便。如果用了非关系型数据库,就可以避免一些麻烦,更简单、高效。