spacy的安装和使用教程

**引言:**从文本内容中抽取实体已经成为增强许多下游任务表现的一个关键因素。如何安装spacy库,下载spacy预训练语言模型以及使用模型抽取文本中的实体信息是本文的重点关注问题。若想详细了解spacy模型可以浏览github库https://github.com/explosion/spacy-models

文章目录

一、spacy安装

最简单直接的方式是采用以下命令直接在终端实施在线安装spacy包。

c 复制代码
pip install spacy

受python版本以及相关依赖包的缺乏,经常出现无法安装的窘境。为此,我们下载spacy包和相应的依赖包murmurhash、cymem,采用离线安装whl的方式实现安装。三个相关依赖包可通过官网下载:https://pypi.org/。一定要保证三个依赖包与自己的python版本匹配!!

c 复制代码
1.pip install murmurhash-1.0.10-cp37-cp37m-win_amd64.whl
2.pip install cymem-2.0.8-cp37-cp37m-win_amd64.whl
3.pip install spacy

二、spacy预训练模型安装

从https://spacy.io/models库中找到对应语言的预训练模型。

模型分为四类,各类模型描述如下:

将与spacy版本对应的某语言模型的tar.gz或.whl文件下载到本地文件夹中,用pip install 命令安装预训练模型。

三、spacy模型的使用pytorch代码

下面列举两个英文和中文提取实体信息的示例代码

c 复制代码
import spacy

try:
    nlp_en = spacy.load("en_core_web_sm")
    print("✅ English spaCy 模型加载成功!")
except Exception as e:
    print(f"❌ 加载失败:{e}")

try:
    nlp_zh = spacy.load("zh_core_web_sm")
    print("✅ Chinese spaCy 模型加载成功!")
except Exception as e:
    print(f"❌ 加载失败:{e}")

def extract_entities(text, lang="en"):
    """
    抽取文本中的实体
    lang: "en" 英文, "zh" 中文
    """
    nlp = nlp_en if lang == "en" else nlp_zh
    doc = nlp(text)
    return [(ent.text, ent.label_) for ent in doc.ents]


text = 'Apple Inc. was founded by Steve Jobs in Cupertino, California.'

en_text = "Apple Inc. was founded by Steve Jobs in Cupertino, California."
print("英文实体:")
for text, label in extract_entities(en_text, "en"):
    print(f"  {text}: {label}")

# 中文示例
zh_text = "2024年,阿里巴巴集团在杭州举办了云栖大会,创始人马云出席并发言。"
print("\n中文实体:")
for text, label in extract_entities(zh_text, "zh"):
    print(f"  {text}: {label}")

总结: spacy包已经成为抽取实体信息的必要环节。本博文从安装依赖包到下载预训练模型进行描述。如果对您有帮助,不要吝惜的点一个赞呀😁😁😁

参考博文:

1.https://www.cnblogs.com/my16/p/15167257.html

2.https://blog.csdn.net/cicd6pipeline/article/details/151013912

3.https://comate.baidu.com/zh/page/8cnl2692bec

相关推荐
小宋10211 小时前
Diffusion LLM 为什么能并行生成:从逐 Token 解码到多位置去噪实战
人工智能
znx9391 小时前
机器学习赋能量化交易:解锁新时代投资的核心竞争优势
人工智能·python·机器学习·期魔方
atwednesday1 小时前
理解 Transformer
人工智能
Timmy1 小时前
前端转全栈笔记:讲框架之前,先把 TypeScript 这关过了
前端·人工智能·node.js
_Meilinger_1 小时前
碎片笔记|生成图像检测与溯源领域近期审稿意见锦囊
人工智能·生成图像检测·投稿经验·生成图像取证·ai治理·生成图像溯源·科研经验
xzal121 小时前
Python 列表操作笔记:append / extend / + / pop
笔记·python
XUHUOJUN1 小时前
AI-Native Software Engineering:氛围编程的工程化与 Software Change Management
人工智能·ai-native
AI日报派送佬1 小时前
2026年9月30日AI行业日报|OpenAI DevDay连发25项更新,GPT-6.1 Sol&Dots智能体落地,全球AI监管收紧
人工智能·gpt·openai·ai智能体·大模型技术·人工智能前沿·ai监管
Frag0ut1 小时前
Chrome Canary 最新实验功能:AI Mode、按设备筛选历史记录与 Gemini 自动改密
前端·人工智能·chrome·dev·beta·canary·最新实验功能