nlp文本主题提取算法总结

  1. BERTopic:

    • 简介: 基于预训练的语言模型BERT(Bidirectional Encoder Representations from Transformers)的主题模型,通过将文档嵌入到BERT空间中并进行聚类,实现主题提取。
    • 作者: 出自Cherubin等人的研究(2021)。
  2. BigARTM (Big Additive Regularization Topic Model):

    • 简介: BigARTM是一种多模态、多目标的主题模型,可以处理大规模文本集合,并且允许用户通过添加正则化项来引导主题模型学习特定的模式。
    • 作者: 出自"BigARTM: Open-Source Library for Regularized Multimodal and Multilingual Topic Modeling"(2015)。
  3. LDA2Vec:

    • 简介: LDA2Vec是一种将词向量和主题模型(Latent Dirichlet Allocation, LDA)结合的方法,通过将LDA中的主题表示嵌入到词嵌入空间中,实现更好的语义建模。
    • 作者: 出自"Dynamic Topic Models for Tracking Research Communities over Time"(2016)。
  4. ETM (Embedding Topic Model):

    • 简介: ETM是一种将主题嵌入到连续空间的模型,通过学习主题嵌入向量,将文档嵌入到主题空间中,以获得更丰富的语义表示。
    • 作者: 出自"A Neural Probabilistic Topic Model"(2019)。
  5. Biterm Topic Model (BTM):

    • 简介: BTM是一种基于二项分布的主题模型,通过对文档中的词对(biterms)进行建模,实现了在大规模文本集上高效的主题建模。
    • 作者: 出自"Modeling Bimodal Texts with the Biterm Topic Model"(2014)。
相关推荐
古希腊掌管学习的神1 小时前
[机器学习]XGBoost(3)——确定树的结构
人工智能·机器学习
ZHOU_WUYI1 小时前
4.metagpt中的软件公司智能体 (ProjectManager 角色)
人工智能·metagpt
靴子学长2 小时前
基于字节大模型的论文翻译(含免费源码)
人工智能·深度学习·nlp
AI_NEW_COME3 小时前
知识库管理系统可扩展性深度测评
人工智能
海棠AI实验室3 小时前
AI的进阶之路:从机器学习到深度学习的演变(一)
人工智能·深度学习·机器学习
hunteritself3 小时前
AI Weekly『12月16-22日』:OpenAI公布o3,谷歌发布首个推理模型,GitHub Copilot免费版上线!
人工智能·gpt·chatgpt·github·openai·copilot
IT古董4 小时前
【机器学习】机器学习的基本分类-强化学习-策略梯度(Policy Gradient,PG)
人工智能·机器学习·分类
centurysee4 小时前
【最佳实践】Anthropic:Agentic系统实践案例
人工智能
mahuifa4 小时前
混合开发环境---使用编程AI辅助开发Qt
人工智能·vscode·qt·qtcreator·编程ai
四口鲸鱼爱吃盐4 小时前
Pytorch | 从零构建GoogleNet对CIFAR10进行分类
人工智能·pytorch·分类