自然语言处理

KAU的云实验台12 小时前
人工智能·语言模型·自然语言处理
【研究分享】大语言模型 × 进化计算新范式? —— 以ReEvo为例拆解本文核心内容最近KAU研究了大语言模型和进化算法的结合相关论文,发现这个方向挺有意思,让我觉得LLM能够给进化计算加上“语义上的方向感”,该领域的研究进展也是日新月异。 因此,本文KAU对该研究方向作一些个人层面的梳理与分享,供大家参考讨论 (如有错漏,欢迎随时拍砖指正)
想会飞的蒲公英1 天前
人工智能·python·自然语言处理
计算机怎样读取中文文本:编码、清洗与标准化文本分类项目看起来是在训练模型,但第一步其实不是模型,而是让计算机正确读取文本。如果一开始就乱码、混入奇怪符号、空白不统一,后面的分词、TF-IDF 和模型训练都会受到影响。这一课先解决一个基础问题:中文文本进入模型之前,应该怎样读取、清洗和标准化。
羊羊小栈2 天前
人工智能·算法·语言模型·自然语言处理·毕业设计·neo4j·大作业
基于GraphRAG的税务财务智能问答系统(Neo4j_大语言模型)b站演示视频与部署教程视频(点击这里) https://www.bilibili.com/video/BV1asK26PEsu/?share_source=copy_web&vd_source=31c839f46a9a845dd6dd641cbd5c2ac1
Tbisnic2 天前
gpt·自然语言处理·大模型·nlp·bert·预训练模型
28.NLP 三大预训练模型 ELMo/BERT/GPT + HuggingFace Transformers从词向量到双向上下文,从特征提取到微调,一篇文章理清现代 NLP 的基石如果你刚接触自然语言处理(NLP),一定会在 ELMo、BERT、GPT 这三个名字前感到困惑:它们都是预训练模型,为什么 BERT 在阅读理解上封神,GPT 成了写作利器,而 ELMo 却渐渐淡出大众视野?它们的训练方式、底层架构、适用场景到底差在哪里?
AI人工智能+2 天前
深度学习·计算机视觉·自然语言处理·ocr·银行回单识别
银行回单识别技术通过AI驱动的智能文档理解方案,实现财务处理的革命性升级在数字化转型的浪潮中,企业财务管理的自动化与智能化已成为提升核心竞争力的关键。高精度的银行回单识别技术的出现,不仅解决了传统财务处理中的痛点,更为企业构建了高效、准确、安全的智能财务闭环。
Summer-Bright2 天前
人工智能·ai·自然语言处理·agi
深度 | Kimi K3 48 小时设计芯片:EDA 行业真的会被 AI 颠覆吗?核心观点:Kimi K3 用开源工具 48 小时跑通芯片设计,让 Cadence 和 Synopsys 一天蒸发 158 亿美元。但 EDA 的护城河不是"能不能画版图",而是晶圆厂只认特定工具的签核签名。45nm 学术演示和 2nm 商业签核之间,隔着的不只是技术鸿沟,还有整个半导体产业的信任体系。
卖微积分的男孩3 天前
人工智能·语言模型·自然语言处理
【论文精读】Tapered Language Models|锥形语言模型论文地址:Tapered Language Models包括Transformer、RNN和基于记忆机制的各类变体在内的现代语言模型,都采用了一种通用的架构:由若干结构完全相同的层堆叠而成,在深度方向上均匀分配参数。但是现在的一些研究表明,不同层对最后输出的贡献是非均匀的:深层更多在于细化残差流(residual stream),而非对其进行转化。为此,作者提出参数容量是否反映出了这种不对称性。
大模型任我行3 天前
人工智能·语言模型·自然语言处理·论文笔记
腾讯:预测散度掩码提升LLM强化学习📖标题:Predictive Divergence Masks for LLM RL 🌐来源:arXiv, 2607.10848v1
解局易否结局3 天前
华为·自然语言处理·分类·harmonyos·tf-idf
鸿蒙端侧 NLP 实战:分词器 + TF-IDF + 朴素贝叶斯分类 + 文本相似度技术栈:HarmonyOS NEXT(API 12+)|ArkTS 原生开发 核心亮点:纯算法实现,不依赖任何第三方 NLP 库;覆盖分词 → 关键词提取 → 文本分类 → 相似度计算全链路 难度定位:中高级 · 完整可运行代码
wish3663 天前
人工智能·语言模型·自然语言处理·local llm
使用 Chainlit 调用 TextGen API + 本地 LLM 实现 RAG Chatbot 应用随着大语言模型(LLM)的快速发展,检索增强生成(RAG)已成为构建知识密集型应用的主流架构。然而,在实际部署中,我们常常面临两个核心挑战:如何快速构建一个交互式的演示界面,以及如何将 RAG 系统与本地部署的 LLM 高效集成。
春波petal4 天前
人工智能·自然语言处理·chatgpt·大模型·多模态·语音大模型
大模型底层逻辑:优势局限与天生短板👨‍💻 了解博主:波仔椿 📖 人生箴言:技术落地,方为 AI 正道。 🧰 我的专栏:普通人可落地的 AI 提效实战
有Li5 天前
人工智能·深度学习·语言模型·自然语言处理·文献·医学生
用于肝细胞癌个体化临床决策的多模态大语言模型智能体框架文献速递/医学智能体前沿2026.7.17本文融合MRI影像组学、改进GhostNet病理标志物预测与LLM智能体,为肝细胞癌患者生成并评估个体化治疗建议。
lilihuigz5 天前
人工智能·语言模型·自然语言处理
大型语言模型(LLMs)如何解读网站📎 原文来源:大型语言模型(LLMs)如何解读网站 https://woshops.com/da-xing-yu-yan-mo-xing-llms-ru-he-jie-du-wang-zhan/
Omics Pro5 天前
数据库·人工智能·深度学习·mysql·搜索引擎·自然语言处理
深度学习多组学互作:组内+组间多组学互作(包括组内互作、组间互作以及社会环境调控作用)是挖掘单一组学分析、传统整合手段难以发现分子机制的关键。深度学习为攻克现有研究局限提供了可行方案,可解决高维非线性互作建模、样本量不足与多重检验带来的计算负担等难题。
zhangfeng11336 天前
人工智能·语言模型·自然语言处理
llamafactory 大语言模型llm 微调,关键参数深度讲解(法律大模型微调专属版)环境:ROCm AMD GPU + LlamaFactory LoRA微调 Qwen2-5120(48层大模型),断点续训 checkpoint-2500,单卡训练。 训练任务:法律领域监督微调(法律问答/法条解析/文书生成)
陆水A6 天前
大数据·数据库·自然语言处理·big data·etl工程师
【问数系统】SQL跑对了图表却空了?打通问数系统最后1公里的3个API坑这是【问数系统拆解】系列第7篇。上篇讲流式续流——用户断网了对话怎么不丢。这篇讲一个被所有人忽略的环节:SQL跑出来了,结果也返回了,但用户还是看不懂。
学编程的小虎6 天前
人工智能·python·自然语言处理
SenseVoice微调需要同时安装Sensevoice和FunASR,本文在root用户下操作使用命令生成 train.jsonl
数聚天成DeepSData6 天前
数据库·人工智能·深度学习·机器学习·自然语言处理·数据挖掘
遥感农业数据集下载全攻略摘要:本文系统梳理了 EuroSAT、BigEarthNet、Agriculture-Vision、IBM-NASA 多时相作物分类、CropNet 等主流遥感农业数据集,提供国内下载稳定入口与避坑指南。通过横向对比表格、选型指南与实战案例(如玉米病害预警、作物识别与产量预测),助你根据任务目标、数据模态与许可协议快速选型,规避常见陷阱。涵盖数据处理流程、注意事项与资源导航,为农业遥感深度学习项目提供一站式实战参考。无论你是进行遥感图像分类、土地覆盖识别、农田异常检测还是作物产量预测,本文都能帮助你快速找
般若-波罗蜜6 天前
人工智能·python·语言模型·自然语言处理
MinerU高级用法,避坑指南(持续更新)如图,pdf文本(可复制),经过mineru解析后,数字相关的部分都丢失了。 问题定位: MinerU支持PDF、图片和DOCX三大主流文档格式的输入。对于PDF文档,工具能够自动处理扫描件和乱码PDF并启用OCR功能。 从官方给出的代码可以看出,mineru默认采用”auto“来进行解析,内部自动根据文本格式等因素选择采用OCR、text的方式来解析文本。这里的text是使用了python解析库来解析pdf的(如:pymulf),(猜测,数字地方可能包含了其它格式,如latex),传统的python库解
cxr8287 天前
人工智能·python·算法·缓存·语言模型·自然语言处理·llm
大语言模型上下文缓存命中率测试全场景清单以下是我们系统梳理过的大语言模型上下文缓存命中率测试全场景清单,按测试目的分为六大类,每个场景包含目的、方法与预期行为。