nlp

苏子寒11 小时前
人工智能·笔记·python·机器学习·nlp·vllm
Nano-VLLM全代码解析笔记(2)-block_manager[1]Nano-VLLM全代码解析笔记(1)-sequence[2]Nano-VLLM全代码解析笔记(2)-block_manager
小女孩真可爱1 天前
人工智能·python·gpt·nlp
GPT(1)----------从零实现 GPT 模型以生成文本本文用于记录和学习GPT搭建,以及一个训练优化的技巧,对于基础知识需自行去补充。## 1. 概述本文档描述一个完整的 GPT (Generative Pre-trained Transformer) 语言模型实现。该实现对应 **GPT-2 Small(124M 参数)** 的标准结构,涵盖从 token 输入到生成文本的完整流程。
苏子寒2 天前
pytorch·笔记·python·机器学习·ai·nlp·vllm
Nano-VLLM全代码解析笔记(6)-embed_head和linear一些问题:[系列(1) 开篇](https://blog.csdn.net/xxx/article/details/xxxxxx) [系列(2) 核心原理](https://blog.csdn.net/xxx/article/details/xxxxxx) 🔗上一篇:[系列(1)开篇](https://blog.csdn.net/xxx/article/details/xxxxxx) 🔗下一篇:[系列(3)实战演练](https://blog.csdn.net/xxx/article/details/
uncle_ll9 天前
llm·nlp·llama·ollama·大模型微调
Llama 3 私有化落地全栈实战:从 Ollama 极速部署到 LLaMA Factory LoRA 定制微调在前沿生成式 AI 的落地应用中,开发者常面临两大工程痛点:本文将围绕开源大模型基座 Llama 3,提供一条“推理部署 + 轻量微调”的完整闭环方案:采用Ollama构建零门槛本地 API 服务,结合LLaMA Factory框架完成低算力消耗的 LoRA 参数高效微调(PEFT)。
墨心@9 天前
自然语言处理·nlp·agent·codex
阶段 1:一次模型调用对应代码:stage01_model.py |理解"模型服务端只产生事件流,不循环"这件事。把多次请求串成闭环的永远是本地代码——这是理解整个 Agent 架构的第一块基石。
阿图灵12 天前
深度学习·gru·nlp·机器翻译·seq2seq
基于 GRU 的 Seq2Seq 中英机器翻译:从 Tatoeba 语料到 BLEU 0.195项目地址(Gitee):https://gitee.com/Touari/seq2seq_zh_en_translation.git 本文整合自项目《构建文档》与《技术文档》,既讲复现步骤,也讲设计原理。
网络工程小王12 天前
人工智能·深度学习·自然语言处理·nlp·transformer
【HCIE-AI】4.NLP 核心任务与技术演进学习笔记NLP 的任务可以归纳为四大类:文本分类、序列标注、信息抽取、文本生成。 几乎所有实际应用(搜索引擎、客服机器人、翻译、写作助手)都是这四类的组合。
Lee_jerome13 天前
nlp·transformer·encoder·注意力机制·decoder·交叉注意力·self-attention
python神经网络编程入门(三十五)——Transformer 整体架构——一张图看懂全貌📍 路标:本篇位于《从零构建 Transformer》系列 第 6/16 章 · 架构篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5) ▸ 架构篇(6-10·本篇) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
Lee_jerome14 天前
深度学习·nlp·transformer·注意力机制·多头注意力·self-attention
python神经网络编程入门(三十三)——多头注意力(Multi-Head Attention)📍 路标:本篇位于《从零构建 Transformer》系列 第 4/16 章 · 基石篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5·本篇) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
Lee_jerome16 天前
rnn·深度学习·nlp·transformer·attention·注意力机制·序列建模
python神经网络编程入门(三十)——Transformer 从 RNN 到注意力:模型为什么需要“瞄一眼“📍 路标:本篇位于《从零构建 Transformer》系列 第 1/16 章 · 基石篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5·本篇) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
阿图灵16 天前
人工智能·深度学习·分类·nlp·lstm·情感分类
基于 LSTM 的中文电商评论情感分类:从数据处理到 91% 准确率实战项目地址(Gitee):https://gitee.com/Touari/lstm_sentiment_2class.git 本文整合自项目《构建文档》与《技术文档》,既讲复现步骤,也讲设计原理。
方品18 天前
服务器·人工智能·深度学习·nlp
【无标题】Tensor core计算效率通常是cuda core 10倍,因此高性能矩阵计算、模型计算需要充分使用Tensor core来实现。
今日无bug19 天前
llm·nlp
用 Prompt 做 NLP 任务开发:几分钟构建一个推理系统仅用几分钟,我们就可以构建多个用于对文本进行推理的系统,而以前这需要熟练的机器学习人员数天到数周的时间。这就是 Prompt 工程带来的效率革命。
uncle_ll22 天前
gpt·深度学习·llm·nlp·transformer
GPT 中文文本生成指南:从开箱调用到定制化微调,吃透 Transformer 解码器核心 logic从 GPT-1/2 到 GPT-4、Llama 系列,自回归解码器专门解决文本生成这一核心问题。本文基于 Hugging Face 生态,从开箱即用的推理调用切入,深入拆解 GPT-2 底层生成原理,并手把手带你完成一套完整的古诗词自回归微调与工程优化全流程。
uncle_ll22 天前
服务器·python·gpt·llm·nlp
服务器选型、微调范式、训练优化与环境搭建在完成 BERT、GPT-2 等模型的本地微调入门后,真实项目中往往会面临显存不足、训练效率低、环境配置复杂等问题。本文系统梳理从云端服务器选择、三种微调范式对比、训练效率优化到本地环境搭建的全流程实操方案,覆盖从零基础入门到工业级调优的核心要点。
JaydenAI24 天前
ai·nlp·agent·evaluation·maf
[Agent的评估-07]整合MEAI针对自然语言处理相关的评估器Agent的评估-05:MEAI用来评估LLM响应质量的9种评估器介绍了定义在NuGet包Microsoft.Extensions.AI.Evaluation.Quality中与质量相关指标(包括完整性、一致性、相关性和等效性等)的各种评估器。除此之外,在NuGet包Microsoft.Extensions.AI.Evaluation.NLP还包含两个与自然语言处理(NLP)相关的评估器,这篇文章就来聊聊它们都用来评估怎样的指标,以及如何利用Agent的评估-06:如何改进MAF针对MEAI评估系统的适配
不爱记笔记25 天前
人工智能·自然语言处理·nlp·音视频·多模态
多模态AI如何理解视频内容?从视觉、语音到语义的三层技术拆解过去两年,音视频内容的生产速度远超文本。一个B站UP主每月产出几十个小时的视频,一门培训课程动辄上百节录播。面对海量视频,靠人力逐帧观看、手动做笔记已经不现实。多模态AI的出现,让机器理解视频内容从概念变成了可落地的技术方案。
uncle_ll1 个月前
llm·nlp·bert·huggingface·hf-mirror·hf
深入探索 Hugging Face核心组件及实践随着大语言模型(LLM)技术的全面爆发,自然语言处理正式迈入工业化落地阶段。无论是企业垂直场景的智能问答、情感舆情分析,还是个人开发者的AI创意应用开发,几乎所有大模型落地项目都绕不开一个核心平台——Hugging Face。
迷途呀1 个月前
开发语言·笔记·python·langchain·nlp
Python:函数中的参数类型Python 函数参数类型(尤其是 * 和 / 的作用) ,重点解释二者的不同和使用。Python 函数参数分为五种类型,按定义顺序排列:
Tbisnic1 个月前
gpt·自然语言处理·大模型·nlp·bert·预训练模型
28.NLP 三大预训练模型 ELMo/BERT/GPT + HuggingFace Transformers从词向量到双向上下文,从特征提取到微调,一篇文章理清现代 NLP 的基石如果你刚接触自然语言处理(NLP),一定会在 ELMo、BERT、GPT 这三个名字前感到困惑:它们都是预训练模型,为什么 BERT 在阅读理解上封神,GPT 成了写作利器,而 ELMo 却渐渐淡出大众视野?它们的训练方式、底层架构、适用场景到底差在哪里?