技术栈
nlp
苏子寒
11 小时前
人工智能
·
笔记
·
python
·
机器学习
·
nlp
·
vllm
Nano-VLLM全代码解析笔记(2)-block_manager
[1]Nano-VLLM全代码解析笔记(1)-sequence[2]Nano-VLLM全代码解析笔记(2)-block_manager
小女孩真可爱
1 天前
人工智能
·
python
·
gpt
·
nlp
GPT(1)----------从零实现 GPT 模型以生成文本
本文用于记录和学习GPT搭建,以及一个训练优化的技巧,对于基础知识需自行去补充。## 1. 概述本文档描述一个完整的 GPT (Generative Pre-trained Transformer) 语言模型实现。该实现对应 **GPT-2 Small(124M 参数)** 的标准结构,涵盖从 token 输入到生成文本的完整流程。
苏子寒
2 天前
pytorch
·
笔记
·
python
·
机器学习
·
ai
·
nlp
·
vllm
Nano-VLLM全代码解析笔记(6)-embed_head和linear
一些问题:[系列(1) 开篇](https://blog.csdn.net/xxx/article/details/xxxxxx) [系列(2) 核心原理](https://blog.csdn.net/xxx/article/details/xxxxxx) 🔗上一篇:[系列(1)开篇](https://blog.csdn.net/xxx/article/details/xxxxxx) 🔗下一篇:[系列(3)实战演练](https://blog.csdn.net/xxx/article/details/
uncle_ll
9 天前
llm
·
nlp
·
llama
·
ollama
·
大模型微调
Llama 3 私有化落地全栈实战:从 Ollama 极速部署到 LLaMA Factory LoRA 定制微调
在前沿生成式 AI 的落地应用中,开发者常面临两大工程痛点:本文将围绕开源大模型基座 Llama 3,提供一条“推理部署 + 轻量微调”的完整闭环方案:采用Ollama构建零门槛本地 API 服务,结合LLaMA Factory框架完成低算力消耗的 LoRA 参数高效微调(PEFT)。
墨心@
9 天前
自然语言处理
·
nlp
·
agent
·
codex
阶段 1:一次模型调用
对应代码:stage01_model.py |理解"模型服务端只产生事件流,不循环"这件事。把多次请求串成闭环的永远是本地代码——这是理解整个 Agent 架构的第一块基石。
阿图灵
12 天前
深度学习
·
gru
·
nlp
·
机器翻译
·
seq2seq
基于 GRU 的 Seq2Seq 中英机器翻译:从 Tatoeba 语料到 BLEU 0.195
项目地址(Gitee):https://gitee.com/Touari/seq2seq_zh_en_translation.git 本文整合自项目《构建文档》与《技术文档》,既讲复现步骤,也讲设计原理。
网络工程小王
12 天前
人工智能
·
深度学习
·
自然语言处理
·
nlp
·
transformer
【HCIE-AI】4.NLP 核心任务与技术演进学习笔记
NLP 的任务可以归纳为四大类:文本分类、序列标注、信息抽取、文本生成。 几乎所有实际应用(搜索引擎、客服机器人、翻译、写作助手)都是这四类的组合。
Lee_jerome
13 天前
nlp
·
transformer
·
encoder
·
注意力机制
·
decoder
·
交叉注意力
·
self-attention
python神经网络编程入门(三十五)——Transformer 整体架构——一张图看懂全貌
📍 路标:本篇位于《从零构建 Transformer》系列 第 6/16 章 · 架构篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5) ▸ 架构篇(6-10·本篇) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
Lee_jerome
14 天前
深度学习
·
nlp
·
transformer
·
注意力机制
·
多头注意力
·
self-attention
python神经网络编程入门(三十三)——多头注意力(Multi-Head Attention)
📍 路标:本篇位于《从零构建 Transformer》系列 第 4/16 章 · 基石篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5·本篇) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
Lee_jerome
16 天前
rnn
·
深度学习
·
nlp
·
transformer
·
attention
·
注意力机制
·
序列建模
python神经网络编程入门(三十)——Transformer 从 RNN 到注意力:模型为什么需要“瞄一眼“
📍 路标:本篇位于《从零构建 Transformer》系列 第 1/16 章 · 基石篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5·本篇) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
阿图灵
16 天前
人工智能
·
深度学习
·
分类
·
nlp
·
lstm
·
情感分类
基于 LSTM 的中文电商评论情感分类:从数据处理到 91% 准确率实战
项目地址(Gitee):https://gitee.com/Touari/lstm_sentiment_2class.git 本文整合自项目《构建文档》与《技术文档》,既讲复现步骤,也讲设计原理。
方品
18 天前
服务器
·
人工智能
·
深度学习
·
nlp
【无标题】
Tensor core计算效率通常是cuda core 10倍,因此高性能矩阵计算、模型计算需要充分使用Tensor core来实现。
今日无bug
19 天前
llm
·
nlp
用 Prompt 做 NLP 任务开发:几分钟构建一个推理系统
仅用几分钟,我们就可以构建多个用于对文本进行推理的系统,而以前这需要熟练的机器学习人员数天到数周的时间。这就是 Prompt 工程带来的效率革命。
uncle_ll
22 天前
gpt
·
深度学习
·
llm
·
nlp
·
transformer
GPT 中文文本生成指南:从开箱调用到定制化微调,吃透 Transformer 解码器核心 logic
从 GPT-1/2 到 GPT-4、Llama 系列,自回归解码器专门解决文本生成这一核心问题。本文基于 Hugging Face 生态,从开箱即用的推理调用切入,深入拆解 GPT-2 底层生成原理,并手把手带你完成一套完整的古诗词自回归微调与工程优化全流程。
uncle_ll
22 天前
服务器
·
python
·
gpt
·
llm
·
nlp
服务器选型、微调范式、训练优化与环境搭建
在完成 BERT、GPT-2 等模型的本地微调入门后,真实项目中往往会面临显存不足、训练效率低、环境配置复杂等问题。本文系统梳理从云端服务器选择、三种微调范式对比、训练效率优化到本地环境搭建的全流程实操方案,覆盖从零基础入门到工业级调优的核心要点。
JaydenAI
24 天前
ai
·
nlp
·
agent
·
evaluation
·
maf
[Agent的评估-07]整合MEAI针对自然语言处理相关的评估器
Agent的评估-05:MEAI用来评估LLM响应质量的9种评估器介绍了定义在NuGet包Microsoft.Extensions.AI.Evaluation.Quality中与质量相关指标(包括完整性、一致性、相关性和等效性等)的各种评估器。除此之外,在NuGet包Microsoft.Extensions.AI.Evaluation.NLP还包含两个与自然语言处理(NLP)相关的评估器,这篇文章就来聊聊它们都用来评估怎样的指标,以及如何利用Agent的评估-06:如何改进MAF针对MEAI评估系统的适配
不爱记笔记
25 天前
人工智能
·
自然语言处理
·
nlp
·
音视频
·
多模态
多模态AI如何理解视频内容?从视觉、语音到语义的三层技术拆解
过去两年,音视频内容的生产速度远超文本。一个B站UP主每月产出几十个小时的视频,一门培训课程动辄上百节录播。面对海量视频,靠人力逐帧观看、手动做笔记已经不现实。多模态AI的出现,让机器理解视频内容从概念变成了可落地的技术方案。
uncle_ll
1 个月前
llm
·
nlp
·
bert
·
huggingface
·
hf-mirror
·
hf
深入探索 Hugging Face核心组件及实践
随着大语言模型(LLM)技术的全面爆发,自然语言处理正式迈入工业化落地阶段。无论是企业垂直场景的智能问答、情感舆情分析,还是个人开发者的AI创意应用开发,几乎所有大模型落地项目都绕不开一个核心平台——Hugging Face。
迷途呀
1 个月前
开发语言
·
笔记
·
python
·
langchain
·
nlp
Python:函数中的参数类型
Python 函数参数类型(尤其是 * 和 / 的作用) ,重点解释二者的不同和使用。Python 函数参数分为五种类型,按定义顺序排列:
Tbisnic
1 个月前
gpt
·
自然语言处理
·
大模型
·
nlp
·
bert
·
预训练模型
28.NLP 三大预训练模型 ELMo/BERT/GPT + HuggingFace Transformers
从词向量到双向上下文,从特征提取到微调,一篇文章理清现代 NLP 的基石如果你刚接触自然语言处理(NLP),一定会在 ELMo、BERT、GPT 这三个名字前感到困惑:它们都是预训练模型,为什么 BERT 在阅读理解上封神,GPT 成了写作利器,而 ELMo 却渐渐淡出大众视野?它们的训练方式、底层架构、适用场景到底差在哪里?