语言模型

webor200610 小时前
人工智能·语言模型·自然语言处理
<七>从3秒记忆到过目不忘——语言模型的三代进化上篇https://www.cnblogs.com/webor2006/p/22389647学了语言模型是什么——就是对"下一个词出现的概率"进行数学建模。但这事说起来简单,做起来一点都不简单。怎么建这个模?计算机怎么"记住"前面说过的话?
ZJU_统一阿萨姆13 小时前
开发语言·人工智能·语言模型·架构·系统架构
【推理优化进阶】通信关键路径:NCCL、RDMA 与计算通信重叠注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。在上一节中,我们已经建立了消息延迟的微观构成——从软件栈到网络传输的每一层开销。现在,我们把这些开销抽象成两个参数,构建一个能够定量推导集合通信成本的核心模型。这个模型的价值在于:当你在 profile 中看到一个 AllReduce 耗时 2.3ms,你能立刻判断出它是由什么支配的,以及是否存在优化空间。
学习中.........14 小时前
人工智能·算法·语言模型
Karpathy nanoGPT 教程到底讲了什么CS336的教程功课难度较高,曲线救过,通过 karpathy 的 nanogpt 项目,深入理解大模型的底层原理,模型的网络架构以及一些训练的工程细节,培养一定的代码能力,才能更好的完成CS336的学习。
0x3F(小茶)18 小时前
人工智能·算法·语言模型
Tokenization(分词算法):一切大语言模型的地基在深入 Prompt Engineering、RAG、微调等高级话题之前,有一项最基础但至关重要的技术常常被忽视——Tokenization(分词算法)。它是所有大语言模型(LLM)处理文本的第一道工序,决定了模型如何看待文字,并深刻影响着推理成本、上下文长度、模型效果以及后续所有环节的设计。
树码小子2 天前
人工智能·语言模型·mvc
什么是大语言模型大语言模型(Large Language Model,LLM)是指基于大规模神经网络,通过自监督或半监督方式,对海量文本进行训练、能理解和生成人类语言的语言模型**。
问天_观心1 天前
人工智能·神经网络·语言模型·github·模型蒸馏
零基础在windows环境下的WSL使用llamafactory(二)微调模型 (Fine-tuned Model / Instruct Model)在预训练基础上进一步适配下游任务(如医疗问答、代码生成等)
专注仿真1 天前
人工智能·python·算法·语言模型·问答大模型关键算法·熵权融合算法·交叉编码器重排算法
问答大模型技术方案算法实现-熵权法融合算法 + 交叉编码器重排算法算法核心特点 熵权法权重计算:动态计算向量检索和关键词检索的权重,避免固定权重的主观性交叉编码器重排:使用预训练的交叉编码器模型进行精排,提高相关性判断准确性
阿维的博客日记1 天前
人工智能·语言模型·自然语言处理
什么是unigram语言模型Unigram 语言模型(一元文法模型)是自然语言处理(NLP)中最简单、最基础的统计语言模型(N-gramN\text{-gram}N-gram 模型中 N=1N=1N=1 的特例)。
ZJU_统一阿萨姆1 天前
开发语言·人工智能·语言模型·系统架构·vllm
【推理优化进阶】调度器的数学内核:排队论、SLO 与在线决策注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。经典排队论的服务台假设是:顾客到达后立即被服务,服务时间彼此独立且与系统状态无关。LLM Serving 的场景——请求按序列生成 token,一个 batch 中的多个请求共享 GPU 计算资源,输出长度在到达时完全未知——恰好系统性破坏这三个假设。因此,这节的任务不是照搬教科书公式,而是建立一套可推导、可测量、能预测拐点的近似模型,让后续的 admission、batching、preemption 决策有统一的数学
ZJU_统一阿萨姆2 天前
开发语言·人工智能·语言模型·架构·开源
【推理优化进阶】图编译与运行时:动态形状、CUDA Graph 与内存规划注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。当你在 PyTorch 中写下 model(x) 时,Dynamo——PyTorch 的编译框架——拦截到的并不是一套算子调用的流水账,而是一个可以程序化重组的计算图。理解这条从捕获到生成的路径,关键不在于记住每一步的 API 名称,而在于看清每一层 IR 究竟在优化什么——以及它为此舍弃了什么。
Dawson Zhu3 天前
人工智能·语言模型·aigc·agi
从串行到树搜索:LATS 如何用蒙特卡洛树搜索重构 LLM Agent 决策框架大型语言模型(LLM)驱动的智能体(Agent)近年来取得了显著进展,其中 ReAct 范式(Reasoning + Acting)因其简洁有效的"思考-行动-观察"循环成为主流。然而,ReAct 本质上是串行决策链:每一步都严格依赖前一步的输出,一旦早期出现错误(如选错参数、误解指令),整个轨迹便无法挽回,导致任务失败。
Together_CZ3 天前
语言模型·llm·transformer·scaling laws·parcae·用于稳定循环语言模型的扩展定律·stable looped
Parcae: Scaling Laws For Stable Looped Language Models——用于稳定循环语言模型的扩展定律论文由加州大学圣迭戈分校和Together AI的研究者共同完成,聚焦于如何稳定地训练循环(Looped)架构的大语言模型,并将其发展为一种独立于模型参数和数据量的、可预测的扩展计算规模的新维度。核心贡献是提出了新型循环架构 Parcae,通过动态系统理论和工程化改进,解决了该类模型长期存在的训练不稳定问题,并首次系统性地推导了其在训练和推理阶段的扩展定律。
问天_观心3 天前
人工智能·windows·python·神经网络·语言模型·github·模型蒸馏
零基础在windows环境下的WSL使用llamafactory(一)模型微调的大致流程:微调训练、推理验证、模型导出、模型部署目录llamafactory三种搭建方式python环境的搭建
MartinYeung53 天前
学习·安全·语言模型
[论文学习]Latent Fusion Jailbreak: 融合有害与无害表征以诱导大语言模型产生不安全输出本文提出了一种名为潜在融合越狱(Latent Fusion Jailbreak, LFJ) 的新型白盒攻击方法,通过将有害查询与结构相似的无害查询配对,在选定的Transformer层和token位置上对二者的隐藏状态进行插值融合,从而绕过LLM的安全对齐机制。实验表明,该攻击在五个开源模型和四个安全基准上达到了94.13%的平均攻击成功率(ASR) ,同时作者还设计了一种针对性的潜在对抗训练防御方法,可将ASR降至12.37%。
江畔柳前堤3 天前
大数据·人工智能·分布式·目标检测·机器学习·语言模型·架构
AgentScope 设计与原理全解:从消息原语到分布式智能体工程底座最后更新:2026年8月17日 | 基于 AgentScope 2.0(Python/TS)及 AgentScope Java 2.0 GA 版本撰写
ZJU_统一阿萨姆3 天前
开发语言·人工智能·语言模型·系统架构·vllm
【推理优化进阶】性能实验科学:工作负载、统计显著性与尾延迟归因注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。先导课中,我们通过固定延迟、固定 QPS 的压测拿到了基线吞吐数字。但把这份报告带到生产环境评审时,几乎必然会被挑战:真实流量不会像基准测试那样方方正正如矩阵——每一行等长,每个请求同质。生产流量有到达的节奏、有输入输出的联合形态、有不同租户的叠加,这些维度共同决定了实验结论是否可迁移。
ZJU_统一阿萨姆3 天前
开发语言·人工智能·语言模型·架构·开源
【推理优化进阶】Hopper_Blackwell 微架构:从指令、流水线到真实性能上限注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。把 GPU 看作一群并行执行的 SM,是最常见的抽象;但要解释"为什么 Tensor Core 没吃满",必须进入单个 SM 的内部,理解 warp scheduler、寄存器文件与 shared memory 如何在每个时钟周期内争夺资源并最终决定占用率(occupancy)。
lucky_syq3 天前
人工智能·语言模型·架构·transformer
第3篇 · S1·上:什么是大语言模型 + Transformer 架构深讲这一篇剥掉大模型的神秘外衣:LLM 的概率本质、能力与边界,以及 Decoder-only Transformer 的完整架构与注意力推导。它是整个学习篇(S1-S10)的地基,后续训练(第 6-7 篇)、微调(第 8-9 篇)、推理优化(第 10-11 篇)都踩在这块地基上。 学完你应该能看懂任何主流 LLM 的架构图,把注意力计算对应到自己熟悉的分布式/数据概念上,面试能默写注意力公式并讲清 √d_k。 每节按 原理 -> 关键推导 -> 前端/后端/大数据映射 -> 实操要点 -> 误区 走。遇到公
皮皮蟹虾饺3 天前
linux·人工智能·ubuntu·语言模型·kubernetes
NCCL 源码解析:通信器从出生到消亡的完整一生📌 本文亮点:帮你建立对 NCCL 的全局认知坐标系,并讲透 ncclComm_t 通信器从出生到消亡的完整一生。
墨心@4 天前
人工智能·语言模型·大语言模型·agent·codex·harness
阶段 4:事件总线对应代码:stage04_events.py理解"事件既是给消费者的消息,也是驱动派生状态的输入",并实现 terminal_error 的单写多读模式。