语言模型

ZJU_统一阿萨姆8 小时前
人工智能·算法·语言模型·硬件架构
【算子开发】算子融合与Softmax_LayerNorm实现在讨论 Softmax 与 LayerNorm 的具体实现之前,有必要先回答一个更根本的问题:为什么不直接按数学公式逐行实现,而要引入"融合"(fusion)这一层设计? 答案藏在一个简单的观察里:深度学习算子的计算强度(compute intensity)正在逐年下降,而模型中对内存带宽的渴望从未降低。换句话说,瓶颈早已不是算力,而是数据搬运。
Dawson Zhu10 小时前
人工智能·语言模型·重构·架构·aigc
图结构(Graph)如何重构智能体认知?从DAG规划到GraphRAG的技术拆解当前LLM Agent在处理复杂现实任务时,常受限于非结构化数据的"语义迷雾"与上下文窗口的"记忆瓶颈"。本文基于前沿技术视角,深度解析图结构(Graph Structure)如何作为下一代AI的认知脚手架,从DAG任务规划、工具链执行约束、GraphRAG动态记忆三个维度,探讨图神经网络与符号推理融合的技术路径及其工程化挑战。
大模型任我行3 天前
人工智能·语言模型·自然语言处理·论文笔记
NUS:冻结语义表征构建视频生成潜空间📖标题:V-RAE: Rethinking Video Latent Spaces for Generation 🌐来源:arXiv, 2608.13556v1
老郑聊AI业财智造11 小时前
人工智能·python·深度学习·语言模型·架构·transformer·软件工程
Transformer 技术架构与源码分析一句话概括:Transformer 不是神经网络架构的版本号递进,而是一场彻底的“范式革命”——以纯注意力机制彻底取代了统治序列建模数十年的 RNN 和 CNN,将序列建模从“顺序计算”的桎梏中解放出来,让并行训练成为可能;它以“编码器-解码器”为骨架、以多头自注意力为核心、以位置编码为序、以残差连接与层归一化为盾,用一套简洁而统一的原语回答了一个根本问题: 如果模型可以一次性“看见”整个序列中的所有位置,为什么还要一步步地“走过”它们?****
FunTester15 小时前
人工智能·语言模型·常用插件·deepseek·harness
DeepSeek Harness 常用插件介绍DeepSeek Harness(简称 DSH)是 DeepSeek 官方开源的 AI Agent 运行时框架,核心理念是 “一切皆插件”(Everything is a Plugin)。
Dawson Zhu19 小时前
人工智能·语言模型·架构·aigc
Agent自我纠错死循环:从原理剖析到工程化防御体系构建随着大模型Agent从Demo验证走向生产环境,“自我纠错死循环”(Soft Loop)已成为导致Token资源浪费与任务失败的核心故障之一。本文基于工程化实践,深入剖析盲点共享、目标无界、幻觉耦合三大底层成因,系统梳理语义停滞、状态机路径等四种检测手段,并提出包含预算熔断、异构裁判、检查点回溯在内的六级跳出策略。文章结合Loop Engineering与Agent Harness等前沿理念,旨在为开发者提供一套客观、可落地的Agent稳定性工程指南。
ZJU_统一阿萨姆19 小时前
人工智能·语言模型
【算子开发】卷积算子基础实现与优化卷积神经网络(CNN)的计算核心是卷积算子。无论是图像分类、目标检测还是语义分割,卷积运算都占据了整个模型 90% 以上的计算量。在 ResNet-50 中,单张 224×224 图像的一次前向推理需要约 38 亿次乘加运算,其中卷积层贡献了绝大多数。如果不做任何优化,在单核 CPU 上执行这些运算需要数秒,而在现代 GPU 上则可以压缩到毫秒级。这种数量级的差异,正是源于卷积运算本身的结构特性与 GPU 并行架构的高度契合。
Moon上有月亮21 小时前
人工智能·语言模型·自然语言处理·ollama
Ollama 完全指南:本地大语言模型的“开箱即用”方案从安装到部署,彻底搞懂 Ollama 的核心机制与实战应用一句话定义: Ollama 是一个本地大语言模型(LLM)部署与管理平台,让你可以在自己的电脑上轻松运行各种开源大模型,无需云服务、无需 API 密钥。
ZJU_统一阿萨姆2 天前
人工智能·算法·语言模型
【算子开发】Reduction算子完全指南在深入CUDA实现之前,我们必须先把问题本身嚼碎。归约(Reduction)不是某个特定算法,而是一类结构化折叠操作的统称——理解它的数学本质、输入输出契约以及串行参考实现,是后续所有并行化讨论的基石。本节将回答三个问题:归约到底在做什么?为什么可结合律决定了一切?以及CPU上最朴素的写法长什么样?
大模型任我行2 天前
人工智能·语言模型·自然语言处理·论文笔记
阿里:智能体原生视频表示学习📖标题:AVA-Encoder: Towards Agent-Native Video Representation Learning 🌐来源:arXiv, 2608.12313v1
老郑聊AI业财智造3 天前
人工智能·语言模型·架构·系统架构·软件工程
Qwen技术架构与源码深度剖析一句话概括:Qwen的技术演进不是参数规模的简单堆砌,而是一场从“稠密通用”到“稀疏专家协作”的系统工程革命——Qwen3.8-Max以2.4万亿总参数、仅950亿激活参数的MoE架构,用接近百亿级模型的推理成本撬动了万亿级模型的知识容量,在第三方盲测中综合能力仅次于Claude;Qwen3.6-35B-A3B则以35亿总参数、仅3亿激活参数的极致稀疏设计,让MoE大模型首次真正进入消费级硬件的射程——两者共同回答了同一个问题: 如何用最小的推理成本获得最强的模型能力?****
Claire_883 天前
语言模型·音视频·知识图谱
从视频字幕到知识图谱:基于大语言模型的自动思维导图生成工具调研技术关键词:自动语音识别(ASR)、大语言模型(LLM)、结构化输出、知识图谱构建、提示词工程我平时会通过B站、YouTube、极客时间等平台观看技术教程和行业分享。一个常见的情况是:花四十分钟看完一场架构演进的技术分享,当时觉得内容很清晰,但两天后想回顾其中的某个设计决策时,往往需要重新拖动进度条寻找——效率不太理想。
MartinYeung53 天前
网络·学习·语言模型
[论文学习]δ-STEAL:基于本地差分隐私的大语言模型窃取攻击本文提出了一种名为δ-STEAL的大语言模型(LLM)窃取攻击方法,通过在对窃取模型进行微调时向token嵌入注入满足本地差分隐私(LDP)保证的噪声,从而在绕过服务商水印检测器的同时保持攻击者模型的实用性。实验表明,该方法在轻量级修改下可实现高达96.95%的攻击成功率,对当前基于水印的LLM知识产权保护方案构成严重威胁。
澳鹏Appen4 天前
人工智能·gpt·ai·语言模型
AppenTalk | GPT-Red:AI 自动攻防,能替代人类红队吗?当 AI 系统开始自主浏览网页、读取邮件、调用工具,攻击面也在同步扩大。将恶意指令隐藏在网页、文件或工具中的提示注入(Prompt Injection)已成为大模型安全面临的最棘手挑战之一。
ZJU_统一阿萨姆3 天前
java·服务器·网络·人工智能·语言模型
【算子开发】全局内存访问与合并访存假设一段 CUDA 内核代码中,某个 warp 的 32 个线程各自对全局内存发起了一次 4 字节的读取。你可能会直觉地认为,硬件需要执行 32 次独立的内存访问。但事实远非如此——GPU 的内存子系统会在硬件层面合并这些请求,而理解这一机制的关键,在于「内存事务」(memory transaction)这一概念。
老郑聊AI业财智造3 天前
人工智能·语言模型·架构·系统架构·软件工程
DeepSeek技术架构与源码分析一句话概括:DeepSeek 的工程化精髓在于“以轻驭重”——R1-0528-Qwen3-8B 用 80 亿参数实现了 2350 亿参数模型的数学推理水平;V4-Flash 以 2840 亿总参数、仅 130 亿激活参数的 MoE 架构,在 Agent 能力上反超了自家三个月前的 Pro 预览版——两者共同回答了同一个问题: 在算力受限的约束下,如何用最小的推理成本获得最强的模型能力?****
如此这般英俊3 天前
前端·人工智能·chrome·python·算法·语言模型·自然语言处理
手搓Claude Code-第十三章 background_tasks上一章我们完成了整个任务分发系统,但你有没有发现,无论agent分化了多少个任务,其实都是由一个agent串行执行的。
盼小辉丶3 天前
pytorch·深度学习·语言模型·chatgpt·强化学习
PyTorch强化学习实战——用预训练语言模型和ChatGPT玩转文本游戏文本互动小说 (interactive fiction) 是强化学习研究中一个独特而富有挑战性的领域。与图形丰富的街机游戏不同,这类游戏通过纯文本描述呈现状态,要求智能体理解自然语言、进行长期规划并在复杂的语义空间中决策。我们已经以微软 TextWorld 为实验平台,学习了如何使用自然语言处理 (Natural Language Processing, NLP) 工具处理复杂的文本数据,并在交互式小说游戏环境中进行实验,在本节中,我们将借助 Hugging Face 预训练 Transformer 和
webor20064 天前
人工智能·语言模型·自然语言处理
<七>从3秒记忆到过目不忘——语言模型的三代进化上篇https://www.cnblogs.com/webor2006/p/22389647学了语言模型是什么——就是对"下一个词出现的概率"进行数学建模。但这事说起来简单,做起来一点都不简单。怎么建这个模?计算机怎么"记住"前面说过的话?
ZJU_统一阿萨姆4 天前
开发语言·人工智能·语言模型·架构·系统架构
【推理优化进阶】通信关键路径:NCCL、RDMA 与计算通信重叠注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。在上一节中,我们已经建立了消息延迟的微观构成——从软件栈到网络传输的每一层开销。现在,我们把这些开销抽象成两个参数,构建一个能够定量推导集合通信成本的核心模型。这个模型的价值在于:当你在 profile 中看到一个 AllReduce 耗时 2.3ms,你能立刻判断出它是由什么支配的,以及是否存在优化空间。