语言模型

FunTester3 小时前
人工智能·语言模型·常用插件·deepseek·harness
DeepSeek Harness 常用插件介绍DeepSeek Harness(简称 DSH)是 DeepSeek 官方开源的 AI Agent 运行时框架,核心理念是 “一切皆插件”(Everything is a Plugin)。
Dawson Zhu7 小时前
人工智能·语言模型·架构·aigc
Agent自我纠错死循环:从原理剖析到工程化防御体系构建随着大模型Agent从Demo验证走向生产环境,“自我纠错死循环”(Soft Loop)已成为导致Token资源浪费与任务失败的核心故障之一。本文基于工程化实践,深入剖析盲点共享、目标无界、幻觉耦合三大底层成因,系统梳理语义停滞、状态机路径等四种检测手段,并提出包含预算熔断、异构裁判、检查点回溯在内的六级跳出策略。文章结合Loop Engineering与Agent Harness等前沿理念,旨在为开发者提供一套客观、可落地的Agent稳定性工程指南。
ZJU_统一阿萨姆7 小时前
人工智能·语言模型
【算子开发】卷积算子基础实现与优化卷积神经网络(CNN)的计算核心是卷积算子。无论是图像分类、目标检测还是语义分割,卷积运算都占据了整个模型 90% 以上的计算量。在 ResNet-50 中,单张 224×224 图像的一次前向推理需要约 38 亿次乘加运算,其中卷积层贡献了绝大多数。如果不做任何优化,在单核 CPU 上执行这些运算需要数秒,而在现代 GPU 上则可以压缩到毫秒级。这种数量级的差异,正是源于卷积运算本身的结构特性与 GPU 并行架构的高度契合。
Moon上有月亮9 小时前
人工智能·语言模型·自然语言处理·ollama
Ollama 完全指南:本地大语言模型的“开箱即用”方案从安装到部署,彻底搞懂 Ollama 的核心机制与实战应用一句话定义: Ollama 是一个本地大语言模型(LLM)部署与管理平台,让你可以在自己的电脑上轻松运行各种开源大模型,无需云服务、无需 API 密钥。
ZJU_统一阿萨姆1 天前
人工智能·算法·语言模型
【算子开发】Reduction算子完全指南在深入CUDA实现之前,我们必须先把问题本身嚼碎。归约(Reduction)不是某个特定算法,而是一类结构化折叠操作的统称——理解它的数学本质、输入输出契约以及串行参考实现,是后续所有并行化讨论的基石。本节将回答三个问题:归约到底在做什么?为什么可结合律决定了一切?以及CPU上最朴素的写法长什么样?
大模型任我行2 天前
人工智能·语言模型·自然语言处理·论文笔记
阿里:智能体原生视频表示学习📖标题:AVA-Encoder: Towards Agent-Native Video Representation Learning 🌐来源:arXiv, 2608.12313v1
老郑聊AI业财智造2 天前
人工智能·语言模型·架构·系统架构·软件工程
Qwen技术架构与源码深度剖析一句话概括:Qwen的技术演进不是参数规模的简单堆砌,而是一场从“稠密通用”到“稀疏专家协作”的系统工程革命——Qwen3.8-Max以2.4万亿总参数、仅950亿激活参数的MoE架构,用接近百亿级模型的推理成本撬动了万亿级模型的知识容量,在第三方盲测中综合能力仅次于Claude;Qwen3.6-35B-A3B则以35亿总参数、仅3亿激活参数的极致稀疏设计,让MoE大模型首次真正进入消费级硬件的射程——两者共同回答了同一个问题: 如何用最小的推理成本获得最强的模型能力?****
Claire_882 天前
语言模型·音视频·知识图谱
从视频字幕到知识图谱:基于大语言模型的自动思维导图生成工具调研技术关键词:自动语音识别(ASR)、大语言模型(LLM)、结构化输出、知识图谱构建、提示词工程我平时会通过B站、YouTube、极客时间等平台观看技术教程和行业分享。一个常见的情况是:花四十分钟看完一场架构演进的技术分享,当时觉得内容很清晰,但两天后想回顾其中的某个设计决策时,往往需要重新拖动进度条寻找——效率不太理想。
MartinYeung52 天前
网络·学习·语言模型
[论文学习]δ-STEAL:基于本地差分隐私的大语言模型窃取攻击本文提出了一种名为δ-STEAL的大语言模型(LLM)窃取攻击方法,通过在对窃取模型进行微调时向token嵌入注入满足本地差分隐私(LDP)保证的噪声,从而在绕过服务商水印检测器的同时保持攻击者模型的实用性。实验表明,该方法在轻量级修改下可实现高达96.95%的攻击成功率,对当前基于水印的LLM知识产权保护方案构成严重威胁。
澳鹏Appen3 天前
人工智能·gpt·ai·语言模型
AppenTalk | GPT-Red:AI 自动攻防,能替代人类红队吗?当 AI 系统开始自主浏览网页、读取邮件、调用工具,攻击面也在同步扩大。将恶意指令隐藏在网页、文件或工具中的提示注入(Prompt Injection)已成为大模型安全面临的最棘手挑战之一。
ZJU_统一阿萨姆2 天前
java·服务器·网络·人工智能·语言模型
【算子开发】全局内存访问与合并访存假设一段 CUDA 内核代码中,某个 warp 的 32 个线程各自对全局内存发起了一次 4 字节的读取。你可能会直觉地认为,硬件需要执行 32 次独立的内存访问。但事实远非如此——GPU 的内存子系统会在硬件层面合并这些请求,而理解这一机制的关键,在于「内存事务」(memory transaction)这一概念。
老郑聊AI业财智造2 天前
人工智能·语言模型·架构·系统架构·软件工程
DeepSeek技术架构与源码分析一句话概括:DeepSeek 的工程化精髓在于“以轻驭重”——R1-0528-Qwen3-8B 用 80 亿参数实现了 2350 亿参数模型的数学推理水平;V4-Flash 以 2840 亿总参数、仅 130 亿激活参数的 MoE 架构,在 Agent 能力上反超了自家三个月前的 Pro 预览版——两者共同回答了同一个问题: 在算力受限的约束下,如何用最小的推理成本获得最强的模型能力?****
如此这般英俊2 天前
前端·人工智能·chrome·python·算法·语言模型·自然语言处理
手搓Claude Code-第十三章 background_tasks上一章我们完成了整个任务分发系统,但你有没有发现,无论agent分化了多少个任务,其实都是由一个agent串行执行的。
盼小辉丶2 天前
pytorch·深度学习·语言模型·chatgpt·强化学习
PyTorch强化学习实战——用预训练语言模型和ChatGPT玩转文本游戏文本互动小说 (interactive fiction) 是强化学习研究中一个独特而富有挑战性的领域。与图形丰富的街机游戏不同,这类游戏通过纯文本描述呈现状态,要求智能体理解自然语言、进行长期规划并在复杂的语义空间中决策。我们已经以微软 TextWorld 为实验平台,学习了如何使用自然语言处理 (Natural Language Processing, NLP) 工具处理复杂的文本数据,并在交互式小说游戏环境中进行实验,在本节中,我们将借助 Hugging Face 预训练 Transformer 和
webor20063 天前
人工智能·语言模型·自然语言处理
<七>从3秒记忆到过目不忘——语言模型的三代进化上篇https://www.cnblogs.com/webor2006/p/22389647学了语言模型是什么——就是对"下一个词出现的概率"进行数学建模。但这事说起来简单,做起来一点都不简单。怎么建这个模?计算机怎么"记住"前面说过的话?
ZJU_统一阿萨姆3 天前
开发语言·人工智能·语言模型·架构·系统架构
【推理优化进阶】通信关键路径:NCCL、RDMA 与计算通信重叠注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。在上一节中,我们已经建立了消息延迟的微观构成——从软件栈到网络传输的每一层开销。现在,我们把这些开销抽象成两个参数,构建一个能够定量推导集合通信成本的核心模型。这个模型的价值在于:当你在 profile 中看到一个 AllReduce 耗时 2.3ms,你能立刻判断出它是由什么支配的,以及是否存在优化空间。
学习中.........3 天前
人工智能·算法·语言模型
Karpathy nanoGPT 教程到底讲了什么CS336的教程功课难度较高,曲线救过,通过 karpathy 的 nanogpt 项目,深入理解大模型的底层原理,模型的网络架构以及一些训练的工程细节,培养一定的代码能力,才能更好的完成CS336的学习。
0x3F(小茶)3 天前
人工智能·算法·语言模型
Tokenization(分词算法):一切大语言模型的地基在深入 Prompt Engineering、RAG、微调等高级话题之前,有一项最基础但至关重要的技术常常被忽视——Tokenization(分词算法)。它是所有大语言模型(LLM)处理文本的第一道工序,决定了模型如何看待文字,并深刻影响着推理成本、上下文长度、模型效果以及后续所有环节的设计。
树码小子4 天前
人工智能·语言模型·mvc
什么是大语言模型大语言模型(Large Language Model,LLM)是指基于大规模神经网络,通过自监督或半监督方式,对海量文本进行训练、能理解和生成人类语言的语言模型**。
问天_观心4 天前
人工智能·神经网络·语言模型·github·模型蒸馏
零基础在windows环境下的WSL使用llamafactory(二)微调模型 (Fine-tuned Model / Instruct Model)在预训练基础上进一步适配下游任务(如医疗问答、代码生成等)