语言模型

howdoyoudo20260636 分钟前
大数据·人工智能·安全·ai·语言模型
AI审计手记 #01(数据补全版):107小时、17,600次操作——OpenAI越狱案完整攻击链量化分析AI审计手记 #01(数据补全版):107小时、17,600次操作——OpenAI越狱案完整攻击链量化分析
硅谷秋水2 小时前
人工智能·深度学习·安全·机器学习·语言模型·机器人
通过技能-驾驭进化实现自我演化的具身智能体26年8月来自美国东北大学和微软研究院的论文“Self-Evolving Embodied Agents via Skill-Harness Evolution”。
大模型任我行7 小时前
人工智能·语言模型·自然语言处理·论文笔记
NUS:全模态感知驱动AI科学家📖标题:OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 🌐来源:arXiv, 2608.13558v1
硅谷秋水7 小时前
人工智能·深度学习·安全·机器学习·语言模型·机器人
迈向具身智能体的驾驭26年8月来自宁波东方理工大学的论文“Towards the Harness of Embodied Agents”。
sel_910 小时前
人工智能·pytorch·深度学习·算法·语言模型
【Pytorch】PyTorch 深度学习框架详解:从安装到实战本文系统梳理 PyTorch 的核心概念与常用 API,涵盖安装配置、张量操作、自动求导、神经网络搭建、数据加载、训练循环、模型保存与加载、GPU 加速、常用技巧等内容,配合可运行代码示例讲解,适合有 Python 基础、希望系统入门深度学习实战的开发者阅读。
ZJU_统一阿萨姆21 小时前
人工智能·算法·语言模型·硬件架构
【算子开发】算子融合与Softmax_LayerNorm实现在讨论 Softmax 与 LayerNorm 的具体实现之前,有必要先回答一个更根本的问题:为什么不直接按数学公式逐行实现,而要引入"融合"(fusion)这一层设计? 答案藏在一个简单的观察里:深度学习算子的计算强度(compute intensity)正在逐年下降,而模型中对内存带宽的渴望从未降低。换句话说,瓶颈早已不是算力,而是数据搬运。
Dawson Zhu1 天前
人工智能·语言模型·重构·架构·aigc
图结构(Graph)如何重构智能体认知?从DAG规划到GraphRAG的技术拆解当前LLM Agent在处理复杂现实任务时,常受限于非结构化数据的"语义迷雾"与上下文窗口的"记忆瓶颈"。本文基于前沿技术视角,深度解析图结构(Graph Structure)如何作为下一代AI的认知脚手架,从DAG任务规划、工具链执行约束、GraphRAG动态记忆三个维度,探讨图神经网络与符号推理融合的技术路径及其工程化挑战。
大模型任我行4 天前
人工智能·语言模型·自然语言处理·论文笔记
NUS:冻结语义表征构建视频生成潜空间📖标题:V-RAE: Rethinking Video Latent Spaces for Generation 🌐来源:arXiv, 2608.13556v1
老郑聊AI业财智造1 天前
人工智能·python·深度学习·语言模型·架构·transformer·软件工程
Transformer 技术架构与源码分析一句话概括:Transformer 不是神经网络架构的版本号递进,而是一场彻底的“范式革命”——以纯注意力机制彻底取代了统治序列建模数十年的 RNN 和 CNN,将序列建模从“顺序计算”的桎梏中解放出来,让并行训练成为可能;它以“编码器-解码器”为骨架、以多头自注意力为核心、以位置编码为序、以残差连接与层归一化为盾,用一套简洁而统一的原语回答了一个根本问题: 如果模型可以一次性“看见”整个序列中的所有位置,为什么还要一步步地“走过”它们?****
FunTester1 天前
人工智能·语言模型·常用插件·deepseek·harness
DeepSeek Harness 常用插件介绍DeepSeek Harness(简称 DSH)是 DeepSeek 官方开源的 AI Agent 运行时框架,核心理念是 “一切皆插件”(Everything is a Plugin)。
Dawson Zhu1 天前
人工智能·语言模型·架构·aigc
Agent自我纠错死循环:从原理剖析到工程化防御体系构建随着大模型Agent从Demo验证走向生产环境,“自我纠错死循环”(Soft Loop)已成为导致Token资源浪费与任务失败的核心故障之一。本文基于工程化实践,深入剖析盲点共享、目标无界、幻觉耦合三大底层成因,系统梳理语义停滞、状态机路径等四种检测手段,并提出包含预算熔断、异构裁判、检查点回溯在内的六级跳出策略。文章结合Loop Engineering与Agent Harness等前沿理念,旨在为开发者提供一套客观、可落地的Agent稳定性工程指南。
ZJU_统一阿萨姆1 天前
人工智能·语言模型
【算子开发】卷积算子基础实现与优化卷积神经网络(CNN)的计算核心是卷积算子。无论是图像分类、目标检测还是语义分割,卷积运算都占据了整个模型 90% 以上的计算量。在 ResNet-50 中,单张 224×224 图像的一次前向推理需要约 38 亿次乘加运算,其中卷积层贡献了绝大多数。如果不做任何优化,在单核 CPU 上执行这些运算需要数秒,而在现代 GPU 上则可以压缩到毫秒级。这种数量级的差异,正是源于卷积运算本身的结构特性与 GPU 并行架构的高度契合。
Moon上有月亮1 天前
人工智能·语言模型·自然语言处理·ollama
Ollama 完全指南:本地大语言模型的“开箱即用”方案从安装到部署,彻底搞懂 Ollama 的核心机制与实战应用一句话定义: Ollama 是一个本地大语言模型(LLM)部署与管理平台,让你可以在自己的电脑上轻松运行各种开源大模型,无需云服务、无需 API 密钥。
ZJU_统一阿萨姆2 天前
人工智能·算法·语言模型
【算子开发】Reduction算子完全指南在深入CUDA实现之前,我们必须先把问题本身嚼碎。归约(Reduction)不是某个特定算法,而是一类结构化折叠操作的统称——理解它的数学本质、输入输出契约以及串行参考实现,是后续所有并行化讨论的基石。本节将回答三个问题:归约到底在做什么?为什么可结合律决定了一切?以及CPU上最朴素的写法长什么样?
大模型任我行3 天前
人工智能·语言模型·自然语言处理·论文笔记
阿里:智能体原生视频表示学习📖标题:AVA-Encoder: Towards Agent-Native Video Representation Learning 🌐来源:arXiv, 2608.12313v1
老郑聊AI业财智造3 天前
人工智能·语言模型·架构·系统架构·软件工程
Qwen技术架构与源码深度剖析一句话概括:Qwen的技术演进不是参数规模的简单堆砌,而是一场从“稠密通用”到“稀疏专家协作”的系统工程革命——Qwen3.8-Max以2.4万亿总参数、仅950亿激活参数的MoE架构,用接近百亿级模型的推理成本撬动了万亿级模型的知识容量,在第三方盲测中综合能力仅次于Claude;Qwen3.6-35B-A3B则以35亿总参数、仅3亿激活参数的极致稀疏设计,让MoE大模型首次真正进入消费级硬件的射程——两者共同回答了同一个问题: 如何用最小的推理成本获得最强的模型能力?****
Claire_883 天前
语言模型·音视频·知识图谱
从视频字幕到知识图谱:基于大语言模型的自动思维导图生成工具调研技术关键词:自动语音识别(ASR)、大语言模型(LLM)、结构化输出、知识图谱构建、提示词工程我平时会通过B站、YouTube、极客时间等平台观看技术教程和行业分享。一个常见的情况是:花四十分钟看完一场架构演进的技术分享,当时觉得内容很清晰,但两天后想回顾其中的某个设计决策时,往往需要重新拖动进度条寻找——效率不太理想。
MartinYeung53 天前
网络·学习·语言模型
[论文学习]δ-STEAL:基于本地差分隐私的大语言模型窃取攻击本文提出了一种名为δ-STEAL的大语言模型(LLM)窃取攻击方法,通过在对窃取模型进行微调时向token嵌入注入满足本地差分隐私(LDP)保证的噪声,从而在绕过服务商水印检测器的同时保持攻击者模型的实用性。实验表明,该方法在轻量级修改下可实现高达96.95%的攻击成功率,对当前基于水印的LLM知识产权保护方案构成严重威胁。
澳鹏Appen4 天前
人工智能·gpt·ai·语言模型
AppenTalk | GPT-Red:AI 自动攻防,能替代人类红队吗?当 AI 系统开始自主浏览网页、读取邮件、调用工具,攻击面也在同步扩大。将恶意指令隐藏在网页、文件或工具中的提示注入(Prompt Injection)已成为大模型安全面临的最棘手挑战之一。
ZJU_统一阿萨姆3 天前
java·服务器·网络·人工智能·语言模型
【算子开发】全局内存访问与合并访存假设一段 CUDA 内核代码中,某个 warp 的 32 个线程各自对全局内存发起了一次 4 字节的读取。你可能会直觉地认为,硬件需要执行 32 次独立的内存访问。但事实远非如此——GPU 的内存子系统会在硬件层面合并这些请求,而理解这一机制的关键,在于「内存事务」(memory transaction)这一概念。