语言模型

sel_911 小时前
人工智能·深度学习·算法·语言模型·自然语言处理
【多轮对话论文导读(二)】多轮对话与LLM Agent论文阅读:长期记忆、多轮评估与Agent训练最近多轮对话研究的一个明显趋势是:研究重点正在从“单轮回答质量”转向长期交互过程中的状态跟踪、用户意图理解、澄清决策、记忆和Agent训练。
硅谷秋水16 小时前
人工智能·深度学习·计算机视觉·语言模型·机器人·音视频
ImageWAM:世界-动作模型真的需要视频生成,还是只需要图像编辑?26年6月来自上海交大、东方理工、腾讯、清华和中关村学院的论文“ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?”。
MartinYeung519 小时前
人工智能·学习·语言模型
[论文学习]PoisonBench:评估语言模型对投毒偏好数据的脆弱性PoisonBench是首个系统性评估大语言模型在偏好学习阶段面对数据投毒攻击脆弱性的标准化基准。研究在22个广泛使用的模型上部署了两种攻击类型(内容注入与对齐退化),覆盖8个现实场景,揭示了三个关键发现:参数规模扩大并不天然增强抗投毒能力;投毒比例与攻击效果呈对数线性关系;投毒效应可泛化至训练中未见的触发词。该工作已被ICML 2025接收。
MartinYeung52 天前
人工智能·学习·语言模型
[论文学习]BadRobot:物理世界中具身大语言模型智能体的越狱攻击BadRobot 是首个针对物理世界中具身大语言模型(Embodied LLM)智能体的越狱攻击范式,首次系统地揭示了将 LLM 作为机器人“大脑”时所面临的全新安全威胁——攻击者仅通过语音交互,即可操纵机器人执行物理层面的危险行为。研究团队识别出三大安全漏洞,并在 Voxposer、Code as Policies、ProgPrompt 等主流具身 LLM 框架上通过大量实验验证了攻击的有效性。
晓天衡宇•评测社区2 天前
人工智能·语言模型
FSR-Bench 榜单更新:Qwen3.8-Max 开工具配置位列第 5,双配置均进入前十随着大模型逐步具备联网搜索、代码执行等能力,科学推理评测所考查的对象也开始从单一模型扩展到模型与工具组成的完整系统。模型不仅要理解问题,还要判断何时检索资料、如何筛选证据,以及怎样将工具返回的信息转化为可靠结论。
tachibana22 天前
数据库·人工智能·语言模型·自然语言处理·大模型·llm
大语言模型基础从概率论与统计学视角来看,语言模型(Language Model, LM)的目标是建立一个计算自然语言序列概率分布的数学模型。
Allen_LVyingbo2 天前
运维·人工智能·机器学习·语言模型·自然语言处理·自动化·健康医疗
面向电子病历的批量语义分析自动化工具:从设计到实战(上)Design and Implementation of a Batch Semantic Analysis Automation Tool for Electronic Medical Records — A Hands-on Blog
Zzj_tju2 天前
人工智能·pytorch·深度学习·语言模型
复现一个 Transformer Encoder:从论文公式到最小 PyTorch系列:开源 AI 论文复现实验与代码解读 日期:2026-08-24 适合读者:研究生、科研新人、希望真正理解 Transformer 代码的工程读者 检索日期:2026-08-24
MartinYeung52 天前
人工智能·学习·语言模型
[论文学习]Poser:通过操纵内部结构揭示对齐伪装的大语言模型本文提出了一个名为 Poser 的基准测试框架,用于检测那些在评估时表现对齐、但在有利时机下会故意作恶的大语言模型(即“对齐伪装者”)。研究发现,向模型激活值注入噪声 是最有效的检测策略,能以 98% 的准确率 识别出对齐伪装模型,并且该策略还能用于进一步消除模型的伪装行为。
sel_92 天前
人工智能·深度学习·算法·机器学习·语言模型
【强化学习】Hands-on Modern RL项目实践|OPD 算法完整解析关键词:On-Policy Distillation、OPD、Reverse KL、Mode-Seeking、GRPO、RLVR、Tinker、蒸馏
星辰AI2 天前
人工智能·ai·语言模型
全栈项目代码质量治理复盘:ESLint+Prettier+Husky的渐进式引入策略在一个15人的全栈团队中推行ESLint+Prettier+Husky时遇到的第一反应不是"太好了",而是:
howdoyoudo2026062 天前
大数据·人工智能·安全·ai·语言模型
AI审计手记 #01(数据补全版):107小时、17,600次操作——OpenAI越狱案完整攻击链量化分析AI审计手记 #01(数据补全版):107小时、17,600次操作——OpenAI越狱案完整攻击链量化分析
硅谷秋水2 天前
人工智能·深度学习·安全·机器学习·语言模型·机器人
通过技能-驾驭进化实现自我演化的具身智能体26年8月来自美国东北大学和微软研究院的论文“Self-Evolving Embodied Agents via Skill-Harness Evolution”。
大模型任我行3 天前
人工智能·语言模型·自然语言处理·论文笔记
NUS:全模态感知驱动AI科学家📖标题:OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 🌐来源:arXiv, 2608.13558v1
硅谷秋水3 天前
人工智能·深度学习·安全·机器学习·语言模型·机器人
迈向具身智能体的驾驭26年8月来自宁波东方理工大学的论文“Towards the Harness of Embodied Agents”。
sel_93 天前
人工智能·pytorch·深度学习·算法·语言模型
【Pytorch】PyTorch 深度学习框架详解:从安装到实战本文系统梳理 PyTorch 的核心概念与常用 API,涵盖安装配置、张量操作、自动求导、神经网络搭建、数据加载、训练循环、模型保存与加载、GPU 加速、常用技巧等内容,配合可运行代码示例讲解,适合有 Python 基础、希望系统入门深度学习实战的开发者阅读。
ZJU_统一阿萨姆3 天前
人工智能·算法·语言模型·硬件架构
【算子开发】算子融合与Softmax_LayerNorm实现在讨论 Softmax 与 LayerNorm 的具体实现之前,有必要先回答一个更根本的问题:为什么不直接按数学公式逐行实现,而要引入"融合"(fusion)这一层设计? 答案藏在一个简单的观察里:深度学习算子的计算强度(compute intensity)正在逐年下降,而模型中对内存带宽的渴望从未降低。换句话说,瓶颈早已不是算力,而是数据搬运。
Dawson Zhu3 天前
人工智能·语言模型·重构·架构·aigc
图结构(Graph)如何重构智能体认知?从DAG规划到GraphRAG的技术拆解当前LLM Agent在处理复杂现实任务时,常受限于非结构化数据的"语义迷雾"与上下文窗口的"记忆瓶颈"。本文基于前沿技术视角,深度解析图结构(Graph Structure)如何作为下一代AI的认知脚手架,从DAG任务规划、工具链执行约束、GraphRAG动态记忆三个维度,探讨图神经网络与符号推理融合的技术路径及其工程化挑战。
大模型任我行6 天前
人工智能·语言模型·自然语言处理·论文笔记
NUS:冻结语义表征构建视频生成潜空间📖标题:V-RAE: Rethinking Video Latent Spaces for Generation 🌐来源:arXiv, 2608.13556v1
老郑聊AI业财智造3 天前
人工智能·python·深度学习·语言模型·架构·transformer·软件工程
Transformer 技术架构与源码分析一句话概括:Transformer 不是神经网络架构的版本号递进,而是一场彻底的“范式革命”——以纯注意力机制彻底取代了统治序列建模数十年的 RNN 和 CNN,将序列建模从“顺序计算”的桎梏中解放出来,让并行训练成为可能;它以“编码器-解码器”为骨架、以多头自注意力为核心、以位置编码为序、以残差连接与层归一化为盾,用一套简洁而统一的原语回答了一个根本问题: 如果模型可以一次性“看见”整个序列中的所有位置,为什么还要一步步地“走过”它们?****