技术栈
语言模型
MartinYeung5
11 小时前
人工智能
·
学习
·
语言模型
[论文学习]BadRobot:物理世界中具身大语言模型智能体的越狱攻击
BadRobot 是首个针对物理世界中具身大语言模型(Embodied LLM)智能体的越狱攻击范式,首次系统地揭示了将 LLM 作为机器人“大脑”时所面临的全新安全威胁——攻击者仅通过语音交互,即可操纵机器人执行物理层面的危险行为。研究团队识别出三大安全漏洞,并在 Voxposer、Code as Policies、ProgPrompt 等主流具身 LLM 框架上通过大量实验验证了攻击的有效性。
晓天衡宇•评测社区
11 小时前
人工智能
·
语言模型
FSR-Bench 榜单更新:Qwen3.8-Max 开工具配置位列第 5,双配置均进入前十
随着大模型逐步具备联网搜索、代码执行等能力,科学推理评测所考查的对象也开始从单一模型扩展到模型与工具组成的完整系统。模型不仅要理解问题,还要判断何时检索资料、如何筛选证据,以及怎样将工具返回的信息转化为可靠结论。
tachibana2
13 小时前
数据库
·
人工智能
·
语言模型
·
自然语言处理
·
大模型
·
llm
大语言模型基础
从概率论与统计学视角来看,语言模型(Language Model, LM)的目标是建立一个计算自然语言序列概率分布的数学模型。
Allen_LVyingbo
13 小时前
运维
·
人工智能
·
机器学习
·
语言模型
·
自然语言处理
·
自动化
·
健康医疗
面向电子病历的批量语义分析自动化工具:从设计到实战(上)
Design and Implementation of a Batch Semantic Analysis Automation Tool for Electronic Medical Records — A Hands-on Blog
Zzj_tju
13 小时前
人工智能
·
pytorch
·
深度学习
·
语言模型
复现一个 Transformer Encoder:从论文公式到最小 PyTorch
系列:开源 AI 论文复现实验与代码解读 日期:2026-08-24 适合读者:研究生、科研新人、希望真正理解 Transformer 代码的工程读者 检索日期:2026-08-24
MartinYeung5
15 小时前
人工智能
·
学习
·
语言模型
[论文学习]Poser:通过操纵内部结构揭示对齐伪装的大语言模型
本文提出了一个名为 Poser 的基准测试框架,用于检测那些在评估时表现对齐、但在有利时机下会故意作恶的大语言模型(即“对齐伪装者”)。研究发现,向模型激活值注入噪声 是最有效的检测策略,能以 98% 的准确率 识别出对齐伪装模型,并且该策略还能用于进一步消除模型的伪装行为。
sel_9
1 天前
人工智能
·
深度学习
·
算法
·
机器学习
·
语言模型
【强化学习】Hands-on Modern RL项目实践|OPD 算法完整解析
关键词:On-Policy Distillation、OPD、Reverse KL、Mode-Seeking、GRPO、RLVR、Tinker、蒸馏
星辰AI
1 天前
人工智能
·
ai
·
语言模型
全栈项目代码质量治理复盘:ESLint+Prettier+Husky的渐进式引入策略
在一个15人的全栈团队中推行ESLint+Prettier+Husky时遇到的第一反应不是"太好了",而是:
howdoyoudo202606
1 天前
大数据
·
人工智能
·
安全
·
ai
·
语言模型
AI审计手记 #01(数据补全版):107小时、17,600次操作——OpenAI越狱案完整攻击链量化分析
AI审计手记 #01(数据补全版):107小时、17,600次操作——OpenAI越狱案完整攻击链量化分析
硅谷秋水
1 天前
人工智能
·
深度学习
·
安全
·
机器学习
·
语言模型
·
机器人
通过技能-驾驭进化实现自我演化的具身智能体
26年8月来自美国东北大学和微软研究院的论文“Self-Evolving Embodied Agents via Skill-Harness Evolution”。
大模型任我行
1 天前
人工智能
·
语言模型
·
自然语言处理
·
论文笔记
NUS:全模态感知驱动AI科学家
📖标题:OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 🌐来源:arXiv, 2608.13558v1
硅谷秋水
1 天前
人工智能
·
深度学习
·
安全
·
机器学习
·
语言模型
·
机器人
迈向具身智能体的驾驭
26年8月来自宁波东方理工大学的论文“Towards the Harness of Embodied Agents”。
sel_9
2 天前
人工智能
·
pytorch
·
深度学习
·
算法
·
语言模型
【Pytorch】PyTorch 深度学习框架详解:从安装到实战
本文系统梳理 PyTorch 的核心概念与常用 API,涵盖安装配置、张量操作、自动求导、神经网络搭建、数据加载、训练循环、模型保存与加载、GPU 加速、常用技巧等内容,配合可运行代码示例讲解,适合有 Python 基础、希望系统入门深度学习实战的开发者阅读。
ZJU_统一阿萨姆
2 天前
人工智能
·
算法
·
语言模型
·
硬件架构
【算子开发】算子融合与Softmax_LayerNorm实现
在讨论 Softmax 与 LayerNorm 的具体实现之前,有必要先回答一个更根本的问题:为什么不直接按数学公式逐行实现,而要引入"融合"(fusion)这一层设计? 答案藏在一个简单的观察里:深度学习算子的计算强度(compute intensity)正在逐年下降,而模型中对内存带宽的渴望从未降低。换句话说,瓶颈早已不是算力,而是数据搬运。
Dawson Zhu
2 天前
人工智能
·
语言模型
·
重构
·
架构
·
aigc
图结构(Graph)如何重构智能体认知?从DAG规划到GraphRAG的技术拆解
当前LLM Agent在处理复杂现实任务时,常受限于非结构化数据的"语义迷雾"与上下文窗口的"记忆瓶颈"。本文基于前沿技术视角,深度解析图结构(Graph Structure)如何作为下一代AI的认知脚手架,从DAG任务规划、工具链执行约束、GraphRAG动态记忆三个维度,探讨图神经网络与符号推理融合的技术路径及其工程化挑战。
大模型任我行
5 天前
人工智能
·
语言模型
·
自然语言处理
·
论文笔记
NUS:冻结语义表征构建视频生成潜空间
📖标题:V-RAE: Rethinking Video Latent Spaces for Generation 🌐来源:arXiv, 2608.13556v1
老郑聊AI业财智造
2 天前
人工智能
·
python
·
深度学习
·
语言模型
·
架构
·
transformer
·
软件工程
Transformer 技术架构与源码分析
一句话概括:Transformer 不是神经网络架构的版本号递进,而是一场彻底的“范式革命”——以纯注意力机制彻底取代了统治序列建模数十年的 RNN 和 CNN,将序列建模从“顺序计算”的桎梏中解放出来,让并行训练成为可能;它以“编码器-解码器”为骨架、以多头自注意力为核心、以位置编码为序、以残差连接与层归一化为盾,用一套简洁而统一的原语回答了一个根本问题: 如果模型可以一次性“看见”整个序列中的所有位置,为什么还要一步步地“走过”它们?****
FunTester
2 天前
人工智能
·
语言模型
·
常用插件
·
deepseek
·
harness
DeepSeek Harness 常用插件介绍
DeepSeek Harness(简称 DSH)是 DeepSeek 官方开源的 AI Agent 运行时框架,核心理念是 “一切皆插件”(Everything is a Plugin)。
Dawson Zhu
2 天前
人工智能
·
语言模型
·
架构
·
aigc
Agent自我纠错死循环:从原理剖析到工程化防御体系构建
随着大模型Agent从Demo验证走向生产环境,“自我纠错死循环”(Soft Loop)已成为导致Token资源浪费与任务失败的核心故障之一。本文基于工程化实践,深入剖析盲点共享、目标无界、幻觉耦合三大底层成因,系统梳理语义停滞、状态机路径等四种检测手段,并提出包含预算熔断、异构裁判、检查点回溯在内的六级跳出策略。文章结合Loop Engineering与Agent Harness等前沿理念,旨在为开发者提供一套客观、可落地的Agent稳定性工程指南。
ZJU_统一阿萨姆
2 天前
人工智能
·
语言模型
【算子开发】卷积算子基础实现与优化
卷积神经网络(CNN)的计算核心是卷积算子。无论是图像分类、目标检测还是语义分割,卷积运算都占据了整个模型 90% 以上的计算量。在 ResNet-50 中,单张 224×224 图像的一次前向推理需要约 38 亿次乘加运算,其中卷积层贡献了绝大多数。如果不做任何优化,在单核 CPU 上执行这些运算需要数秒,而在现代 GPU 上则可以压缩到毫秒级。这种数量级的差异,正是源于卷积运算本身的结构特性与 GPU 并行架构的高度契合。