语言模型

Allen_LVyingbo10 分钟前
运维·人工智能·机器学习·语言模型·自然语言处理·自动化·健康医疗
面向电子病历的批量语义分析自动化工具:从设计到实战(上)Design and Implementation of a Batch Semantic Analysis Automation Tool for Electronic Medical Records — A Hands-on Blog
Zzj_tju27 分钟前
人工智能·pytorch·深度学习·语言模型
复现一个 Transformer Encoder:从论文公式到最小 PyTorch系列:开源 AI 论文复现实验与代码解读 日期:2026-08-24 适合读者:研究生、科研新人、希望真正理解 Transformer 代码的工程读者 检索日期:2026-08-24
MartinYeung52 小时前
人工智能·学习·语言模型
[论文学习]Poser:通过操纵内部结构揭示对齐伪装的大语言模型本文提出了一个名为 Poser 的基准测试框架,用于检测那些在评估时表现对齐、但在有利时机下会故意作恶的大语言模型(即“对齐伪装者”)。研究发现,向模型激活值注入噪声 是最有效的检测策略,能以 98% 的准确率 识别出对齐伪装模型,并且该策略还能用于进一步消除模型的伪装行为。
sel_911 小时前
人工智能·深度学习·算法·机器学习·语言模型
【强化学习】Hands-on Modern RL项目实践|OPD 算法完整解析关键词:On-Policy Distillation、OPD、Reverse KL、Mode-Seeking、GRPO、RLVR、Tinker、蒸馏
星辰AI14 小时前
人工智能·ai·语言模型
全栈项目代码质量治理复盘:ESLint+Prettier+Husky的渐进式引入策略在一个15人的全栈团队中推行ESLint+Prettier+Husky时遇到的第一反应不是"太好了",而是:
howdoyoudo20260616 小时前
大数据·人工智能·安全·ai·语言模型
AI审计手记 #01(数据补全版):107小时、17,600次操作——OpenAI越狱案完整攻击链量化分析AI审计手记 #01(数据补全版):107小时、17,600次操作——OpenAI越狱案完整攻击链量化分析
硅谷秋水17 小时前
人工智能·深度学习·安全·机器学习·语言模型·机器人
通过技能-驾驭进化实现自我演化的具身智能体26年8月来自美国东北大学和微软研究院的论文“Self-Evolving Embodied Agents via Skill-Harness Evolution”。
大模型任我行1 天前
人工智能·语言模型·自然语言处理·论文笔记
NUS:全模态感知驱动AI科学家📖标题:OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 🌐来源:arXiv, 2608.13558v1
硅谷秋水1 天前
人工智能·深度学习·安全·机器学习·语言模型·机器人
迈向具身智能体的驾驭26年8月来自宁波东方理工大学的论文“Towards the Harness of Embodied Agents”。
sel_91 天前
人工智能·pytorch·深度学习·算法·语言模型
【Pytorch】PyTorch 深度学习框架详解:从安装到实战本文系统梳理 PyTorch 的核心概念与常用 API,涵盖安装配置、张量操作、自动求导、神经网络搭建、数据加载、训练循环、模型保存与加载、GPU 加速、常用技巧等内容,配合可运行代码示例讲解,适合有 Python 基础、希望系统入门深度学习实战的开发者阅读。
ZJU_统一阿萨姆1 天前
人工智能·算法·语言模型·硬件架构
【算子开发】算子融合与Softmax_LayerNorm实现在讨论 Softmax 与 LayerNorm 的具体实现之前,有必要先回答一个更根本的问题:为什么不直接按数学公式逐行实现,而要引入"融合"(fusion)这一层设计? 答案藏在一个简单的观察里:深度学习算子的计算强度(compute intensity)正在逐年下降,而模型中对内存带宽的渴望从未降低。换句话说,瓶颈早已不是算力,而是数据搬运。
Dawson Zhu2 天前
人工智能·语言模型·重构·架构·aigc
图结构(Graph)如何重构智能体认知?从DAG规划到GraphRAG的技术拆解当前LLM Agent在处理复杂现实任务时,常受限于非结构化数据的"语义迷雾"与上下文窗口的"记忆瓶颈"。本文基于前沿技术视角,深度解析图结构(Graph Structure)如何作为下一代AI的认知脚手架,从DAG任务规划、工具链执行约束、GraphRAG动态记忆三个维度,探讨图神经网络与符号推理融合的技术路径及其工程化挑战。
大模型任我行4 天前
人工智能·语言模型·自然语言处理·论文笔记
NUS:冻结语义表征构建视频生成潜空间📖标题:V-RAE: Rethinking Video Latent Spaces for Generation 🌐来源:arXiv, 2608.13556v1
老郑聊AI业财智造2 天前
人工智能·python·深度学习·语言模型·架构·transformer·软件工程
Transformer 技术架构与源码分析一句话概括:Transformer 不是神经网络架构的版本号递进,而是一场彻底的“范式革命”——以纯注意力机制彻底取代了统治序列建模数十年的 RNN 和 CNN,将序列建模从“顺序计算”的桎梏中解放出来,让并行训练成为可能;它以“编码器-解码器”为骨架、以多头自注意力为核心、以位置编码为序、以残差连接与层归一化为盾,用一套简洁而统一的原语回答了一个根本问题: 如果模型可以一次性“看见”整个序列中的所有位置,为什么还要一步步地“走过”它们?****
FunTester2 天前
人工智能·语言模型·常用插件·deepseek·harness
DeepSeek Harness 常用插件介绍DeepSeek Harness(简称 DSH)是 DeepSeek 官方开源的 AI Agent 运行时框架,核心理念是 “一切皆插件”(Everything is a Plugin)。
Dawson Zhu2 天前
人工智能·语言模型·架构·aigc
Agent自我纠错死循环:从原理剖析到工程化防御体系构建随着大模型Agent从Demo验证走向生产环境,“自我纠错死循环”(Soft Loop)已成为导致Token资源浪费与任务失败的核心故障之一。本文基于工程化实践,深入剖析盲点共享、目标无界、幻觉耦合三大底层成因,系统梳理语义停滞、状态机路径等四种检测手段,并提出包含预算熔断、异构裁判、检查点回溯在内的六级跳出策略。文章结合Loop Engineering与Agent Harness等前沿理念,旨在为开发者提供一套客观、可落地的Agent稳定性工程指南。
ZJU_统一阿萨姆2 天前
人工智能·语言模型
【算子开发】卷积算子基础实现与优化卷积神经网络(CNN)的计算核心是卷积算子。无论是图像分类、目标检测还是语义分割,卷积运算都占据了整个模型 90% 以上的计算量。在 ResNet-50 中,单张 224×224 图像的一次前向推理需要约 38 亿次乘加运算,其中卷积层贡献了绝大多数。如果不做任何优化,在单核 CPU 上执行这些运算需要数秒,而在现代 GPU 上则可以压缩到毫秒级。这种数量级的差异,正是源于卷积运算本身的结构特性与 GPU 并行架构的高度契合。
Moon上有月亮2 天前
人工智能·语言模型·自然语言处理·ollama
Ollama 完全指南:本地大语言模型的“开箱即用”方案从安装到部署,彻底搞懂 Ollama 的核心机制与实战应用一句话定义: Ollama 是一个本地大语言模型(LLM)部署与管理平台,让你可以在自己的电脑上轻松运行各种开源大模型,无需云服务、无需 API 密钥。
ZJU_统一阿萨姆3 天前
人工智能·算法·语言模型
【算子开发】Reduction算子完全指南在深入CUDA实现之前,我们必须先把问题本身嚼碎。归约(Reduction)不是某个特定算法,而是一类结构化折叠操作的统称——理解它的数学本质、输入输出契约以及串行参考实现,是后续所有并行化讨论的基石。本节将回答三个问题:归约到底在做什么?为什么可结合律决定了一切?以及CPU上最朴素的写法长什么样?
大模型任我行4 天前
人工智能·语言模型·自然语言处理·论文笔记
阿里:智能体原生视频表示学习📖标题:AVA-Encoder: Towards Agent-Native Video Representation Learning 🌐来源:arXiv, 2608.12313v1