语言模型

Dawson Zhu8 小时前
人工智能·语言模型·aigc·agi
从串行到树搜索:LATS 如何用蒙特卡洛树搜索重构 LLM Agent 决策框架大型语言模型(LLM)驱动的智能体(Agent)近年来取得了显著进展,其中 ReAct 范式(Reasoning + Acting)因其简洁有效的"思考-行动-观察"循环成为主流。然而,ReAct 本质上是串行决策链:每一步都严格依赖前一步的输出,一旦早期出现错误(如选错参数、误解指令),整个轨迹便无法挽回,导致任务失败。
Together_CZ1 天前
语言模型·llm·transformer·scaling laws·parcae·用于稳定循环语言模型的扩展定律·stable looped
Parcae: Scaling Laws For Stable Looped Language Models——用于稳定循环语言模型的扩展定律论文由加州大学圣迭戈分校和Together AI的研究者共同完成,聚焦于如何稳定地训练循环(Looped)架构的大语言模型,并将其发展为一种独立于模型参数和数据量的、可预测的扩展计算规模的新维度。核心贡献是提出了新型循环架构 Parcae,通过动态系统理论和工程化改进,解决了该类模型长期存在的训练不稳定问题,并首次系统性地推导了其在训练和推理阶段的扩展定律。
问天_观心9 小时前
人工智能·windows·python·神经网络·语言模型·github·模型蒸馏
零基础在windows环境下的WSL使用llamafactory(一)模型微调的大致流程:微调训练、推理验证、模型导出、模型部署目录llamafactory三种搭建方式python环境的搭建
MartinYeung511 小时前
学习·安全·语言模型
[论文学习]Latent Fusion Jailbreak: 融合有害与无害表征以诱导大语言模型产生不安全输出本文提出了一种名为潜在融合越狱(Latent Fusion Jailbreak, LFJ) 的新型白盒攻击方法,通过将有害查询与结构相似的无害查询配对,在选定的Transformer层和token位置上对二者的隐藏状态进行插值融合,从而绕过LLM的安全对齐机制。实验表明,该攻击在五个开源模型和四个安全基准上达到了94.13%的平均攻击成功率(ASR) ,同时作者还设计了一种针对性的潜在对抗训练防御方法,可将ASR降至12.37%。
江畔柳前堤12 小时前
大数据·人工智能·分布式·目标检测·机器学习·语言模型·架构
AgentScope 设计与原理全解:从消息原语到分布式智能体工程底座最后更新:2026年8月17日 | 基于 AgentScope 2.0(Python/TS)及 AgentScope Java 2.0 GA 版本撰写
ZJU_统一阿萨姆13 小时前
开发语言·人工智能·语言模型·系统架构·vllm
【推理优化进阶】性能实验科学:工作负载、统计显著性与尾延迟归因注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。先导课中,我们通过固定延迟、固定 QPS 的压测拿到了基线吞吐数字。但把这份报告带到生产环境评审时,几乎必然会被挑战:真实流量不会像基准测试那样方方正正如矩阵——每一行等长,每个请求同质。生产流量有到达的节奏、有输入输出的联合形态、有不同租户的叠加,这些维度共同决定了实验结论是否可迁移。
ZJU_统一阿萨姆14 小时前
开发语言·人工智能·语言模型·架构·开源
【推理优化进阶】Hopper_Blackwell 微架构:从指令、流水线到真实性能上限注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。把 GPU 看作一群并行执行的 SM,是最常见的抽象;但要解释"为什么 Tensor Core 没吃满",必须进入单个 SM 的内部,理解 warp scheduler、寄存器文件与 shared memory 如何在每个时钟周期内争夺资源并最终决定占用率(occupancy)。
lucky_syq1 天前
人工智能·语言模型·架构·transformer
第3篇 · S1·上:什么是大语言模型 + Transformer 架构深讲这一篇剥掉大模型的神秘外衣:LLM 的概率本质、能力与边界,以及 Decoder-only Transformer 的完整架构与注意力推导。它是整个学习篇(S1-S10)的地基,后续训练(第 6-7 篇)、微调(第 8-9 篇)、推理优化(第 10-11 篇)都踩在这块地基上。 学完你应该能看懂任何主流 LLM 的架构图,把注意力计算对应到自己熟悉的分布式/数据概念上,面试能默写注意力公式并讲清 √d_k。 每节按 原理 -> 关键推导 -> 前端/后端/大数据映射 -> 实操要点 -> 误区 走。遇到公
皮皮蟹虾饺1 天前
linux·人工智能·ubuntu·语言模型·kubernetes
NCCL 源码解析:通信器从出生到消亡的完整一生📌 本文亮点:帮你建立对 NCCL 的全局认知坐标系,并讲透 ncclComm_t 通信器从出生到消亡的完整一生。
墨心@1 天前
人工智能·语言模型·大语言模型·agent·codex·harness
阶段 4:事件总线对应代码:stage04_events.py理解"事件既是给消费者的消息,也是驱动派生状态的输入",并实现 terminal_error 的单写多读模式。
还不秃顶的计科生1 天前
人工智能·深度学习·算法·机器学习·语言模型·vla·vlm
具身智能论文学习10:π0: A Vision-Language-Action Flow Model for General Robot Control如何在保留预训练 VLM 强大视觉语言知识的同时,直接生成高频、连续、精细的机器人 Action Chunk,从而实现通用且灵巧的机器人控制?
Zzj_tju2 天前
人工智能·语言模型
Evaluation 论文精读路线:Open-ended Eval、Human Eval、LLM-as-Judge 和 Contamination系列:AI 论文精读与复现训练营 日期:2026-08-14 适合读者:研究生、LLM evaluation 入门研究者、有工程背景的 AI 读者 检索日期:2026-08-14
还不秃顶的计科生2 天前
人工智能·深度学习·学习·机器学习·语言模型·vla·vlm
具身智能论文学习8:Octo: An Open-Source Generalist Robot PolicyOpen X-Embodiment→多机器人、大规模数据Diffusion Policy→连续动作序列与扩散动作生成
Dawson Zhu2 天前
人工智能·语言模型·架构·制造·agi
为什么智能体 Agent 需要本体 Ontology在构建基于大语言模型(LLM)的智能体(Agent)系统时,一个核心矛盾始终存在:LLM 的概率生成特性带来了强大的创造力,同时也引入了不可预测的"幻觉"和行为。当智能体获得自主执行动作的能力后,这种不确定性将直接转化为生产环境中的风险——错误退款、状态不一致、资源无限消耗等。
MartinYeung54 天前
人工智能·学习·语言模型
[论文学习]Prεεmpt:大语言模型敏感提示词清洗系统本文提出了一种名为 Prεεmpt 的提示词清洗系统,用于在用户将提示词提交给不可信的大语言模型(LLM)API之前,对其中包含的敏感信息进行形式化的隐私保护。该系统将敏感词元分为两类——格式依赖型(如SSN、信用卡号)采用格式保持加密(FPE),数值依赖型(如年龄、薪资)采用度量本地差分隐私(mLDP)——在提供严格隐私保证的同时保持高响应质量,并在翻译、RAG、长文本问答和多轮金融问答等任务中验证了其实用性。
Dawson Zhu2 天前
人工智能·语言模型·架构·制造
面向AI自动化分析的数据仓库建模实践随着大语言模型(LLM)在企业数据分析场景中的应用,越来越多的团队尝试让AI自动完成SQL生成、指标计算和趋势分析。然而在实际落地过程中,许多团队发现即使使用了强大的模型,AI生成的查询仍然频繁出错:选错表、误解字段含义、计算出错误指标。
MartinYeung53 天前
人工智能·学习·语言模型
[论文学习]JBShield:通过激活概念分析与操纵防御大语言模型越狱攻击本文基于线性表征假说(Linear Representation Hypothesis, LRH),系统揭示了大语言模型越狱攻击的内在机制,并提出了一套名为JBShield的防御框架。该框架通过识别输入提示中是否同时激活了“有毒概念”和“越狱概念”来检测越狱攻击,并通过增强有毒概念、削弱越狱概念来操纵模型的隐藏表征,从而实现安全输出。实验表明,JBShield在五个开源LLM上对九种越狱攻击的平均检测F1-Score达到0.94,将平均攻击成功率从61%降至2%。
ZJU_统一阿萨姆3 天前
人工智能·语言模型·系统架构·vllm
【推理优化】KV Cache 量化:在不牺牲质量的前提下压榨更多内存在讨论权重量化时,我们通常会先收集一批校准数据,统计出每层权重张量的数值分布,然后基于这些静态统计数据确定缩放因子和零点。这个过程可以在模型部署前离线完成,一次校准、处处使用。但当我们把目光转向 KV Cache 时,这套成熟的方法论立刻失效了——因为 KV Cache 的数值分布从本质上就不是静态的。
程序猿编码3 天前
pytorch·语言模型·大模型·c++20·推荐算法
不用GPU,不用多线程,我用C++20手写了一个Gemma 3推理引擎现在跑大模型,大家的默认思路是:上GPU、开多线程、调各种推理框架。但有时候你只是想在自己的笔记本上快速试个东西,或者你的场景根本不允许用GPU(比如嵌入式设备、边缘计算节点)。这时候,CPU单线程推理就成了唯一选择。
云和数据.ChenGuang3 天前
人工智能·深度学习·机器学习·语言模型·状态模式·fastapi
fastapi的参数剖析先记住核心结论:假设模型前端请求体:{"title": null}只过滤请求里没有提交的字段输出结果: