语言模型

树码小子12 小时前
人工智能·语言模型·mvc
什么是大语言模型大语言模型(Large Language Model,LLM)是指基于大规模神经网络,通过自监督或半监督方式,对海量文本进行训练、能理解和生成人类语言的语言模型**。
问天_观心5 小时前
人工智能·神经网络·语言模型·github·模型蒸馏
零基础在windows环境下的WSL使用llamafactory(二)微调模型 (Fine-tuned Model / Instruct Model)在预训练基础上进一步适配下游任务(如医疗问答、代码生成等)
专注仿真7 小时前
人工智能·python·算法·语言模型·问答大模型关键算法·熵权融合算法·交叉编码器重排算法
问答大模型技术方案算法实现-熵权法融合算法 + 交叉编码器重排算法算法核心特点 熵权法权重计算:动态计算向量检索和关键词检索的权重,避免固定权重的主观性交叉编码器重排:使用预训练的交叉编码器模型进行精排,提高相关性判断准确性
阿维的博客日记9 小时前
人工智能·语言模型·自然语言处理
什么是unigram语言模型Unigram 语言模型(一元文法模型)是自然语言处理(NLP)中最简单、最基础的统计语言模型(N-gramN\text{-gram}N-gram 模型中 N=1N=1N=1 的特例)。
ZJU_统一阿萨姆10 小时前
开发语言·人工智能·语言模型·系统架构·vllm
【推理优化进阶】调度器的数学内核:排队论、SLO 与在线决策注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。经典排队论的服务台假设是:顾客到达后立即被服务,服务时间彼此独立且与系统状态无关。LLM Serving 的场景——请求按序列生成 token,一个 batch 中的多个请求共享 GPU 计算资源,输出长度在到达时完全未知——恰好系统性破坏这三个假设。因此,这节的任务不是照搬教科书公式,而是建立一套可推导、可测量、能预测拐点的近似模型,让后续的 admission、batching、preemption 决策有统一的数学
ZJU_统一阿萨姆10 小时前
开发语言·人工智能·语言模型·架构·开源
【推理优化进阶】图编译与运行时:动态形状、CUDA Graph 与内存规划注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。当你在 PyTorch 中写下 model(x) 时,Dynamo——PyTorch 的编译框架——拦截到的并不是一套算子调用的流水账,而是一个可以程序化重组的计算图。理解这条从捕获到生成的路径,关键不在于记住每一步的 API 名称,而在于看清每一层 IR 究竟在优化什么——以及它为此舍弃了什么。
Dawson Zhu1 天前
人工智能·语言模型·aigc·agi
从串行到树搜索:LATS 如何用蒙特卡洛树搜索重构 LLM Agent 决策框架大型语言模型(LLM)驱动的智能体(Agent)近年来取得了显著进展,其中 ReAct 范式(Reasoning + Acting)因其简洁有效的"思考-行动-观察"循环成为主流。然而,ReAct 本质上是串行决策链:每一步都严格依赖前一步的输出,一旦早期出现错误(如选错参数、误解指令),整个轨迹便无法挽回,导致任务失败。
Together_CZ2 天前
语言模型·llm·transformer·scaling laws·parcae·用于稳定循环语言模型的扩展定律·stable looped
Parcae: Scaling Laws For Stable Looped Language Models——用于稳定循环语言模型的扩展定律论文由加州大学圣迭戈分校和Together AI的研究者共同完成,聚焦于如何稳定地训练循环(Looped)架构的大语言模型,并将其发展为一种独立于模型参数和数据量的、可预测的扩展计算规模的新维度。核心贡献是提出了新型循环架构 Parcae,通过动态系统理论和工程化改进,解决了该类模型长期存在的训练不稳定问题,并首次系统性地推导了其在训练和推理阶段的扩展定律。
问天_观心1 天前
人工智能·windows·python·神经网络·语言模型·github·模型蒸馏
零基础在windows环境下的WSL使用llamafactory(一)模型微调的大致流程:微调训练、推理验证、模型导出、模型部署目录llamafactory三种搭建方式python环境的搭建
MartinYeung52 天前
学习·安全·语言模型
[论文学习]Latent Fusion Jailbreak: 融合有害与无害表征以诱导大语言模型产生不安全输出本文提出了一种名为潜在融合越狱(Latent Fusion Jailbreak, LFJ) 的新型白盒攻击方法,通过将有害查询与结构相似的无害查询配对,在选定的Transformer层和token位置上对二者的隐藏状态进行插值融合,从而绕过LLM的安全对齐机制。实验表明,该攻击在五个开源模型和四个安全基准上达到了94.13%的平均攻击成功率(ASR) ,同时作者还设计了一种针对性的潜在对抗训练防御方法,可将ASR降至12.37%。
江畔柳前堤2 天前
大数据·人工智能·分布式·目标检测·机器学习·语言模型·架构
AgentScope 设计与原理全解:从消息原语到分布式智能体工程底座最后更新:2026年8月17日 | 基于 AgentScope 2.0(Python/TS)及 AgentScope Java 2.0 GA 版本撰写
ZJU_统一阿萨姆2 天前
开发语言·人工智能·语言模型·系统架构·vllm
【推理优化进阶】性能实验科学:工作负载、统计显著性与尾延迟归因注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。先导课中,我们通过固定延迟、固定 QPS 的压测拿到了基线吞吐数字。但把这份报告带到生产环境评审时,几乎必然会被挑战:真实流量不会像基准测试那样方方正正如矩阵——每一行等长,每个请求同质。生产流量有到达的节奏、有输入输出的联合形态、有不同租户的叠加,这些维度共同决定了实验结论是否可迁移。
ZJU_统一阿萨姆2 天前
开发语言·人工智能·语言模型·架构·开源
【推理优化进阶】Hopper_Blackwell 微架构:从指令、流水线到真实性能上限注:建议在开始学习本专栏前先完成对 推理优化工程师快速入门指南 专栏中所有内容的学习。把 GPU 看作一群并行执行的 SM,是最常见的抽象;但要解释"为什么 Tensor Core 没吃满",必须进入单个 SM 的内部,理解 warp scheduler、寄存器文件与 shared memory 如何在每个时钟周期内争夺资源并最终决定占用率(occupancy)。
lucky_syq2 天前
人工智能·语言模型·架构·transformer
第3篇 · S1·上:什么是大语言模型 + Transformer 架构深讲这一篇剥掉大模型的神秘外衣:LLM 的概率本质、能力与边界,以及 Decoder-only Transformer 的完整架构与注意力推导。它是整个学习篇(S1-S10)的地基,后续训练(第 6-7 篇)、微调(第 8-9 篇)、推理优化(第 10-11 篇)都踩在这块地基上。 学完你应该能看懂任何主流 LLM 的架构图,把注意力计算对应到自己熟悉的分布式/数据概念上,面试能默写注意力公式并讲清 √d_k。 每节按 原理 -> 关键推导 -> 前端/后端/大数据映射 -> 实操要点 -> 误区 走。遇到公
皮皮蟹虾饺2 天前
linux·人工智能·ubuntu·语言模型·kubernetes
NCCL 源码解析:通信器从出生到消亡的完整一生📌 本文亮点:帮你建立对 NCCL 的全局认知坐标系,并讲透 ncclComm_t 通信器从出生到消亡的完整一生。
墨心@3 天前
人工智能·语言模型·大语言模型·agent·codex·harness
阶段 4:事件总线对应代码:stage04_events.py理解"事件既是给消费者的消息,也是驱动派生状态的输入",并实现 terminal_error 的单写多读模式。
还不秃顶的计科生3 天前
人工智能·深度学习·算法·机器学习·语言模型·vla·vlm
具身智能论文学习10:π0: A Vision-Language-Action Flow Model for General Robot Control如何在保留预训练 VLM 强大视觉语言知识的同时,直接生成高频、连续、精细的机器人 Action Chunk,从而实现通用且灵巧的机器人控制?
Zzj_tju3 天前
人工智能·语言模型
Evaluation 论文精读路线:Open-ended Eval、Human Eval、LLM-as-Judge 和 Contamination系列:AI 论文精读与复现训练营 日期:2026-08-14 适合读者:研究生、LLM evaluation 入门研究者、有工程背景的 AI 读者 检索日期:2026-08-14
还不秃顶的计科生3 天前
人工智能·深度学习·学习·机器学习·语言模型·vla·vlm
具身智能论文学习8:Octo: An Open-Source Generalist Robot PolicyOpen X-Embodiment→多机器人、大规模数据Diffusion Policy→连续动作序列与扩散动作生成
Dawson Zhu3 天前
人工智能·语言模型·架构·制造·agi
为什么智能体 Agent 需要本体 Ontology在构建基于大语言模型(LLM)的智能体(Agent)系统时,一个核心矛盾始终存在:LLM 的概率生成特性带来了强大的创造力,同时也引入了不可预测的"幻觉"和行为。当智能体获得自主执行动作的能力后,这种不确定性将直接转化为生产环境中的风险——错误退款、状态不一致、资源无限消耗等。