大语言模型

Geek-Chow1 天前
人工智能·llm·大语言模型
12 开源 vs 闭源:同一份权重,两种交付训练管线跑完,产出一个几十 GB 的文件。接下来只剩一个决策:这个文件公开吗?就这一个二选一,分叉出了两个平行生态、两套成本模型、两种隐私边界、两类风险。而分叉之后,两边跑的推理原理一模一样——同样的 prefill/decode、同样的 KV Cache、同样的采样参数。
小白跃升坊2 天前
ai·大语言模型
DeepSeek 多模态 API 调用完全指南:从调用到效果,一篇讲透2026年8月21日,DeepSeek 正式上线 V4 系列首款视觉模型 DeepSeek-V4-Flash-Vision-Exp,开放多模态 API 服务。这是 DeepSeek 从纯文本大模型正式迈入多模态 Agent 赛道的重要一步。本文将从 API 调用、实际效果、中间层架构三个维度,帮你一次讲透。
白拾4 天前
大语言模型·图神经网络·知识蒸馏·少样本学习·neurips 2025·pkd 论文分享
【NeurIPS 2025】PKD:偏好驱动的知识蒸馏,少样本节点分类|从少样本图学习视角本文解读 NeurIPS 2025 论文《Preference-driven Knowledge Distillation for Few-shot Node Classification》。该论文提出偏好驱动的知识蒸馏框架 PKD,通过融合GNN 偏好节点选择器 GNS、节点偏好 GNN 选择器 NGS与图拓扑感知(GTA)提示微调,让大语言模型(LLM)与多种图神经网络(GNN)在少样本节点分类上互补协同,其特别之处在于把蒸馏粒度细化到「节点-教师」配对级别。实验表明仅用每类 5 个标注节点即可在 C
猫先生Mr.Mao4 天前
机器人·大语言模型·论文解读·具身智能·saycan
具身智能语言规划之SayCan详解:让大模型“会说”,也让机器人“能做”【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
DogDaoDao5 天前
机器人·大语言模型·nvidia·机器人模型·智能机器人·图像生成模型·gr00t
GR00T N1 论文深度拆解:英伟达给机器人装上了“快与慢“双系统大脑论文:GR00T N1: An Open Foundation Model for Generalist Humanoid Robots 作者:NVIDIA(研究负责人 Linxi “Jim” Fan、Yuke Zhu) 出处:arXiv:2503.14734 [cs.RO],2025-03-18 开源:模型权重(HuggingFace nvidia/GR00T-N1-2B)、训练数据、仿真基准全量开放 一句话概括:一个 2.2B 参数的视觉-语言-动作(VLA)基础模型,用"System 2 推理 +
白拾7 天前
大语言模型·模型压缩·高效推理·efficient llm·mlsys·tmlr 2024
【TMLR 2024】Efficient LLM:高效大语言模型综述,模型、数据与框架三重视角|从大模型系统优化视角本文解读 TMLR 2024 论文《Efficient Large Language Models: A Survey》。该综述提出模型、数据、框架三重视角的统一分类法,系统梳理模型压缩、高效预训练/微调/推理与高效架构,覆盖 379 篇文献,其特别之处在于配套持续维护的 GitHub 仓库作为社区基础设施。综述表明量化到 4-bit 近乎无损、剪枝达 60% 稀疏、MoE 以 1T 参数解耦规模与算力,为高效大语言模型研究提供了系统化地图。
墨心@8 天前
人工智能·语言模型·大语言模型·agent·codex·harness
阶段 4:事件总线对应代码:stage04_events.py理解"事件既是给消费者的消息,也是驱动派生状态的输入",并实现 terminal_error 的单写多读模式。
白拾10 天前
大语言模型·高效推理·mla·deepseek-v2 论文分享·moe 稀疏架构·arxiv 2024
【arXiv 2024】DeepSeek-V2 论文解读:经济训练与高效推理的 MoE 大语言模型|从稀疏架构降本增效视角本文解读 arXiv 2024 论文《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》。该论文提出DeepSeek-V2 大语言模型,通过融合MLA(多头潜在注意力)、DeepSeekMoE(细粒度专家稀疏)与GRPO 两阶段对齐,在 236B 总参数、每 token 仅激活 21B 的条件下支持 128K 上下文,其特别之处在于用低秩 KV 联合压缩把推理显存瓶颈转化为一次可被矩阵吸收的
夏文强11 天前
人工智能·大语言模型·多模态·前沿技术·ai agent
多模态 AI Agent 前沿全景:2026 年从「能回答」到「能干活」的跃迁标签: 多模态, AI Agent, 大语言模型, 人工智能, 前沿技术如果说 2023–2024 年的大模型关键词是「会聊天」,那么 2026 年的关键词毫无疑问是「能干活」。AI Agent(智能体)正在从「回答一个问题」进化到「端到端交付一个任务」,而多模态能力则是让它真正看懂世界、动手操作的关键一跃。
夏文强11 天前
人工智能·深度学习·机器学习·大语言模型·技术架构
AI 技术全景架构科普:从算法到应用的一整套技术栈标签: 人工智能, 深度学习, 大语言模型, 机器学习, 技术架构人工智能(Artificial Intelligence,AI)已经渗透到我们生活的方方面面:从手机里的语音助手、人脸识别,到生成文本的 ChatGPT、生成图片的 Midjourney。但对很多人来说,AI 仍然像是一个「黑箱」——知道它很厉害,却不清楚它内部到底是怎么运转的。
美人胖八分11 天前
lora·大语言模型·deepspeed·qlora
大模型常见微调框架对比微调框架的价值不只在于启动训练,还要正确处理聊天模板、损失掩码、4-bit 基座加载、LoRA 注入、分布式检查点与权重导出。选型前应分清层级:Transformers 提供模型、Tokenizer 和通用 Trainer;PEFT 实现 LoRA 等参数高效方法;Accelerate 统一设备和任务启动;DeepSpeed ZeRO、PyTorch FSDP 负责切分参数、梯度与优化器状态;Megatron-Core 则提供张量、流水线、上下文和专家并行。LLaMA-Factory、Axolotl 和
艺杯羹13 天前
网络·安全·网络安全·ai·llm·大语言模型·ai安全
LLM越狱与安全护栏攻防大演进:从奶奶漏洞到输入输出双重检测模型目录1. 角色扮演攻防战:从“奶奶漏洞”到强化学习安全对齐1.1. 角色扮演攻击的底层机制1.2. 静态拦截与强化学习对齐(RLHF/SFT)
还是奇怪14 天前
人工智能·web安全·大语言模型·anthropic
Agent 安全事件成为本周核心风险信号,从三起越界评测到 Hugging Face 入侵导语:2026 年 7 月底,Anthropic、OpenAI 与 Hugging Face 接连披露真实系统被 AI Agent 越界访问的事件。它们不是“模型突然产生恶意”的证据,却足以推翻一种危险的安全假设:只要在系统提示词里写明边界,Agent 就会被约束在边界内。
prog_610320 天前
笔记·llm·大语言模型·agent
【笔记】用cursor手搓cursor(八)最近有点魔怔,因为思路完全卡住了。现在的claude code、codex、hermes就是LLM的wrapper而已,而且LLM为了在RL里刷分,幻觉会提高不少。它见过的东西确实写得很不错,它没见过的真的是胡扯。
科研小刘带你玩学术21 天前
人工智能·大语言模型·未来趋势·智能体·智能系统
AI Agent正在改变人工智能应用模式:从工具助手走向自主智能系统过去几年,人工智能的发展主要围绕大语言模型展开。ChatGPT、Claude、Gemini等模型让AI具备了强大的语言理解和内容生成能力。
带娃的IT创业者23 天前
人工智能·开源·大语言模型·多模态·moe·开源模型·inkling
Inkling:当开源模型开始思考“如何思考”👋 大家好,我是 带娃的IT创业者,CSDN 人工智能领域新星创作者,一边带娃一边创业的全栈工程师。专注 AI 大模型应用落地、Python 实战进阶与 AI 开发工具链(Python / FastAPI / 大模型 / AI 编程)。
钱多多_qdd1 个月前
ai·大语言模型
Mac本地部署大模型,Ollama+Qwen3.5很多新手第一次折腾本地模型,刚起步就翻车——核心原因就一个:选了个自己Mac跑不动的模型!要么内存不够直接报错,要么跑起来卡到怀疑人生,白忙活一场。
寒水馨1 个月前
windows·llm·大语言模型·llama·本地部署·ollama·模型运行
Windows下载、安装ollama-v0.32.1(附安装包OllamaSetup.exe)Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 130,000 颗星标(Stars),是 AI 开发者社区中最受关注的开源项目之一。
战族狼魂1 个月前
人工智能·算法·大模型·大语言模型
高频面试题精选:分治与AI Agent架构基于过去一周CSDN、51CTO、掘金等技术社区的热议内容,筛选出10道高频面试题,涵盖算法、系统设计、数据库、网络四大核心领域。