技术栈
大语言模型
Geek-Chow
1 天前
人工智能
·
llm
·
大语言模型
12 开源 vs 闭源:同一份权重,两种交付
训练管线跑完,产出一个几十 GB 的文件。接下来只剩一个决策:这个文件公开吗?就这一个二选一,分叉出了两个平行生态、两套成本模型、两种隐私边界、两类风险。而分叉之后,两边跑的推理原理一模一样——同样的 prefill/decode、同样的 KV Cache、同样的采样参数。
小白跃升坊
2 天前
ai
·
大语言模型
DeepSeek 多模态 API 调用完全指南:从调用到效果,一篇讲透
2026年8月21日,DeepSeek 正式上线 V4 系列首款视觉模型 DeepSeek-V4-Flash-Vision-Exp,开放多模态 API 服务。这是 DeepSeek 从纯文本大模型正式迈入多模态 Agent 赛道的重要一步。本文将从 API 调用、实际效果、中间层架构三个维度,帮你一次讲透。
白拾
4 天前
大语言模型
·
图神经网络
·
知识蒸馏
·
少样本学习
·
neurips 2025
·
pkd 论文分享
【NeurIPS 2025】PKD:偏好驱动的知识蒸馏,少样本节点分类|从少样本图学习视角
本文解读 NeurIPS 2025 论文《Preference-driven Knowledge Distillation for Few-shot Node Classification》。该论文提出偏好驱动的知识蒸馏框架 PKD,通过融合GNN 偏好节点选择器 GNS、节点偏好 GNN 选择器 NGS与图拓扑感知(GTA)提示微调,让大语言模型(LLM)与多种图神经网络(GNN)在少样本节点分类上互补协同,其特别之处在于把蒸馏粒度细化到「节点-教师」配对级别。实验表明仅用每类 5 个标注节点即可在 C
猫先生Mr.Mao
4 天前
机器人
·
大语言模型
·
论文解读
·
具身智能
·
saycan
具身智能语言规划之SayCan详解:让大模型“会说”,也让机器人“能做”
【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
DogDaoDao
5 天前
机器人
·
大语言模型
·
nvidia
·
机器人模型
·
智能机器人
·
图像生成模型
·
gr00t
GR00T N1 论文深度拆解:英伟达给机器人装上了“快与慢“双系统大脑
论文:GR00T N1: An Open Foundation Model for Generalist Humanoid Robots 作者:NVIDIA(研究负责人 Linxi “Jim” Fan、Yuke Zhu) 出处:arXiv:2503.14734 [cs.RO],2025-03-18 开源:模型权重(HuggingFace nvidia/GR00T-N1-2B)、训练数据、仿真基准全量开放 一句话概括:一个 2.2B 参数的视觉-语言-动作(VLA)基础模型,用"System 2 推理 +
白拾
7 天前
大语言模型
·
模型压缩
·
高效推理
·
efficient llm
·
mlsys
·
tmlr 2024
【TMLR 2024】Efficient LLM:高效大语言模型综述,模型、数据与框架三重视角|从大模型系统优化视角
本文解读 TMLR 2024 论文《Efficient Large Language Models: A Survey》。该综述提出模型、数据、框架三重视角的统一分类法,系统梳理模型压缩、高效预训练/微调/推理与高效架构,覆盖 379 篇文献,其特别之处在于配套持续维护的 GitHub 仓库作为社区基础设施。综述表明量化到 4-bit 近乎无损、剪枝达 60% 稀疏、MoE 以 1T 参数解耦规模与算力,为高效大语言模型研究提供了系统化地图。
墨心@
8 天前
人工智能
·
语言模型
·
大语言模型
·
agent
·
codex
·
harness
阶段 4:事件总线
对应代码:stage04_events.py理解"事件既是给消费者的消息,也是驱动派生状态的输入",并实现 terminal_error 的单写多读模式。
白拾
10 天前
大语言模型
·
高效推理
·
mla
·
deepseek-v2 论文分享
·
moe 稀疏架构
·
arxiv 2024
【arXiv 2024】DeepSeek-V2 论文解读:经济训练与高效推理的 MoE 大语言模型|从稀疏架构降本增效视角
本文解读 arXiv 2024 论文《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》。该论文提出DeepSeek-V2 大语言模型,通过融合MLA(多头潜在注意力)、DeepSeekMoE(细粒度专家稀疏)与GRPO 两阶段对齐,在 236B 总参数、每 token 仅激活 21B 的条件下支持 128K 上下文,其特别之处在于用低秩 KV 联合压缩把推理显存瓶颈转化为一次可被矩阵吸收的
夏文强
11 天前
人工智能
·
大语言模型
·
多模态
·
前沿技术
·
ai agent
多模态 AI Agent 前沿全景:2026 年从「能回答」到「能干活」的跃迁
标签: 多模态, AI Agent, 大语言模型, 人工智能, 前沿技术如果说 2023–2024 年的大模型关键词是「会聊天」,那么 2026 年的关键词毫无疑问是「能干活」。AI Agent(智能体)正在从「回答一个问题」进化到「端到端交付一个任务」,而多模态能力则是让它真正看懂世界、动手操作的关键一跃。
夏文强
11 天前
人工智能
·
深度学习
·
机器学习
·
大语言模型
·
技术架构
AI 技术全景架构科普:从算法到应用的一整套技术栈
标签: 人工智能, 深度学习, 大语言模型, 机器学习, 技术架构人工智能(Artificial Intelligence,AI)已经渗透到我们生活的方方面面:从手机里的语音助手、人脸识别,到生成文本的 ChatGPT、生成图片的 Midjourney。但对很多人来说,AI 仍然像是一个「黑箱」——知道它很厉害,却不清楚它内部到底是怎么运转的。
美人胖八分
11 天前
lora
·
大语言模型
·
deepspeed
·
qlora
大模型常见微调框架对比
微调框架的价值不只在于启动训练,还要正确处理聊天模板、损失掩码、4-bit 基座加载、LoRA 注入、分布式检查点与权重导出。选型前应分清层级:Transformers 提供模型、Tokenizer 和通用 Trainer;PEFT 实现 LoRA 等参数高效方法;Accelerate 统一设备和任务启动;DeepSpeed ZeRO、PyTorch FSDP 负责切分参数、梯度与优化器状态;Megatron-Core 则提供张量、流水线、上下文和专家并行。LLaMA-Factory、Axolotl 和
艺杯羹
13 天前
网络
·
安全
·
网络安全
·
ai
·
llm
·
大语言模型
·
ai安全
LLM越狱与安全护栏攻防大演进:从奶奶漏洞到输入输出双重检测模型
目录1. 角色扮演攻防战:从“奶奶漏洞”到强化学习安全对齐1.1. 角色扮演攻击的底层机制1.2. 静态拦截与强化学习对齐(RLHF/SFT)
还是奇怪
14 天前
人工智能
·
web安全
·
大语言模型
·
anthropic
Agent 安全事件成为本周核心风险信号,从三起越界评测到 Hugging Face 入侵
导语:2026 年 7 月底,Anthropic、OpenAI 与 Hugging Face 接连披露真实系统被 AI Agent 越界访问的事件。它们不是“模型突然产生恶意”的证据,却足以推翻一种危险的安全假设:只要在系统提示词里写明边界,Agent 就会被约束在边界内。
prog_6103
20 天前
笔记
·
llm
·
大语言模型
·
agent
【笔记】用cursor手搓cursor(八)
最近有点魔怔,因为思路完全卡住了。现在的claude code、codex、hermes就是LLM的wrapper而已,而且LLM为了在RL里刷分,幻觉会提高不少。它见过的东西确实写得很不错,它没见过的真的是胡扯。
科研小刘带你玩学术
21 天前
人工智能
·
大语言模型
·
未来趋势
·
智能体
·
智能系统
AI Agent正在改变人工智能应用模式:从工具助手走向自主智能系统
过去几年,人工智能的发展主要围绕大语言模型展开。ChatGPT、Claude、Gemini等模型让AI具备了强大的语言理解和内容生成能力。
带娃的IT创业者
23 天前
人工智能
·
开源
·
大语言模型
·
多模态
·
moe
·
开源模型
·
inkling
Inkling:当开源模型开始思考“如何思考”
👋 大家好,我是 带娃的IT创业者,CSDN 人工智能领域新星创作者,一边带娃一边创业的全栈工程师。专注 AI 大模型应用落地、Python 实战进阶与 AI 开发工具链(Python / FastAPI / 大模型 / AI 编程)。
钱多多_qdd
1 个月前
ai
·
大语言模型
Mac本地部署大模型,Ollama+Qwen3.5
很多新手第一次折腾本地模型,刚起步就翻车——核心原因就一个:选了个自己Mac跑不动的模型!要么内存不够直接报错,要么跑起来卡到怀疑人生,白忙活一场。
寒水馨
1 个月前
windows
·
llm
·
大语言模型
·
llama
·
本地部署
·
ollama
·
模型运行
Windows下载、安装ollama-v0.32.1(附安装包OllamaSetup.exe)
Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 130,000 颗星标(Stars),是 AI 开发者社区中最受关注的开源项目之一。
战族狼魂
1 个月前
人工智能
·
算法
·
大模型
·
大语言模型
高频面试题精选:分治与AI Agent架构
基于过去一周CSDN、51CTO、掘金等技术社区的热议内容,筛选出10道高频面试题,涵盖算法、系统设计、数据库、网络四大核心领域。