大语言模型

prog_61031 天前
笔记·大语言模型·agent·vibe-coding·qwen3.8-flash
【笔记】cllama:搜罗万象当LLM api server测qwen3.8:flash-nextTL;DR cllama先别急着看代码。我想先讲个故事。我有一台很普通的服务器——没有 GPU,只有 CPU,但它在公网上,有个公网 IP,可以连着腾讯的 IMA。这台机器常年安静地跑着 bge-m3 做 embedding,把知识库向量化,等着被检索。
EDPJ2 天前
llm·负载均衡·大语言模型·moe
(2024|DeepSeek & 北大,Loss-Free Balancing,每专家偏置,QB)MoE 的无辅助损失负载均衡策略论文地址:https://arxiv.org/abs/2408.15664ICLR 2025:https://openreview.net/forum?id=y1iU5czYpE
天地会珠海分舵3 天前
大语言模型·测评报告·qwen 3.8 flash
Qwen 3.8‑Flash完整实测!从推理编程到多模态!真的能打吗?任务:输出10个以汉字数字结尾的句子,且按照顺序一到十,语句要通顺有意义,且倒数第二个字不能重复且不能是”第”,”是”,”为”
龍德明宇3 天前
大语言模型·ai哲学·负主体性
四个时代之问的存在论根基-龍德明宇7月17日,2026世界人工智能大会上的主旨演讲《携手构建公正合理的全球人工智能治理体系》,提出四个时代之问,并给出四个方向:开放共赢、安全可控、包容并蓄、和衷共济。同日发布的《人工智能合作发展行动计划》,以八项行动将这四个方向落实为具体举措。
今天吃饺子5 天前
大语言模型·llama·故障诊断
超高创新模型!TF-SAX-Llama 轴承故障诊断近年来,大语言模型火得一塌糊涂,写文案、敲代码、做图样样都行。于是很多人开始琢磨:能不能把大模型用在工业故障诊断上?
prog_61035 天前
人工智能·笔记·大语言模型·agent
【笔记】用cursor手搓cursor(九)用了一圈,我觉得目前知识库比较接近我的预想的是腾讯的ima,但是管理大规模知识的检索,以及索引的索引,索引的索引的索引…都还是问题,说白了就是思维链通路。
Geek-Chow6 天前
人工智能·大语言模型·多模态
02 多模态 LLM 是什么:定义、边界与生态位置上一篇讲清了纯文本 LLM 撞上的四堵墙,以及 CLIP 造出了眼睛却没接大脑。这一篇把"接起来之后的那个东西"正式定义出来。
Geek-Chow8 天前
人工智能·llm·大语言模型
12 开源 vs 闭源:同一份权重,两种交付训练管线跑完,产出一个几十 GB 的文件。接下来只剩一个决策:这个文件公开吗?就这一个二选一,分叉出了两个平行生态、两套成本模型、两种隐私边界、两类风险。而分叉之后,两边跑的推理原理一模一样——同样的 prefill/decode、同样的 KV Cache、同样的采样参数。
小白跃升坊9 天前
ai·大语言模型
DeepSeek 多模态 API 调用完全指南:从调用到效果,一篇讲透2026年8月21日,DeepSeek 正式上线 V4 系列首款视觉模型 DeepSeek-V4-Flash-Vision-Exp,开放多模态 API 服务。这是 DeepSeek 从纯文本大模型正式迈入多模态 Agent 赛道的重要一步。本文将从 API 调用、实际效果、中间层架构三个维度,帮你一次讲透。
白拾11 天前
大语言模型·图神经网络·知识蒸馏·少样本学习·neurips 2025·pkd 论文分享
【NeurIPS 2025】PKD:偏好驱动的知识蒸馏,少样本节点分类|从少样本图学习视角本文解读 NeurIPS 2025 论文《Preference-driven Knowledge Distillation for Few-shot Node Classification》。该论文提出偏好驱动的知识蒸馏框架 PKD,通过融合GNN 偏好节点选择器 GNS、节点偏好 GNN 选择器 NGS与图拓扑感知(GTA)提示微调,让大语言模型(LLM)与多种图神经网络(GNN)在少样本节点分类上互补协同,其特别之处在于把蒸馏粒度细化到「节点-教师」配对级别。实验表明仅用每类 5 个标注节点即可在 C
猫先生Mr.Mao11 天前
机器人·大语言模型·论文解读·具身智能·saycan
具身智能语言规划之SayCan详解:让大模型“会说”,也让机器人“能做”【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
DogDaoDao12 天前
机器人·大语言模型·nvidia·机器人模型·智能机器人·图像生成模型·gr00t
GR00T N1 论文深度拆解:英伟达给机器人装上了“快与慢“双系统大脑论文:GR00T N1: An Open Foundation Model for Generalist Humanoid Robots 作者:NVIDIA(研究负责人 Linxi “Jim” Fan、Yuke Zhu) 出处:arXiv:2503.14734 [cs.RO],2025-03-18 开源:模型权重(HuggingFace nvidia/GR00T-N1-2B)、训练数据、仿真基准全量开放 一句话概括:一个 2.2B 参数的视觉-语言-动作(VLA)基础模型,用"System 2 推理 +
白拾14 天前
大语言模型·模型压缩·高效推理·efficient llm·mlsys·tmlr 2024
【TMLR 2024】Efficient LLM:高效大语言模型综述,模型、数据与框架三重视角|从大模型系统优化视角本文解读 TMLR 2024 论文《Efficient Large Language Models: A Survey》。该综述提出模型、数据、框架三重视角的统一分类法,系统梳理模型压缩、高效预训练/微调/推理与高效架构,覆盖 379 篇文献,其特别之处在于配套持续维护的 GitHub 仓库作为社区基础设施。综述表明量化到 4-bit 近乎无损、剪枝达 60% 稀疏、MoE 以 1T 参数解耦规模与算力,为高效大语言模型研究提供了系统化地图。
墨心@15 天前
人工智能·语言模型·大语言模型·agent·codex·harness
阶段 4:事件总线对应代码:stage04_events.py理解"事件既是给消费者的消息,也是驱动派生状态的输入",并实现 terminal_error 的单写多读模式。
白拾17 天前
大语言模型·高效推理·mla·deepseek-v2 论文分享·moe 稀疏架构·arxiv 2024
【arXiv 2024】DeepSeek-V2 论文解读:经济训练与高效推理的 MoE 大语言模型|从稀疏架构降本增效视角本文解读 arXiv 2024 论文《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》。该论文提出DeepSeek-V2 大语言模型,通过融合MLA(多头潜在注意力)、DeepSeekMoE(细粒度专家稀疏)与GRPO 两阶段对齐,在 236B 总参数、每 token 仅激活 21B 的条件下支持 128K 上下文,其特别之处在于用低秩 KV 联合压缩把推理显存瓶颈转化为一次可被矩阵吸收的
夏文强18 天前
人工智能·大语言模型·多模态·前沿技术·ai agent
多模态 AI Agent 前沿全景:2026 年从「能回答」到「能干活」的跃迁标签: 多模态, AI Agent, 大语言模型, 人工智能, 前沿技术如果说 2023–2024 年的大模型关键词是「会聊天」,那么 2026 年的关键词毫无疑问是「能干活」。AI Agent(智能体)正在从「回答一个问题」进化到「端到端交付一个任务」,而多模态能力则是让它真正看懂世界、动手操作的关键一跃。
夏文强18 天前
人工智能·深度学习·机器学习·大语言模型·技术架构
AI 技术全景架构科普:从算法到应用的一整套技术栈标签: 人工智能, 深度学习, 大语言模型, 机器学习, 技术架构人工智能(Artificial Intelligence,AI)已经渗透到我们生活的方方面面:从手机里的语音助手、人脸识别,到生成文本的 ChatGPT、生成图片的 Midjourney。但对很多人来说,AI 仍然像是一个「黑箱」——知道它很厉害,却不清楚它内部到底是怎么运转的。
美人胖八分18 天前
lora·大语言模型·deepspeed·qlora
大模型常见微调框架对比微调框架的价值不只在于启动训练,还要正确处理聊天模板、损失掩码、4-bit 基座加载、LoRA 注入、分布式检查点与权重导出。选型前应分清层级:Transformers 提供模型、Tokenizer 和通用 Trainer;PEFT 实现 LoRA 等参数高效方法;Accelerate 统一设备和任务启动;DeepSpeed ZeRO、PyTorch FSDP 负责切分参数、梯度与优化器状态;Megatron-Core 则提供张量、流水线、上下文和专家并行。LLaMA-Factory、Axolotl 和
艺杯羹20 天前
网络·安全·网络安全·ai·llm·大语言模型·ai安全
LLM越狱与安全护栏攻防大演进:从奶奶漏洞到输入输出双重检测模型目录1. 角色扮演攻防战:从“奶奶漏洞”到强化学习安全对齐1.1. 角色扮演攻击的底层机制1.2. 静态拦截与强化学习对齐(RLHF/SFT)
还是奇怪21 天前
人工智能·web安全·大语言模型·anthropic
Agent 安全事件成为本周核心风险信号,从三起越界评测到 Hugging Face 入侵导语:2026 年 7 月底,Anthropic、OpenAI 与 Hugging Face 接连披露真实系统被 AI Agent 越界访问的事件。它们不是“模型突然产生恶意”的证据,却足以推翻一种危险的安全假设:只要在系统提示词里写明边界,Agent 就会被约束在边界内。