语言模型

吴佳浩 Alben5 小时前
大数据·人工智能·语言模型·架构·自动化·ai编程·devops
构建企业级 DevOps 排错 Agent:从日志告警到自动化修复 PR作 者:吴佳浩(Alben) 微某信公众某号:全栈架构师笔记 系列专栏:《企业级 Agent———打造下一代智能体:企业级 Coding / DevOps Agent》· 第 02 篇
差不多的周周6 小时前
人工智能·深度学习·机器学习·计算机视觉·语言模型·自然语言处理
《MoChat:面向多转弯动作理解和描述的关节分组时空接地多通道大语言模型》论文核心部分详解论文原标题:MoChat: Joints-Grouped Spatio-Temporal Grounding Multimodal Large Language Model for Multi-Turn Motion Comprehension and Description
Zzj_tju7 小时前
人工智能·深度学习·机器学习·语言模型
小模型指令微调:数据混合、模板与过拟合的最小复现监督微调,即 SFT,是用输入及示范回答继续优化模型。预训练提供的能力、示范覆盖的任务、输出格式和评测方式共同决定收益,不能仅凭数据条数解释结果。
艾莉丝努力练剑7 小时前
c++·人工智能·语言模型·自然语言处理·面试
【AI大模型接入SDK】Ollama本地大语言模型部署🎬 艾莉丝的简介:需结合业务功能需求与本地硬件配置(显存、内存、算力),选择适配参数量与量化等级的模型。
hrx-@@8 小时前
人工智能·语言模型·开源·github
DSH 插件开发到上架:完整实操手册本文是一份技术实操文档:手把手讲清楚一个 DeepSeek Harness(DSH)插件从「是什么」到「做出来、调试好、发上 GitHub、进插件市场、发上 npm」的完整流程,包括每一步的细节、原理和注意事项。
吴佳浩 Alben17 小时前
人工智能·语言模型·架构·自动化·ai编程
Agent 怎么做自动化评测?构建端到端的 Agent Evaluation 体系作 者:吴佳浩(Alben) 微某信公众某号:全栈架构师笔记 系列专栏:《企业级 Agent 实战指南————企业级 Agent 质量保障体系:Evaluation 与安全防线》· 第 01 篇
Dawson Zhu18 小时前
人工智能·语言模型·架构·aigc·agi
从单体到联邦:多Agent架构的必要性与设计哲学在构建复杂的AI Agent系统时,我们常常面临一个架构抉择:是打造一个"全能"的单体Agent,通过集成多种工具调用(Tool Calling)来处理一切任务,还是将其拆分为多个职责单一的"子Agent",通过协同合作来完成目标?
Dawson Zhu1 天前
人工智能·语言模型·架构·aigc·agi
Agent Skill 自进化架构深度解析:从发现到落地的完整闭环在大语言模型(LLM)应用日益普及的今天,我们常常面临一个核心挑战:如何让一个智能体(Agent)不仅能够理解复杂指令,还能在实际运行中持续学习和优化自身能力,而无需频繁地重新训练庞大的基础模型?
初恋叫萱萱1 天前
语言模型·机器人·企业微信
企业微信智能化办公机器人部署与大语言模型集成实操深度指南在当前数字化协同办公的环境中,企业微信已不再仅仅是一个即时通讯工具,而是演变为企业内部流程自动化与智能化交互的核心终端。通过引入人工智能助手,企业能够实现从琐碎信息处理到复杂业务决策的支持。部署这一体系的第一步,在于正确配置企业微信端的机器人协议入口。
B站计算机毕业设计超人1 天前
大数据·人工智能·语言模型·毕业设计·知识图谱·课程设计·推荐算法
计算机毕业设计知识图谱(Neo4j)+大语言模型LLM+GraphRAG图检索增强技术的考研院校推荐、分数线预测与智能问答系统(源码+文档+PPT+讲解)温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片!温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片!
Zzj_tju1 天前
人工智能·语言模型·自然语言处理
蒸馏:从教师软概率到 response 监督的最小复现知识蒸馏指用教师模型提供的监督训练学生模型。教师可以交出完整输出概率,也可以只交出生成文本。前者让学生看见“第二可能答案”与最高分答案的差距,后者保存一条具体行为轨迹。学生容量较小、教师有偏差、迁移样本覆盖不足,都可能限制收益;参数少只是结构属性,效果仍须独立检验。
木圭的AI时代指南1 天前
大数据·人工智能·ai·语言模型
为了跑星火Spark-X2.5,我把 llama.cpp 重新编译了一遍讯飞子公司 9 月 1 日开源了 Spark-X2.5,主打端侧原生 1M 上下文。我看中的是它 4B / 1.7B 两个尺寸——我这张 3070 跑得动。
土星云SaturnCloud1 天前
服务器·人工智能·语言模型·自然语言处理·边缘计算
VILA 视觉语言模型边缘部署实战一、引言随着多模态大模型的发展,让模型“看得懂图、听得懂视频”已成为 AI 落地的重要方向。VILA 是由 Efficient-Large-Model 实验室提出的视觉语言模型(VLM),它通过大规模交错图像-文本数据进行预训练,具备视频理解与多图像理解能力,尤其适合视频内容分析、多图像关系推理以及图像与文本信息的融合处理。本文基于开源示例工程 sophon-demo 中的 Vila 例程,以算法工程师的视角,从算法原理、应用场景、工程部署三个维度展开,介绍如何将 VILA1.5-3b 部署到土星云 SE
一枚爱吃大蒜的程序员2 天前
人工智能·机器学习·语言模型·qlora·大模型微调·注意力约束
CSDN文章-注意力约束QLoRA教育大模型微调📌 论文原题:基于注意力约束QLoRA与指令样本增强的大模型微调方法研究 📌 核心成果:BLEU 44.1 / ROUGE-L 47.8 / F1 77.3% / 准确率 79.1%,较原生QLoRA提升5.6~10.6个百分点,峰值显存仅8.9GB,推理延迟130ms 📌 适用场景:职业院校、中小型教育机构等低资源条件下的垂直领域大模型微调
海上小飞龙2 天前
人工智能·深度学习·语言模型
大模型推理的两阶段:一次 Prefill,加上多次 Decode你跟 DeepSeek、通义、GPT 这类大模型聊过天,应该都见过那个画面——问完问题,字是一个一个往外蹦的,像有人在你对面现想现说。
Dawson Zhu2 天前
人工智能·语言模型·架构·aigc·agi
离散与连续的博弈:从BM25到向量检索的工程演进与系统融合在RAG(检索增强生成)与大模型搜索召回的面试中,“BM25与向量检索的区别"几乎是必考题。常见的回答往往是"BM25是关键词匹配,向量检索是语义匹配”。这个答案没错,但它仅仅停留在教科书层面,未能触及工业级检索系统的工程本质。
硅谷秋水3 天前
人工智能·机器学习·计算机视觉·语言模型·机器人
JEPA-WAM:基于联合嵌入世界建模的VLA策略学习26年8月来自人大、星源智(XYZ Embodied AI)、数据工程知识工程重点实验室、数据库商务智能研究中心、深圳高级技术研究中心和清华AIR研究所的论文“JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling”。
Dawson Zhu3 天前
人工智能·语言模型·架构·aigc·agi
知识图谱与 Palantir Ontology:同一套「实体—关系」表象下,两种截然不同的工程范式说明:本文面向数据平台与知识工程从业者,从数据模型、存储与更新、查询与推理、治理与执行四个可验证的工程维度,对比 RDF/OWL 知识图谱与 Palantir Ontology(本体)的差异。文中对 Palantir 产品能力的描述均基于其公开官方文档,对其商业性能数字(如某白皮书中的延迟、吞吐指标)不作二次背书,建议读者以自身压测为准。
LlmCraft|大模型工程实践3 天前
人工智能·语言模型·prompt
09 大语言模型(LLM)演进与 Prompt 入门系列文章目录01 NLP入门:什么是自然语言处理 ✅02 文本预处理:从原始文本到干净语料 ✅03 文本向量化:词袋模型与 TF-IDF ✅
Dawson Zhu3 天前
人工智能·语言模型·架构·aigc·agi
Kafka 在 AI Agent 系统中的应用:任务队列与事件总线的角色辨析及工程实践AI Agent(智能体)通常被描述为“感知—规划—行动”的循环:接收用户输入或环境事件,调用大模型推理,再借助工具(检索、数据库、HTTP 接口、代码执行等)完成任务。一个看似简单的对话请求,背后可能串联多次 LLM 调用、知识库查询、工具调用和结果汇总,端到端耗时从几百毫秒到几十分钟不等。