语言模型

吴佳浩 Alben1 小时前
人工智能·语言模型·架构·自动化·ai编程
Agent 怎么做自动化评测?构建端到端的 Agent Evaluation 体系作 者:吴佳浩(Alben) 微某信公众某号:全栈架构师笔记 系列专栏:《企业级 Agent 实战指南————企业级 Agent 质量保障体系:Evaluation 与安全防线》· 第 01 篇
Dawson Zhu2 小时前
人工智能·语言模型·架构·aigc·agi
从单体到联邦:多Agent架构的必要性与设计哲学在构建复杂的AI Agent系统时,我们常常面临一个架构抉择:是打造一个"全能"的单体Agent,通过集成多种工具调用(Tool Calling)来处理一切任务,还是将其拆分为多个职责单一的"子Agent",通过协同合作来完成目标?
Dawson Zhu14 小时前
人工智能·语言模型·架构·aigc·agi
Agent Skill 自进化架构深度解析:从发现到落地的完整闭环在大语言模型(LLM)应用日益普及的今天,我们常常面临一个核心挑战:如何让一个智能体(Agent)不仅能够理解复杂指令,还能在实际运行中持续学习和优化自身能力,而无需频繁地重新训练庞大的基础模型?
初恋叫萱萱14 小时前
语言模型·机器人·企业微信
企业微信智能化办公机器人部署与大语言模型集成实操深度指南在当前数字化协同办公的环境中,企业微信已不再仅仅是一个即时通讯工具,而是演变为企业内部流程自动化与智能化交互的核心终端。通过引入人工智能助手,企业能够实现从琐碎信息处理到复杂业务决策的支持。部署这一体系的第一步,在于正确配置企业微信端的机器人协议入口。
B站计算机毕业设计超人15 小时前
大数据·人工智能·语言模型·毕业设计·知识图谱·课程设计·推荐算法
计算机毕业设计知识图谱(Neo4j)+大语言模型LLM+GraphRAG图检索增强技术的考研院校推荐、分数线预测与智能问答系统(源码+文档+PPT+讲解)温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片!温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片!
Zzj_tju15 小时前
人工智能·语言模型·自然语言处理
蒸馏:从教师软概率到 response 监督的最小复现知识蒸馏指用教师模型提供的监督训练学生模型。教师可以交出完整输出概率,也可以只交出生成文本。前者让学生看见“第二可能答案”与最高分答案的差距,后者保存一条具体行为轨迹。学生容量较小、教师有偏差、迁移样本覆盖不足,都可能限制收益;参数少只是结构属性,效果仍须独立检验。
木圭的AI时代指南16 小时前
大数据·人工智能·ai·语言模型
为了跑星火Spark-X2.5,我把 llama.cpp 重新编译了一遍讯飞子公司 9 月 1 日开源了 Spark-X2.5,主打端侧原生 1M 上下文。我看中的是它 4B / 1.7B 两个尺寸——我这张 3070 跑得动。
土星云SaturnCloud16 小时前
服务器·人工智能·语言模型·自然语言处理·边缘计算
VILA 视觉语言模型边缘部署实战一、引言随着多模态大模型的发展,让模型“看得懂图、听得懂视频”已成为 AI 落地的重要方向。VILA 是由 Efficient-Large-Model 实验室提出的视觉语言模型(VLM),它通过大规模交错图像-文本数据进行预训练,具备视频理解与多图像理解能力,尤其适合视频内容分析、多图像关系推理以及图像与文本信息的融合处理。本文基于开源示例工程 sophon-demo 中的 Vila 例程,以算法工程师的视角,从算法原理、应用场景、工程部署三个维度展开,介绍如何将 VILA1.5-3b 部署到土星云 SE
一枚爱吃大蒜的程序员1 天前
人工智能·机器学习·语言模型·qlora·大模型微调·注意力约束
CSDN文章-注意力约束QLoRA教育大模型微调📌 论文原题:基于注意力约束QLoRA与指令样本增强的大模型微调方法研究 📌 核心成果:BLEU 44.1 / ROUGE-L 47.8 / F1 77.3% / 准确率 79.1%,较原生QLoRA提升5.6~10.6个百分点,峰值显存仅8.9GB,推理延迟130ms 📌 适用场景:职业院校、中小型教育机构等低资源条件下的垂直领域大模型微调
海上小飞龙1 天前
人工智能·深度学习·语言模型
大模型推理的两阶段:一次 Prefill,加上多次 Decode你跟 DeepSeek、通义、GPT 这类大模型聊过天,应该都见过那个画面——问完问题,字是一个一个往外蹦的,像有人在你对面现想现说。
Dawson Zhu2 天前
人工智能·语言模型·架构·aigc·agi
离散与连续的博弈:从BM25到向量检索的工程演进与系统融合在RAG(检索增强生成)与大模型搜索召回的面试中,“BM25与向量检索的区别"几乎是必考题。常见的回答往往是"BM25是关键词匹配,向量检索是语义匹配”。这个答案没错,但它仅仅停留在教科书层面,未能触及工业级检索系统的工程本质。
硅谷秋水2 天前
人工智能·机器学习·计算机视觉·语言模型·机器人
JEPA-WAM:基于联合嵌入世界建模的VLA策略学习26年8月来自人大、星源智(XYZ Embodied AI)、数据工程知识工程重点实验室、数据库商务智能研究中心、深圳高级技术研究中心和清华AIR研究所的论文“JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling”。
Dawson Zhu2 天前
人工智能·语言模型·架构·aigc·agi
知识图谱与 Palantir Ontology:同一套「实体—关系」表象下,两种截然不同的工程范式说明:本文面向数据平台与知识工程从业者,从数据模型、存储与更新、查询与推理、治理与执行四个可验证的工程维度,对比 RDF/OWL 知识图谱与 Palantir Ontology(本体)的差异。文中对 Palantir 产品能力的描述均基于其公开官方文档,对其商业性能数字(如某白皮书中的延迟、吞吐指标)不作二次背书,建议读者以自身压测为准。
LlmCraft|大模型工程实践3 天前
人工智能·语言模型·prompt
09 大语言模型(LLM)演进与 Prompt 入门系列文章目录01 NLP入门:什么是自然语言处理 ✅02 文本预处理:从原始文本到干净语料 ✅03 文本向量化:词袋模型与 TF-IDF ✅
Dawson Zhu3 天前
人工智能·语言模型·架构·aigc·agi
Kafka 在 AI Agent 系统中的应用:任务队列与事件总线的角色辨析及工程实践AI Agent(智能体)通常被描述为“感知—规划—行动”的循环:接收用户输入或环境事件,调用大模型推理,再借助工具(检索、数据库、HTTP 接口、代码执行等)完成任务。一个看似简单的对话请求,背后可能串联多次 LLM 调用、知识库查询、工具调用和结果汇总,端到端耗时从几百毫秒到几十分钟不等。
问天_观心3 天前
人工智能·python·深度学习·学习·语言模型·transformer
大模型微调学习(二)这页主要说明:对 GPT-3 这种超大模型进行全参数 Fine-tune,成本非常高。“噩梦”主要体现在三个方面:
木圭的AI时代指南3 天前
人工智能·ai·语言模型
AI江湖录②·池鱼摘要:七月十七日凌晨,月之暗面开源发布三万亿级模型 Kimi K3,以每百万 token 输出一百元的定价,把国产大模型的定价从"比谁便宜"推向"比谁值"。两天内,智谱跌四成二、MiniMax 跌两成四,港股 AI 板块蒸发约两千八百五十五亿港元,美股 AI 板块同步下挫。但石头只是导火索——解禁、配售、机构浮亏早已让池底开裂。十三天后,挨过打的智谱学会了涨价,阿里连夜改牌,腾讯、小米沉在水底,OpenAI、Anthropic 被证明贵得有理。一池子的鱼各自站队,而点火的那位,早已上岸去敲港交所的门。
Dawson Zhu3 天前
人工智能·语言模型·架构·aigc·agi
大语言模型的本质:从条件概率预测到能力涌现的技术剖析“大模型的本质是什么?”——这是很难回答的问题。回答“它是一个神经网络”过于浅显,回答“它是一个聊天机器人”又过于片面。
Carl_奕然4 天前
javascript·人工智能·python·react.js·设计模式·语言模型
【智能体】Agent的四种设计模式之:React(2026最新版)小屌丝:鱼哥,我最近写了个 Agent,让它查天气,结果你猜怎么着?它直接给我编了个假天气!北京今天明明 35 度大晴天,它告诉我"北京今天小雨 18 度,记得带伞"。我当场就裂开了…… 小鱼:(扶额)兄弟,你这是让模型"闭卷考试"啊。LLM 的知识是 cutoff 的,它又不会真的去查天气预报,可不就瞎编嘛。 小屌丝:那我该咋办?总不能我手动帮它查吧? 小鱼:你得让它学会 “边想边干”。就像你打游戏,不是一上来就冲boss,而是先观察一下——“这怪会喷火,我得绕后"→ 绕后 → 发现它屁股也会喷火 →
DM今天肝到几点?4 天前
网络·人工智能·深度学习·安全·语言模型·开源·知识图谱
AI 安全进入「攻防同频」:Gemini 3.8 Flash Cyber 上线、Astra 触及关键级、HiddenLayer 融资 1 亿美元9 月 2 日到 3 日这两天,安全相关的新闻密度异常高:同一时间,另一条新闻提供了刺眼的反面注脚:黑客在暗网兜售 1.53 亿份美国驾照扫描件。