语言模型

不要生病了17 分钟前
人工智能·语言模型·回归
扩散语言模型的“灵活性陷阱”:为什么训练时反而应该按自回归顺序探索?原论文:The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models 作者:Zanlin Ni、Shenzhi Wang、Yang Yue、Tianyu Yu、Weilin Zhao、Yeguo Hua、Tianyi Chen、Jun Song、Cheng Yu、Bo Zheng、Gao Huang 会议/年份:ICML 2026;原文为 arXiv:2601.15165v4(2026-
憨波个3 小时前
人工智能·深度学习·语言模型·whisper·语音识别
【ASR】Whisper:Robust Speech Recognition via Large-Scale Weak Supervision相比 wav2vec 2.0 、HuBERT 和 WavLM 等自监督模型。Whisper(Radford et al.,OpenAI,2022)的想法是,互联网已经有大量音频、字幕对,能不能接受标签不够精确,以更大的规模和更多样的来源,直接训练一个能转写、能翻译的模型?
wish3668 小时前
人工智能·语言模型·自然语言处理·local llm
LiteLLM 部署实战:Docker 环境LiteLLM 是一个开源的 LLM 网关,它提供统一的 API 接口,让开发者可以用一套代码接入 OpenAI、Anthropic、Azure OpenAI、Google Gemini 等多家大模型服务。通过 LiteLLM,你可以实现模型路由、负载均衡、成本追踪、限流和密钥管理等功能,从而简化多模型接入的复杂度。
大模型任我行9 小时前
人工智能·语言模型·自然语言处理·论文笔记
Meta:AI让推荐系统自动化持续优化📖标题:CORAL: An LLM-Native Harness for Production Recommender Systems 🌐来源:arXiv, 2609.02730v1
Dawson Zhu10 小时前
人工智能·语言模型·架构·aigc·agi
Agent 记忆调用的上下文感知:从“能召回“到“敢开口“的决策框架摘要:主流 Agent 记忆系统已在存储与检索的工程化上趋于成熟(分层上下文、向量/图召回、自动摘要),但普遍采用"召回即注入"的强耦合架构。本文指出,记忆调用的本质不是一个检索问题,而是一个上下文感知的决策问题:错配成本严重不对称(误用 >> 漏用),召回精度越高反而可能越冒犯。基于此,我们提出一套包含结构化标签、场景推断、三层闸门和用户控制面的决策框架,并给出可运行的工程实现、评估指标与落地路线。
wish36614 小时前
人工智能·语言模型·自然语言处理·local llm
EmployeeAssistant 智能问答服务:基于 pgvector 与 LLM 的企业知识库助手EmployeeAssistant 是一个面向企业员工的智能问答服务,采用原生 HTML/CSS/JavaScript 前端与 ASP.NET Core .NET 10 后端,结合 EF Core、PostgreSQL/pgvector 以及本地或组织批准的 LLM 服务,实现基于知识库的语义检索问答。系统根据员工提出的问题生成 embedding,从 PostgreSQL/pgvector 中检索最相关的知识库切块,并将检索内容、问题与引用来源一并发送给 chat 模型,通过 SSE 流式返回回答。服务
Dawson Zhu20 小时前
人工智能·语言模型·架构·aigc·agi
工作流与 Agent 的工程选型:从“控制权归属“看 LLM 应用架构本文从一道常见的 AI 工程化面试题出发——“什么时候用工作流?什么时候用 Agent?”——梳理工作流(Workflow)与智能体(Agent)的核心差异、适用边界、混合架构实践,以及工程选型时容易踩的"伪 Agent"误区。文章内容兼顾概念辨析与落地参考,适合从事 LLM 应用开发、RAG/agent 框架选型的工程师阅读。
差不多的周周1 天前
人工智能·深度学习·机器学习·计算机视觉·语言模型·音视频
《MotionLLM:从人体运动和视频理解人类行为》论文核心部分详解论文原标题:MotionLLM: Understanding Human Behaviors from Human Motions and Videos
纪伊路上盛名在1 天前
人工智能·语言模型·自然语言处理·蛋白质·通用模型·生物大分子·混合专家moe
Omni-Mol:用多模态大语言模型构建通用多任务分子模型参考:https://github.com/ChengxinHU/Omni-Mol 文献:https://arxiv.org/abs/2502.01074
云雀衔光1 天前
java·数据库·人工智能·redis·git·语言模型·飞书
多个 MCP Server 怎么编排:数据库 / Redis / Git / 飞书一把梭🔥 写在前面:单个 MCP Server 好写,但当你要让 AI 同时用上「数据库 + Redis + Git + 飞书」四个 Server 时,问题就来了:工具名撞车怎么办?权限边界怎么划?AI 该调哪个?这篇文章用一套编排规范 + 实测数据,把多 Server 的坑一次填平。
今年下半年2 天前
人工智能·语言模型·自然语言处理
从零开始搭建一套大语言模型 + LangGraph 多智能体编排 + RAG 知识库检索** 的智能问答平台本文档仅针对 chat_py_server(后端)与 chat_py_front(前端)两个项目。本系统是一个基于 大语言模型 + LangGraph 多智能体编排 + RAG 知识库检索 的智能问答平台,面向企业招商/政策等业务场景。
Dawson Zhu2 天前
人工智能·语言模型·架构·aigc·agi
从理论到工程化:构建可靠Agent系统的六大核心工件与实战指南随着大语言模型的快速发展,Agent(智能体)已成为连接LLM能力与真实业务场景的关键桥梁。然而,许多开发者在构建Agent时,往往陷入"Prompt工程"的迷思,认为只要写好提示词、接上API,就能得到一个稳定可靠的Agent系统。事实远非如此。
LearnYard2 天前
人工智能·学习·语言模型
技术博主实测:2026年大语言模型辅助学习工具横向对比在日常技术交流中,经常有读者问我:“博主,你现在用哪些AI工具辅助学习和技术研究?”作为一名关注AI技术发展的博主,过去一年我陆续测试了多款AI辅助学习工具,涉及论文阅读、代码学习、知识整理等不同场景。这篇文章就把我的实测体验整理出来,供有类似需求的技术学习者参考。
吴佳浩 Alben2 天前
大数据·人工智能·语言模型·架构·自动化·ai编程·devops
构建企业级 DevOps 排错 Agent:从日志告警到自动化修复 PR作 者:吴佳浩(Alben) 微某信公众某号:全栈架构师笔记 系列专栏:《企业级 Agent———打造下一代智能体:企业级 Coding / DevOps Agent》· 第 02 篇
差不多的周周2 天前
人工智能·深度学习·机器学习·计算机视觉·语言模型·自然语言处理
《MoChat:面向多转弯动作理解和描述的关节分组时空接地多通道大语言模型》论文核心部分详解论文原标题:MoChat: Joints-Grouped Spatio-Temporal Grounding Multimodal Large Language Model for Multi-Turn Motion Comprehension and Description
Zzj_tju2 天前
人工智能·深度学习·机器学习·语言模型
小模型指令微调:数据混合、模板与过拟合的最小复现监督微调,即 SFT,是用输入及示范回答继续优化模型。预训练提供的能力、示范覆盖的任务、输出格式和评测方式共同决定收益,不能仅凭数据条数解释结果。
艾莉丝努力练剑2 天前
c++·人工智能·语言模型·自然语言处理·面试
【AI大模型接入SDK】Ollama本地大语言模型部署🎬 艾莉丝的简介:需结合业务功能需求与本地硬件配置(显存、内存、算力),选择适配参数量与量化等级的模型。
hrx-@@2 天前
人工智能·语言模型·开源·github
DSH 插件开发到上架:完整实操手册本文是一份技术实操文档:手把手讲清楚一个 DeepSeek Harness(DSH)插件从「是什么」到「做出来、调试好、发上 GitHub、进插件市场、发上 npm」的完整流程,包括每一步的细节、原理和注意事项。
吴佳浩 Alben3 天前
人工智能·语言模型·架构·自动化·ai编程
Agent 怎么做自动化评测?构建端到端的 Agent Evaluation 体系作 者:吴佳浩(Alben) 微某信公众某号:全栈架构师笔记 系列专栏:《企业级 Agent 实战指南————企业级 Agent 质量保障体系:Evaluation 与安全防线》· 第 01 篇
Dawson Zhu3 天前
人工智能·语言模型·架构·aigc·agi
从单体到联邦:多Agent架构的必要性与设计哲学在构建复杂的AI Agent系统时,我们常常面临一个架构抉择:是打造一个"全能"的单体Agent,通过集成多种工具调用(Tool Calling)来处理一切任务,还是将其拆分为多个职责单一的"子Agent",通过协同合作来完成目标?