语言模型

Dawson Zhu1 小时前
人工智能·语言模型·架构·aigc·agi
智能体记忆系统:原理解析与工程实践大语言模型(LLM)作为当前 AI 智能体的核心引擎,其上下文窗口(Context Window)的有限性始终是制约长周期、复杂任务执行的关键瓶颈。尽管模型本身的上下文容量在持续扩大(从 4K 到 128K 甚至更高),但"大海捞针"(Lost in the Middle)问题和上下文越长噪声越大的现象表明,单纯扩大窗口并非最优解。
YOLO数据集集合4 小时前
人工智能·yolo·目标检测·语言模型·铁路缺陷·轨道缺陷
大模型融合YOLO铁路要素缺陷分析系统 | 铁路缺陷检测 YOLO DeepSeek 大语言模型 智能巡检 9141期本系统是一个基于深度学习的铁路要素缺陷检测与分析平台,采用 YOLO目标检测算法 结合大语言模型(DeepSeek、Qwen),实现智能化的铁路缺陷识别与分析。系统支持图像、视频和实时摄像头检测,并提供AI智能分析建议。
大模型任我行4 小时前
人工智能·语言模型·自然语言处理·论文笔记
阿里:通义千问3.8全能版发布📖标题:Qwen3.8-Omni: Towards Native Omni-Modal Agents 🌐来源:arXiv, 2609.25611v1
Dawson Zhu4 小时前
人工智能·语言模型·架构·aigc·agi
大语言模型对齐与微调:原理解析与工程实践当前大语言模型(LLM)的训练范式已形成一套相对成熟的四阶段流水线:预训练(Pre-Training, PT)、指令微调(Supervised Fine-Tuning, SFT)、偏好对齐(Preference Alignment)以及能力精化(Capability Refinement)。其中,PT阶段通过海量无标注文本学习语言统计规律与世界知识,是模型能力的基石;SFT阶段通过人工构建的指令-回答对赋予模型对话格式与指令跟随能力,是构建对话模型的关键环节;偏好对齐阶段旨在使模型输出符合人类价值观与偏好
东方芷兰7 小时前
java·笔记·python·语言模型·自然语言处理
Agent 技术摘要 05 —— BP、SaaS、B2B、C2B、B2C本系列为笔者在实习过程中的所见所闻记录,内容为技术摘要,旨在提供关于Agent领域相关技术名词的通俗和简要介绍,详细内容暂不展开,供同在该领域进修的童鞋们参考。
Dawson Zhu9 小时前
人工智能·语言模型·架构·aigc·agi
Agent上下文压缩的“状态保真“取舍框架解读在长任务 Agent 的工程化落地中,上下文管理是一个被长期低估的核心问题。随着 Agent 运行时间的增长,上下文窗口中不断累积系统提示词、用户指令、工具调用结果、中间推理过程和外部检索数据,最终导致 Token 成本飙升、模型注意力分散、关键信息被淹没,甚至触发上下文窗口溢出而中断执行。
Dawson Zhu9 小时前
人工智能·语言模型·架构·aigc·agi
Cookbook Agent:拓扑Codebook方法与多Agent通信效率优化在多智能体(Multi-Agent)系统中,智能体之间的通信拓扑结构直接决定了协作效率与系统性能。传统的拓扑设计方法要么依赖人工预设(如链式、树形、全连接等固定结构),要么依赖在线实时搜索(如扩散模型连续生成、GNN打分排序等),面临延迟高、Token消耗大、可扩展性差等工程落地瓶颈。
东方佑18 小时前
人工智能·深度学习·语言模型·自然语言处理·架构
从《事件发生与智能》的框架看中国古代命理学如果把前文的统一链条拿来观察中国古代命理学,可以得到一个比较清晰的定位:量子场→量子态→环境纠缠→退相干→经典概率→条件化→统计分布→信息处理→智能/文化涌现 \text{量子场} \rightarrow \text{量子态} \rightarrow \text{环境纠缠} \rightarrow \text{退相干} \rightarrow \text{经典概率} \rightarrow \text{条件化} \rightarrow \text{统计分布} \rightarrow \text{信息处理}
大模型任我行1 天前
人工智能·语言模型·自然语言处理·论文笔记
Meta:强化学习权重传输不再卡顿📖标题:WeightBridge: An Efficient Weight Transfer Library for Reinforcement Learning 🌐来源:arXiv, 2609.25442v1
打工仔折腾 AI1 天前
人工智能·后端·python·深度学习·语言模型·bert
从Attention到BERT:双向预训练语言模型到底解决了什么问题几年前我做过一个情感分类的小任务,数据量不大,大概几千条中文评论。当时第一反应是用 Word2Vec 训练词向量,再套一个 LSTM 做分类。结果跑出来准确率一直卡在 80% 出头,怎么调都上不去。
伞伞悦读1 天前
python·语言模型
从零打通 Hermes Agent:Windows + WSL2 + Clash 全链路安装、认证与首次实战一篇从“Ubuntu 无法访问外网”开始,最终完成 Hermes Agent 安装、Nous Portal OAuth 登录、免费模型选择、本地终端后端配置、Playwright 浏览器验证与首次中文对话的完整实战记录。
Dawson Zhu1 天前
人工智能·语言模型·架构·aigc·agi
几何深度学习:原理解析与工程实践几何深度学习(Geometric Deep Learning, GDL)是深度学习的一个重要分支方向,其核心目标是将数据中的几何结构(对称性)作为先验知识,通过群作用形式化地约束神经网络的设计,从而为卷积神经网络(CNN)、图神经网络(GNN)、Transformer、Deep Sets 等主流架构提供一个统一的数学理解框架。
Dawson Zhu1 天前
人工智能·语言模型·架构·aigc·agi
AI Agent架构选型建议随着大语言模型(LLM)能力的快速演进,AI Agent(智能体)已成为大模型落地的重要形态之一。与传统的对话式AI不同,AI Agent能够感知环境、主动进行决策并执行动作,通过调用外部工具逐步完成用户给定目标。然而,面对不同的业务场景复杂度与控制力需求,应当如何选择合适的Agent架构?本文对七种主流AI Agent架构——单Agent、ReAct、Plan and Execute、Multi-Agent、Root + Skill、Blackboard以及Graph Workflow——进行系统性梳理
泡沫_花火2 天前
语言模型·自然语言处理·面试·职场和发展
大模型开发相关岗位面试资料(含算法)【资料包核心内容(对标截图)】 一、 硬核项目实战 问答Agent项目:从提纲到详细展开(4个文档),手把手教你如何说明大模型落地项目。 零售行业评价推荐系统项目:完整的项目展开,面试必问的推荐系统实战。 二、 大模型 & 算法基础 大模型专区:AI大模型面试总结、补充与项目解析(含大模型知识细节补充)。 基础算法:机器学习、深度学习、自然语言处理(NLP)面试总结。 思维导图:附赠ML、DL、NLP高清思维导图(PNG),帮你快速建立知识树,面试前快速复盘。 三、 面试软技能 简历模板:直接套用,让你的
richard_first2 天前
人工智能·深度学习·语言模型·自然语言处理·transformer
第19章 RAG(Retrieval-Augmented Generation)本章目标:理解 RAG 的完整流程,包括 Chunk、Embedding、Retrieval、Reranker 和 Prompt 设计。
硅谷秋水2 天前
人工智能·机器学习·计算机视觉·语言模型·机器人
WLA³:面向语义、动力学与运动学的世界潜动作建模26年9月来自京东集团研究院的论文“WLA³: WORLD LATENT ACTION MODELING FOR SEMANTICS, DYNAMICS, AND KINEMATICS”。
空 白II2 天前
人工智能·语言模型·自然语言处理
9.30 大语言模型研究简报:Claude Sonnet 5.5:更快、更便宜的 Agent 模型机构: Anthropic 发布时间: 北京时间 2026 年 9 月 29 日 02:00Anthropic 正式发布 Claude Sonnet 5.5。这一代的重点并不是扩大模型规模,而是提升 Agent 与 coding 任务中的执行效率:更少的 token、更少的工具调用、更短的任务完成时间,同时保持接近旗舰模型的能力。
东方佑2 天前
人工智能·语言模型·自然语言处理
权重绑定深度语言模型:深度缩放、免费早退与一个基本权衡草稿 v2 | 2026-09-29 | 基于 DEQ-LM v1→v11 十一个版本、7.27M/23M 两个规模、约 18 小时 GPU 实验
老板一杯拿铁2 天前
ai·语言模型·chatgpt·ai编程
Codex 怎么安装?从下载安装到登录使用,新手图文教程本文面向第一次使用桌面端 AI 编程助手的读者,介绍下载、安装、网络准备、登录验证和功能使用等操作步骤。文档核对日期:2026 年 9 月 29 日。产品入口与功能可能调整,请以官方页面及账号实际显示为准。
男孩李2 天前
语言模型
浅谈RAG与知识问答RAG(Retrieval-Augmented Generation,检索增强生成)融合了智能检索与知识库技术,通过知识库驱动内容生成,具备强大的可解释性和深度定制能力。应用可通过接入Data Augmentation Kit提供的RAG能力,快速实现知识问答、智慧助手等业务场景。本模块还支持通过模板灵活配置RAG运行的核心参数,实现全流程的深度定制。