技术栈
语言模型
东方佑
6 小时前
人工智能
·
深度学习
·
语言模型
·
自然语言处理
·
架构
从《事件发生与智能》的框架看中国古代命理学
如果把前文的统一链条拿来观察中国古代命理学,可以得到一个比较清晰的定位:量子场→量子态→环境纠缠→退相干→经典概率→条件化→统计分布→信息处理→智能/文化涌现 \text{量子场} \rightarrow \text{量子态} \rightarrow \text{环境纠缠} \rightarrow \text{退相干} \rightarrow \text{经典概率} \rightarrow \text{条件化} \rightarrow \text{统计分布} \rightarrow \text{信息处理}
大模型任我行
10 小时前
人工智能
·
语言模型
·
自然语言处理
·
论文笔记
Meta:强化学习权重传输不再卡顿
📖标题:WeightBridge: An Efficient Weight Transfer Library for Reinforcement Learning 🌐来源:arXiv, 2609.25442v1
打工仔折腾 AI
14 小时前
人工智能
·
后端
·
python
·
深度学习
·
语言模型
·
bert
从Attention到BERT:双向预训练语言模型到底解决了什么问题
几年前我做过一个情感分类的小任务,数据量不大,大概几千条中文评论。当时第一反应是用 Word2Vec 训练词向量,再套一个 LSTM 做分类。结果跑出来准确率一直卡在 80% 出头,怎么调都上不去。
伞伞悦读
17 小时前
python
·
语言模型
从零打通 Hermes Agent:Windows + WSL2 + Clash 全链路安装、认证与首次实战
一篇从“Ubuntu 无法访问外网”开始,最终完成 Hermes Agent 安装、Nous Portal OAuth 登录、免费模型选择、本地终端后端配置、Playwright 浏览器验证与首次中文对话的完整实战记录。
Dawson Zhu
19 小时前
人工智能
·
语言模型
·
架构
·
aigc
·
agi
几何深度学习:原理解析与工程实践
几何深度学习(Geometric Deep Learning, GDL)是深度学习的一个重要分支方向,其核心目标是将数据中的几何结构(对称性)作为先验知识,通过群作用形式化地约束神经网络的设计,从而为卷积神经网络(CNN)、图神经网络(GNN)、Transformer、Deep Sets 等主流架构提供一个统一的数学理解框架。
Dawson Zhu
21 小时前
人工智能
·
语言模型
·
架构
·
aigc
·
agi
AI Agent架构选型建议
随着大语言模型(LLM)能力的快速演进,AI Agent(智能体)已成为大模型落地的重要形态之一。与传统的对话式AI不同,AI Agent能够感知环境、主动进行决策并执行动作,通过调用外部工具逐步完成用户给定目标。然而,面对不同的业务场景复杂度与控制力需求,应当如何选择合适的Agent架构?本文对七种主流AI Agent架构——单Agent、ReAct、Plan and Execute、Multi-Agent、Root + Skill、Blackboard以及Graph Workflow——进行系统性梳理
泡沫_花火
1 天前
语言模型
·
自然语言处理
·
面试
·
职场和发展
大模型开发相关岗位面试资料(含算法)
【资料包核心内容(对标截图)】 一、 硬核项目实战 问答Agent项目:从提纲到详细展开(4个文档),手把手教你如何说明大模型落地项目。 零售行业评价推荐系统项目:完整的项目展开,面试必问的推荐系统实战。 二、 大模型 & 算法基础 大模型专区:AI大模型面试总结、补充与项目解析(含大模型知识细节补充)。 基础算法:机器学习、深度学习、自然语言处理(NLP)面试总结。 思维导图:附赠ML、DL、NLP高清思维导图(PNG),帮你快速建立知识树,面试前快速复盘。 三、 面试软技能 简历模板:直接套用,让你的
richard_first
1 天前
人工智能
·
深度学习
·
语言模型
·
自然语言处理
·
transformer
第19章 RAG(Retrieval-Augmented Generation)
本章目标:理解 RAG 的完整流程,包括 Chunk、Embedding、Retrieval、Reranker 和 Prompt 设计。
硅谷秋水
2 天前
人工智能
·
机器学习
·
计算机视觉
·
语言模型
·
机器人
WLA³:面向语义、动力学与运动学的世界潜动作建模
26年9月来自京东集团研究院的论文“WLA³: WORLD LATENT ACTION MODELING FOR SEMANTICS, DYNAMICS, AND KINEMATICS”。
空 白II
2 天前
人工智能
·
语言模型
·
自然语言处理
9.30 大语言模型研究简报:Claude Sonnet 5.5:更快、更便宜的 Agent 模型
机构: Anthropic 发布时间: 北京时间 2026 年 9 月 29 日 02:00Anthropic 正式发布 Claude Sonnet 5.5。这一代的重点并不是扩大模型规模,而是提升 Agent 与 coding 任务中的执行效率:更少的 token、更少的工具调用、更短的任务完成时间,同时保持接近旗舰模型的能力。
东方佑
2 天前
人工智能
·
语言模型
·
自然语言处理
权重绑定深度语言模型:深度缩放、免费早退与一个基本权衡
草稿 v2 | 2026-09-29 | 基于 DEQ-LM v1→v11 十一个版本、7.27M/23M 两个规模、约 18 小时 GPU 实验
老板一杯拿铁
2 天前
ai
·
语言模型
·
chatgpt
·
ai编程
Codex 怎么安装?从下载安装到登录使用,新手图文教程
本文面向第一次使用桌面端 AI 编程助手的读者,介绍下载、安装、网络准备、登录验证和功能使用等操作步骤。文档核对日期:2026 年 9 月 29 日。产品入口与功能可能调整,请以官方页面及账号实际显示为准。
男孩李
2 天前
语言模型
浅谈RAG与知识问答
RAG(Retrieval-Augmented Generation,检索增强生成)融合了智能检索与知识库技术,通过知识库驱动内容生成,具备强大的可解释性和深度定制能力。应用可通过接入Data Augmentation Kit提供的RAG能力,快速实现知识问答、智慧助手等业务场景。本模块还支持通过模板灵活配置RAG运行的核心参数,实现全流程的深度定制。
压码路
2 天前
爬虫
·
语言模型
·
boss直聘
BOSS直聘网页端研究【2026年9月】
该文章古法创作,未使用ai,有耐心看完的请三连!本人从2022年开始因为一个私活开始研究boss直聘,一晃已经4年过去了,也经历boss网页端的几次升级(具体可以看我博客的其它几篇关于boss直聘的文章),最早的前端代码可读性还是很强的,甚至于还有中文注释,随着前端框架的升级,现在的代码都是打包压缩后的chunk,甚至还用上wasm,现在又增加开发者工具检测,如果你用playwright之类的无头浏览器去访问,立刻就能被识别,一旦做登录操作,页面就会自动关闭。下面是我遇到一些问题和解决方案。
硅谷秋水
2 天前
人工智能
·
深度学习
·
机器学习
·
语言模型
·
transformer
Looped Transformer的来源和发展
Looped Transformer 从“让模型学会反复计算”的架构设计,发展为推理时扩展计算量的方法,进一步走向对循环位置、次数和实际计算成本的联合优化。
audyxiao001
3 天前
人工智能
·
语言模型
·
多模态
·
时间序列
让大语言模型先读懂外部事件:一种文本增强与正则扩散对齐的多模态时序预测框架
本文分享一篇2026年人工智能领域国际期刊Knowledge-Based Systems发表的论文《TRDA-TS: Text reinforcement and regularized diffusion alignment for LLM-empowered multimodal time series forecasting》。该论文针对大语言模型用于多模态时间序列预测时,外部事件文本利用不足以及文本与数值时序之间存在跨模态错配等问题,提出了TRDA-TS预测框架。该模型首先在数值分支中提取多尺度和
Dawson Zhu
3 天前
人工智能
·
语言模型
·
架构
·
aigc
·
agi
大模型推理的三维本质:原理解析与工程实践
大语言模型(LLM)的推理效率直接决定了其从实验室走向规模化部署的可行性。然而,工业界对推理瓶颈的认知长期停留在"GPU算力不够"的表层,忽视了推理阶段内在的结构性矛盾。本文基于对大模型推理阶段的系统性分析框架,从数学本质(自回归生成的马尔可夫链过程)、系统本质(Prefill与Decode两阶段交替的计算/访存异构性)和数据本质(KV Cache生命周期管理)三个维度,剖析推理性能瓶颈的根源,并梳理FlashAttention、PagedAttention、连续批处理、投机解码、权重量化等核心工程优化技
云和数据.ChenGuang
3 天前
人工智能
·
深度学习
·
机器学习
·
语言模型
·
fastapi
langchain4j的RAG入门
LangChain‑Python 有 RecursiveCharacterTextSplitter;但 LangChain4j(Java)1.8.x 没有叫这个名字的公开类!
Funny_AI_LAB
3 天前
人工智能
·
经验分享
·
语言模型
·
重构
重构 Coding Agent:当 LLM 没有 KV Cache 时,上下文工程该怎么做?
如果有一天,大语言模型(LLM)的 KV Cache 彻底消失,你会如何重新设计一个 Coding Agent?
Xuantong_90
3 天前
人工智能
·
语言模型
·
重构
拆解 Claude Sonnet5.5 底层设计:自适应思考、子智能体协同,Anthropic 如何重构中端大模型推理范式
2026 年 9 月 28 日,Anthropic 正式发布 Claude Sonnet5.5,这一代模型最值得深挖的不是跑分数字,而是底层推理架构的调整。在 Sonnet5.5 身上,Anthropic 把 “自适应思考(Adaptive Thinking)” 作为默认机制,再加上原生支持多子智能体协同,彻底改变了 Sonnet 系列过去 “单轮静态推理” 的模式。理解这套底层设计,才能看懂为什么它在编码、多步骤任务上实现越级表现,同时理解它存在的短板根源。