transformer

程序猿编码2 小时前
c++·神经网络·transformer·大模型推理
零依赖纯手写:C++ 实现完整神经网络,张量反向传播全打通这是一套完全从零实现的基础神经网络库,全程采用纯C++编写,不依赖任何外部机器学习框架,完整覆盖多维张量运算、模块化网络层、前向传播、手动反向传播、损失函数计算全链路。
高洁0117 小时前
人工智能·深度学习·django·transformer·tornado
大模型的幻觉怎么治大模型的幻觉怎么治一、幻觉从哪来二、可溯源:让每句话有出处三、事实校验:生成后过一道关四、仍绕不开的硬限制五、治理是组合拳不是单招#人工智能 #大模型 #具身智能 #世界模型
大江东去浪淘尽千古风流人物1 天前
机器人·transformer·具身智能·机器人学习·视觉表示·patch policy·robodojo
【RoboDojo】机器人操作通用策略统一评估基准:42仿真+18现实任务×异构并行深度解析通用机器人操作策略发展迅速,但现有基准在系统性评估上存在局限——任务简单、短序列、能力覆盖窄,且仅在仿真或仅在现实中进行。仿真评估可扩展但缺失物理部署挑战,现实评估成本高、耗时且难以复现。RoboDojo 提出统一的仿真-现实评估基准,包含 42 个仿真任务和 18 个现实任务,覆盖五大能力维度(泛化、记忆、精度、长序列、开放式),通过 Isaac Sim 异构并行仿真实现可扩展反馈,通过 RoboDojo-RealEval 提供可复现的现实评估系统(云端访问、标准化硬件、场景重置、评估协议)。配合 XP
高洁012 天前
人工智能·深度学习·transformer·知识图谱·tornado
孪生不止在工厂:能源、医疗与农业孪生不止在工厂:能源、医疗与农业一、能源:让电网和设备可见二、医疗:从器官到流程三、农业:让田地会"说话"四、跨行业的共同难点五、别照搬工业那套#数字孪生 #数字化转型 #能源数字化 #智慧医疗
布吉岛的石头2 天前
人工智能·深度学习·transformer
Java 程序员第 48 阶段15:Transformer 架构总览与自注意力直觉,注意力权重可视化:用 Java 打印注意力矩阵理解模型在看什么大模型整体是黑盒,但注意力分数是少数可解释的窗口。通过看每个 token 关注哪些位置、关注强度如何,你能直观理解模型「为什么这么想」——答对时验证它的逻辑,答错时定位它的偏差。
richard_first2 天前
人工智能·深度学习·语言模型·自然语言处理·transformer
第3章 PTQ:不用重新训练也能量化 LLM前两章我们已经知道:LLM 之所以需要量化,很大程度上是因为模型参数太多,高精度权重会带来巨大的存储和显存开销。例如一个 7B 模型,如果参数使用 FP16:
Allen_LVyingbo2 天前
网络·transformer·知识图谱·健康医疗
三甲医院医疗AI代码库管理系统研究(上)2025 年以来,以 DeepSeek、Qwen 等为代表的开源大模型在中国医疗行业出现规模化落地浪潮。据公开报道,全国已有上千家医院宣布完成 DeepSeek 开源模型的本地化部署,应用场景覆盖医学科研、辅助诊断、病历质控、智能导诊、医院运营管理等诊疗与管理全流程。头部三甲医院更是从「部署通用大模型」走向「自研专科大模型」:上海交通大学医学院附属瑞金医院联合华为发布病理大模型 RuiPath,将单张病理切片诊断时间从约 40 分钟缩短至秒级;四川大学华西医院发布「华西黉医」医学大模型,并打造 HAIP(
JAI科研3 天前
人工智能·深度学习·神经网络·yolo·目标检测·计算机视觉·transformer
YOLO 完全指南(七):YOLO识别工程化 (上)很多朋友在学会用 YOLO 做单张图片推理后,会觉得“模型能用了”。但当你真正要把视觉能力落地到业务里,问题才刚刚开始:
程序猿编码3 天前
c++·计算机视觉·大模型·transformer·rk3588·推理·ggml
扔掉 Python!纯 C++ 本地跑扩散 TTS,GGML 加持,支持 RK3588 NPU 加速这是一套完全原生C++实现的文本转语音(TTS)推理引擎,核心基于GGML轻量张量库构建,采用两阶段扩散式TTS架构:第一阶段由基于Qwen3骨干的扩散语言模型,将输入文本转换为离散音频编码;第二阶段由卷积编解码器将音频编码还原为24kHz语音波形。
Zentceh4 天前
人工智能·深度学习·计算机视觉·车载系统·transformer·无人机·智能硬件
AI-ISP vs 传统ISP全面对比摘要:AI-ISP(人工智能图像信号处理器)正在重塑夜视成像的技术边界。本文从 ISP Pipeline 架构、降噪策略、色彩还原、动态范围、功耗、延迟六个维度,系统对比 AI-ISP 与传统 ISP 的差异,并通过 0.001Lux 极微光环境下的实测数据给出量化结论。适合图像算法工程师、夜视设备选型人员和嵌入式开发者阅读。
tyler_download5 天前
深度学习·算法·transformer
揉扁搓圆transformer架构:NAG优化器算法详解上一节我们研究了sgd with momentum算法,在其基础上非常自然的就能过度到下一个优化算法NAG,全名叫Nestetrov accelerated gradient.它是对前者非常自然的过度。前面我们看到sgd with momentum算法的核心 思想就是,我们把前面前进的过程积累成一个惯性,如果当前我们落入到一个坑底(局部最优解),那么利用惯性就能冲出当前的坑底,也就是它有助于我们逃脱局部最优点,从而有机会找到全局最优点。
tiger8655 天前
人工智能·gpt·rnn·神经网络·自然语言处理·transformer·语音识别
深入理解状态空间模型 (SSM):RNN 与 Transformer 的优雅融合在深度学习的序列建模领域,我们长期面临一个核心问题:Transformer 的长序列建模能力很强,但计算复杂度随序列长度呈二次方增长。
大江东去浪淘尽千古风流人物6 天前
机器人·transformer·具身智能·机器人学习·视觉表示·patch policy
【Patch Policy】稠密视觉表示驱动的轻量级机器人策略深度解析机器人策略常把一帧图像压缩成 CLS token 或全局平均池化向量,虽然计算方便,却容易丢失插孔、边缘、接触点等精细空间信息;直接使用 patch token 的视觉语言动作模型又往往背负数十亿参数。论文《Patch Policy: Efficient Embodied Control via Dense Visual Representations》提出一个更轻量的中间方案:冻结预训练 Vision Transformer,保留每帧的 dense patch features,并用 block-cau
孙启超6 天前
开发语言·人工智能·后端·rust·llm·transformer
【AI开发之Rust】第 3 课:字符串与复合类型 —— 数据怎么放预计时间:75-90 分钟 | 难度:⭐⭐ | 前置:第 1-2 课(变量、类型、函数、控制流)写程序 80% 的时间在处理"数据往哪放、怎么取"。Rust 对数据容器的设计分得很清楚,它不像 Python 那样"字符串就是字符串,列表就是列表",而是把两个问题拆开:
June bug7 天前
人工智能·深度学习·transformer
【HCIA- AI(正课)】2.6.Transformer架构和Diffusion结构介绍Transformer架构、生成模型演进等内容讲解:核心内容:覆盖 Atlas 800、Atlas 900 等 IE 实验涉及的硬件内容,以及鲲鹏 920 芯片相关介绍。
richard_first7 天前
数据库·人工智能·自然语言处理·transformer·embedding
Transformer与大语言模型:第18章 向量数据库本章目标:理解向量数据库的工作原理,以及 HNSW、IVF、PQ 等索引算法。假设你有 100 万篇文章,每篇文章都有一个 768 维的 Embedding 向量。
程序猿编码7 天前
c++·llm·音视频·transformer·模型推理·ggml
LLM 技术迁移音频领域:基于 GGML 搭建 Roformer,端侧音乐人声分离实现详解这是一套纯C++实现的音乐源分离推理引擎,底层基于ggml轻量级张量计算库构建,完整支持BS Roformer与Mel-Band-Roformer两种主流音频分离架构,核心能力是从音乐音频中精准提取人声轨与伴奏轨。
程序猿编码8 天前
开发语言·c++·计算机视觉·大模型·transformer
纯C++轻量计算机视觉推理引擎:基于GGML的端侧CV模型部署技术全解析这是一套完全自包含的纯C++计算机视觉机器学习推理库,底层基于ggml轻量级张量计算库构建,沿用了大语言模型推理的轻量化设计思路,专注于端侧、低资源场景下的CV模型部署与推理。
运筹说8 天前
人工智能·深度学习·transformer
运筹说 第160期 | 大模型如何“思考”? Transformer架构图解大语言模型为什么能够理解问题并生成连贯回答?当我们输入“为什么苹果会落到地面,而不是飞向天空?”时,模型能够结合问题中的关键信息,逐步生成关于地球引力的解释。这个过程并不是从预先存储的答案中直接检索结果,也不是先形成完整回答再一次性输出,而是在不断处理上下文、预测下一个Token 的过程中逐步形成的。