语言模型

蓦然回首却已人去楼空14 小时前
人工智能·语言模型·自然语言处理
Build a Large Language Model (From Scratch) 第五章 在无标签数据上进行预训练本章内容到目前为止,我们已经实现了数据采样和注意力机制,并编写了大语言模型架构的代码。是时候实现训练函数并对大语言模型进行预训练了。在本章中,我们将学习基本的模型评估技术,以衡量生成文本的质量,这是在训练过程中优化大语言模型的必要条件。此外,我们还将讨论如何加载预训练权重,为大语言模型微调奠定扎实的基础。图 5-1 概述了我们的整体计划,并强调了本章将讨论的内容。
大模型任我行13 小时前
人工智能·语言模型·自然语言处理·论文笔记
蚂蚁:智能体安全护栏SingGuard-NSFA📖标题:SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification 🌐来源:arXiv, 2607.13081v1
zhangfeng113317 小时前
c++·人工智能·语言模型·算子开发
Ascendc 大语言模型框架 AscendCraft 和pypto 的区别 pypto生成算子c++源码吗会生成 AscendC(昇腾专用算子C++)源码PyPTO Python API → 多层计算IR(Tensor/Tile/Block)→ 人工可调优化Pass → 生成AscendC源码 → NPU二进制 全程开发者可以在IR任意阶段介入、修改调优参数。
user-猴子1 天前
人工智能·语言模型·大模型·prompt
AiPy + Kimi K3:2048小游戏生成的技术分析从任务拆解、算法实现到一次生成可用,拆解2.8万亿参数模型在游戏开发场景中的实际表现。最近在AiPy中切换了Kimi K3模型,以2048小游戏为测试用例,验证其在代码生成任务中的实际表现。2048是一个经典的滑动合并游戏,规则明确但实现中包含典型的数据结构操作和交互逻辑,适合作为评估模型编程能力的基准。
phltxy1 天前
大数据·人工智能·python·深度学习·语言模型·langchain
LangGraph智能租房助手实践当一个 AI 应用从“回答问题”走向“完成任务”,难点就不再只是把提示词写得更好。它需要理解用户意图、查询外部数据、在关键步骤等待人工确认、记住跨会话信息,还要能够被调试、部署和持续迭代。
winrisef1 天前
人工智能·语言模型·chatgpt·codex
ChatGPT/Codex最新版本出错了,无法进入解决方案然后直接GPT炸了,无论是重装Chat GPT还是重置都不能够解决,一进去就是这个问题,最终发现问题所在,解决方案如下:
林泽毅2 天前
人工智能·python·深度学习·机器学习·语言模型
PyTRIO快速入门(一):概念、推理与训练TRIO的中文是“三重奏”,指的是三个演奏家通力合作,完成一场精彩的表演。而在PyTRIO中,指的是AI训练的三个底层计算:forward(前向传播)、backward(反向传播)、optim(优化器迭代) 。无论训练范式如何变换,这哥仨从未离开。
刘小八3 天前
人工智能·python·语言模型
RAG 文档切分不是越细越好:选择 Chunk Size 与 OverlapRAG 项目中最容易被低估的步骤不是向量数据库选型,而是文档切分。原文进入模型之前先被拆成 Chunk,随后每个 Chunk 生成向量、参与召回并被拼入上下文。切得过大,一个块同时包含多个主题,向量被平均,检索命中后还携带大量无关内容;切得过小,定义、前提、例外和代码解释被分散,模型虽然找到关键词,却无法回答完整问题。
大模型任我行3 天前
人工智能·语言模型·自然语言处理·论文笔记
阿里:端到端文档解析模型OvisOCR2📖标题:OvisOCR2 Technical Report 🌐来源:arXiv, 2607.13639v1
KAU的云实验台4 天前
人工智能·语言模型·自然语言处理
【研究分享】大语言模型 × 进化计算新范式? —— 以ReEvo为例拆解本文核心内容最近KAU研究了大语言模型和进化算法的结合相关论文,发现这个方向挺有意思,让我觉得LLM能够给进化计算加上“语义上的方向感”,该领域的研究进展也是日新月异。 因此,本文KAU对该研究方向作一些个人层面的梳理与分享,供大家参考讨论 (如有错漏,欢迎随时拍砖指正)
硅谷秋水4 天前
人工智能·深度学习·机器学习·计算机视觉·语言模型
PhyGround:生成式世界模型中的物理推理基准测试26年5月来自美国东北大学、Tulane大学、华盛顿大学和CMU的论文“PhyGround: Benchmarking Physical Reasoning in Generative World Models”。
许可可可可4 天前
语言模型
英伟达到昇腾训练迁移:并行配置等问题英伟达(ms-swift)与昇腾(MindSpeed-LLM)的并行维度约束公式不同,脚本无法直接复用。
羊羊小栈5 天前
人工智能·算法·语言模型·自然语言处理·毕业设计·neo4j·大作业
基于GraphRAG的税务财务智能问答系统(Neo4j_大语言模型)b站演示视频与部署教程视频(点击这里) https://www.bilibili.com/video/BV1asK26PEsu/?share_source=copy_web&vd_source=31c839f46a9a845dd6dd641cbd5c2ac1
看-是灰机5 天前
linux·开发语言·后端·docker·语言模型·golang·飞书
使用go语言实现对接目标: Alertmanager告警后对接AI模型,处理完成后发送到飞书群处理返回Alertmanager
大模型码小白6 天前
java·开发语言·人工智能·windows·语言模型·list·ai编程
JAVA 集合框架进阶:List 与 Set 的深度解析与实战在 Java 编程中,集合框架(Collections Framework)是处理对象组最核心的 API。List 和 Set 作为其中最常用、最基础的两个接口,深刻理解它们的特性、差异以及适用场景,是每一位 Java 开发者进阶的必经之路。本文将从底层实现、性能对比、使用场景和实战技巧等多个维度,对 List 和 Set 进行深度解析,并通过代码示例展示如何在实际项目中做出最佳选择。
卖微积分的男孩6 天前
人工智能·语言模型·自然语言处理
【论文精读】Tapered Language Models|锥形语言模型论文地址:Tapered Language Models包括Transformer、RNN和基于记忆机制的各类变体在内的现代语言模型,都采用了一种通用的架构:由若干结构完全相同的层堆叠而成,在深度方向上均匀分配参数。但是现在的一些研究表明,不同层对最后输出的贡献是非均匀的:深层更多在于细化残差流(residual stream),而非对其进行转化。为此,作者提出参数容量是否反映出了这种不对称性。
QN1幻化引擎6 天前
人工智能·语言模型·架构
认知架构调度与语言模型辅助:DalinX V8 Track 1 实验报告摘要:本文报告了 DalinX V8 认知架构在 Track 1 管线中的系统性评测结果。我们建立了完整的评测基础设施——灵鉴(LingJian) C1-C12 场态内探框架、SFA Bridge Server 推理服务、以及三组对比实验管线。核心发现:(1) DalinX 场态在无任何 LLM 辅助的评测态下,综合意识指数 CI=0.7553(C级),认知相干增益 +168.4% vs 随机噪声;(2) 将场态编码为文本级认知前缀注入 LLM 的尝试,对 0.5B 和 3B 模型均产生负面效果(字数 -
大模型任我行6 天前
人工智能·语言模型·自然语言处理·论文笔记
腾讯:预测散度掩码提升LLM强化学习📖标题:Predictive Divergence Masks for LLM RL 🌐来源:arXiv, 2607.10848v1
phltxy6 天前
人工智能·深度学习·语言模型·langchain
LangChain文本向量与检索器实践大语言模型擅长理解和生成语言,却不会自动知道企业内部的制度、项目文档或昨天刚更新的数据。要让模型回答这些问题,关键不是继续堆叠提示词,而是建立一条稳定的数据通路:把文档变成可比较的向量,存入适合相似度检索的存储,再把检索结果交给模型生成答案。
phltxy6 天前
服务器·人工智能·深度学习·语言模型·langchain
LangChain从模型输出到RAG数据管道实战大模型能够生成自然、连贯的文本,但真正把它接入业务系统时,仅仅“能回答问题”远远不够。程序需要稳定的数据结构,知识库需要统一的文档对象,检索系统还要把长文档切成大小合适、语义完整的片段。