语言模型

日月新著2 小时前
人工智能·语言模型
2026年最新!五款高评Agent开源模型介绍:能自主干活的AI来了如果你最近用过 Gemma4 或者 Qwen3.6,应该对它们聊天的能力不陌生——问什么答什么,逻辑清晰,表达流畅,像身边有一个随叫随到的知识顾问。
硅谷秋水6 小时前
人工智能·深度学习·机器学习·计算机视觉·语言模型·机器人
ABot-M0.5:统一的移动-与-操作世界动作模型26年7月来自阿里高德视觉实验室(AMAP CV Lab)的论文“ABot-M0.5: Unified Mobility-and-Manipulation World Action Model”。
BerrySen1788 小时前
人工智能·语言模型·架构
迈向通用人工智能的桥梁:大语言模型驱动的 AI Agent(智能体)全景架构与源码级实战指南作者:AI技术专家与架构师 发布时间:2026年7月 适合人群:AI工程开发人员、大模型算法工程师、系统架构师及对通用人工智能(AGI)感兴趣的工程人员。
AIGC安琪12 小时前
人工智能·ai·语言模型·大模型·agent·workflow·大模型学习
同样接入大模型,如何抉择 Workflow 与 Agent?面试官上周四问了我这个问题,当时我一下子卡壳了。老实说,我之前没有认真理清二者的边界,只是Agent这个概念热度很高、听起来新潮,自己也更熟悉,于是想都没想,直接把它放进了产品方案里。
BerryS3N1 天前
人工智能·语言模型·架构
迈向通用人工智能:大语言模型(LLM)架构、核心机制、高级RAG与Agent智能体开发全景指南在人工智能的发展长河中,自然语言处理(NLP)经历了从基于规则的专家系统、统计语言模型(以隐马尔可夫模型和CRF为代表),到深度学习时代(RNN、LSTM)的演进。然而,直到2017年Transformer架构的横空出世,以及随后GPT系列模型的爆发,才真正开启了“大语言模型(Large Language Model, LLM)”的黄金时代。
学习中.........10 小时前
人工智能·机器学习·语言模型·自然语言处理
从 Karpathy 手写 BPE 到 CS336 `train_bpe` 作业实现这次 train_bpe 的实现过程,大体分成两个阶段:参考视频是 Karpathy 的手写 tokenizer 讲解:Bilibili 视频链接。
蓦然回首却已人去楼空1 天前
人工智能·语言模型·自然语言处理
Build a Large Language Model (From Scratch) 第五章 在无标签数据上进行预训练本章内容到目前为止,我们已经实现了数据采样和注意力机制,并编写了大语言模型架构的代码。是时候实现训练函数并对大语言模型进行预训练了。在本章中,我们将学习基本的模型评估技术,以衡量生成文本的质量,这是在训练过程中优化大语言模型的必要条件。此外,我们还将讨论如何加载预训练权重,为大语言模型微调奠定扎实的基础。图 5-1 概述了我们的整体计划,并强调了本章将讨论的内容。
大模型任我行1 天前
人工智能·语言模型·自然语言处理·论文笔记
蚂蚁:智能体安全护栏SingGuard-NSFA📖标题:SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification 🌐来源:arXiv, 2607.13081v1
zhangfeng11331 天前
c++·人工智能·语言模型·算子开发
Ascendc 大语言模型框架 AscendCraft 和pypto 的区别 pypto生成算子c++源码吗会生成 AscendC(昇腾专用算子C++)源码PyPTO Python API → 多层计算IR(Tensor/Tile/Block)→ 人工可调优化Pass → 生成AscendC源码 → NPU二进制 全程开发者可以在IR任意阶段介入、修改调优参数。
user-猴子1 天前
人工智能·语言模型·大模型·prompt
AiPy + Kimi K3:2048小游戏生成的技术分析从任务拆解、算法实现到一次生成可用,拆解2.8万亿参数模型在游戏开发场景中的实际表现。最近在AiPy中切换了Kimi K3模型,以2048小游戏为测试用例,验证其在代码生成任务中的实际表现。2048是一个经典的滑动合并游戏,规则明确但实现中包含典型的数据结构操作和交互逻辑,适合作为评估模型编程能力的基准。
phltxy1 天前
大数据·人工智能·python·深度学习·语言模型·langchain
LangGraph智能租房助手实践当一个 AI 应用从“回答问题”走向“完成任务”,难点就不再只是把提示词写得更好。它需要理解用户意图、查询外部数据、在关键步骤等待人工确认、记住跨会话信息,还要能够被调试、部署和持续迭代。
winrisef1 天前
人工智能·语言模型·chatgpt·codex
ChatGPT/Codex最新版本出错了,无法进入解决方案然后直接GPT炸了,无论是重装Chat GPT还是重置都不能够解决,一进去就是这个问题,最终发现问题所在,解决方案如下:
林泽毅2 天前
人工智能·python·深度学习·机器学习·语言模型
PyTRIO快速入门(一):概念、推理与训练TRIO的中文是“三重奏”,指的是三个演奏家通力合作,完成一场精彩的表演。而在PyTRIO中,指的是AI训练的三个底层计算:forward(前向传播)、backward(反向传播)、optim(优化器迭代) 。无论训练范式如何变换,这哥仨从未离开。
刘小八3 天前
人工智能·python·语言模型
RAG 文档切分不是越细越好:选择 Chunk Size 与 OverlapRAG 项目中最容易被低估的步骤不是向量数据库选型,而是文档切分。原文进入模型之前先被拆成 Chunk,随后每个 Chunk 生成向量、参与召回并被拼入上下文。切得过大,一个块同时包含多个主题,向量被平均,检索命中后还携带大量无关内容;切得过小,定义、前提、例外和代码解释被分散,模型虽然找到关键词,却无法回答完整问题。
大模型任我行4 天前
人工智能·语言模型·自然语言处理·论文笔记
阿里:端到端文档解析模型OvisOCR2📖标题:OvisOCR2 Technical Report 🌐来源:arXiv, 2607.13639v1
KAU的云实验台4 天前
人工智能·语言模型·自然语言处理
【研究分享】大语言模型 × 进化计算新范式? —— 以ReEvo为例拆解本文核心内容最近KAU研究了大语言模型和进化算法的结合相关论文,发现这个方向挺有意思,让我觉得LLM能够给进化计算加上“语义上的方向感”,该领域的研究进展也是日新月异。 因此,本文KAU对该研究方向作一些个人层面的梳理与分享,供大家参考讨论 (如有错漏,欢迎随时拍砖指正)
硅谷秋水4 天前
人工智能·深度学习·机器学习·计算机视觉·语言模型
PhyGround:生成式世界模型中的物理推理基准测试26年5月来自美国东北大学、Tulane大学、华盛顿大学和CMU的论文“PhyGround: Benchmarking Physical Reasoning in Generative World Models”。
许可可可可4 天前
语言模型
英伟达到昇腾训练迁移:并行配置等问题英伟达(ms-swift)与昇腾(MindSpeed-LLM)的并行维度约束公式不同,脚本无法直接复用。
羊羊小栈5 天前
人工智能·算法·语言模型·自然语言处理·毕业设计·neo4j·大作业
基于GraphRAG的税务财务智能问答系统(Neo4j_大语言模型)b站演示视频与部署教程视频(点击这里) https://www.bilibili.com/video/BV1asK26PEsu/?share_source=copy_web&vd_source=31c839f46a9a845dd6dd641cbd5c2ac1