语言模型

AI浩36 分钟前
人工智能·语言模型·自然语言处理
Migician:揭示多模态大语言模型中自由形式多图定位的魔力https://arxiv.org/pdf/2501.05767多模态大语言模型(MLLMs)的最新进展显著提升了其对单图像的细粒度感知能力以及对多图像的一般理解能力。然而,现有的 MLLMs 在复杂的多图场景中实现精确定位(Grounding)方面仍面临挑战。为此,我们首先探索了一种思维链(CoT)框架,将单图定位与多图理解相结合。虽然该方法部分有效,但由于其非端到端的特性,仍然不稳定且难以捕捉抽象的视觉信息。因此,我们推出了 Migician,这是首个能够在多张图像间执行自由形式且精确定位的模型。为支
硅谷秋水38 分钟前
人工智能·机器学习·语言模型·自然语言处理
从语言模型到作用于世界的系统:智能体AI在数字、社交、虚拟及物理环境中的进展与局限26年9月的综述论文“From Language Models to World-Acting Systems: Progress and Limits of Agentic AI across Digital, Social, Virtual, and Physical Environments”。
喜欢打篮球的普通人1 小时前
语言模型
MiniMind 学习笔记(二):Pretrain 导言——从零理解 LLM,先想清楚这几个问题学习 LLM 最容易犯的错误,就是一头扎进训练代码的局部细节里。这一章的目标不是立刻进入大模型细节,而是先回答一个更基础的问题:当我们说"从零开始理解一个 LLM 的预训练流程"时,到底需要先想清楚哪些问题?
Carl_奕然4 小时前
人工智能·设计模式·语言模型
【智能体】Loop 的四种设计模式之:Agent Loop(2026 最新版)小屌丝:鱼哥,我昨天上线了一个 Agent,让它"帮我把这周的周报整理出来发群里"。结果你猜怎么着?小鱼:它给你把周报写得天花乱坠?
艾莉丝努力练剑4 小时前
网络·c++·人工智能·学习·语言模型
【AI大模型接入SDK】ChatSDK架构设计与实现🎬 艾莉丝的简介:通俗类比:做菜场景项目原有三大独立模块:会话管理内部持有数据管理对象,会话管理与数据管理可以视作一个逻辑单元。
user_admin_god8 小时前
java·人工智能·spring boot·语言模型
第 10 篇:拼上下文与生成——预算、边界与防幻觉第 09 篇结尾留了一句:把挑出来的几条拼成提示词,还有它自己的问题—— 总共能放多少字、超了砍谁、资料不够时怎么让模型坦白说不知道。 这一篇就用实测把这三件事逐个定下来。
奇思妙想聪明勤奋的小羊6 天前
人工智能·python·学习·语言模型
DeepAgents第5章:子Agent 与上下文隔离—让 Agent学会委派第四章Agent的任务规划解决了“复杂任务如何拆分和记录进度”的问题,但如果所有子任务都由主 Agent 自己执行,搜索结果、文件读取、工具调用和中间分析仍然会不断进入主 Agent 的上下文。例如,一个研究任务可能需要多次网络搜索、文件写入和内容整理,这些中间过程本身可能产生大量 Token,而主 Agent 最终真正需要的往往只是研究结论。
IZero076 天前
python·语言模型
Jev 与 Laya整理日期:2026-09-21 来源:github传统大模型(GPT、Claude、DeepSeek)的目标一直是「跟人聊天」和「帮人干活」,本质是逐字生成文本。
喜欢打篮球的普通人6 天前
语言模型
MiniMind 快速上手(一):环境准备与项目结构对于一个项目,最好的学习办法就是最快地把它跑起来。先不纠结细节,把环境搭好、把代码跑起来,再慢慢理解它的细节和原理。本文是 MiniMind 学习笔记的开篇——环境准备与项目结构。
Dawson Zhu6 天前
人工智能·语言模型·架构·aigc·agi
从 Jev 说起:快慢模型如何协同调度,以及这背后需要解决什么问题近期 TypeSafe AI 的 Jev 模型引起了不少关注。它不做自回归文本生成,而是给定状态与一组预定义问题,一次前向输出 Choice / Score / Null 的概率分布与置信度,端到端 70–500 ms。这个变化看似只是「更快更便宜」,实际上改变的是输出的形状——概率可以直接参与计算,而文本必须经过解析才能变成数字。本文从这一处差异出发,记录一条由浅入深的推导路径。
大模型任我行7 天前
人工智能·语言模型·自然语言处理·论文笔记
谷歌:“课程学习”融入扩散模型强化学习📖标题:CanvasAnneal: Curriculum Reinforcement Learning for Diffusion Language Models 🌐来源:arXiv, 2609.13060v1
Dawson Zhu7 天前
人工智能·语言模型·架构·aigc·agi
大模型记忆系统设计:分层架构与关键技术解析大语言模型(LLM)虽然在自然语言理解和生成上表现出色,但其本质是一个无状态的函数——它不保存任何跨请求的上下文信息。实际业务场景中,无论是多轮对话、个性化推荐,还是复杂 Agent 任务,都要求模型能够"记住"之前发生的事。简单的做法是"把所有内容塞进 Prompt",但上下文窗口(Context Window)有容量上限,并且随着对话变长,成本、延迟和"迷失在中间"的问题会越来越严重。
Dawson Zhu7 天前
人工智能·语言模型·架构·aigc·agi
大模型预训练为何普遍单轮遍历?——从 Scaling Laws、数据重复到灾难性遗忘的技术解析在传统深度学习里,几百个 epoch 是家常便饭:ResNet 在 ImageNet 上训几十上百轮,MLP 在小数据集上甚至训到 loss 不再下降为止。数据量小、模型相对小,反复遍历是唯一合理的选择。
johnsong7 天前
人工智能·语言模型
AI 前沿日报 · 2026-09-20今日主题:信任危机——当AI工具变成安全隐患 覆盖:17条深度 · 5大板块今天,一位开发者偶然发现智谱的AI编码桌面应用ZCode在用户不知情的情况下,将整个工作区的 .git 历史打包上传到阿里云OSS。几乎同一时间,韩国个人信息保护委员会宣布将重大数据泄露的最高罚款提升至企业总收入的10%——以Coupang泄露3755万用户数据为例,旧规罚款6246亿韩元,新规下可能突破数万亿。从编码工具到监管法规,"信任"二字正在被重新定义。
硅谷秋水7 天前
计算机视觉·语言模型·机器人
RoboChallenge:具身策略的大规模真实机器人评估25年10月来自Dexmal 和Hugging Face的论文“RoboChallenge: Large-scale Real-robot Evaluation of Embodied Policies”。
Dawson Zhu7 天前
人工智能·语言模型·架构·aigc·agi
大模型 Agent 记忆系统五大技术路线解析与工程选型指南大模型的能力竞争正在从"参数规模"转向"系统能力"。一个模型能否在真实业务中持续服务,很大程度上取决于它能否长期记住用户偏好、历史上下文、事实知识和任务进度。这种能力被统称为 Agent 记忆系统。
AI砖家7 天前
人工智能·语言模型·ai编程·claude·codex
AI 编程面试 20 题:Codex、Claude Code 与 AI 工具使用全攻略适用人群:2026 年校招 / 社招后端、前端、移动端工程师 覆盖范围:AI 编程工具选型(Claude Code、Codex、Cursor、Copilot)、Prompt 技巧、上下文管理、Agent 协作、代码审查、安全规范、开放性问题 每道题包含:题目 → 参考答案 → 面试官追问 → 追问答案
Dawson Zhu7 天前
人工智能·语言模型·架构·aigc·agi
Palantir Foundry 架构深度解析:数据、本体与AI的三层协同摘要:本文基于 Palantir 官方开发者分享会内容,结合公开技术资料进行扩展,系统梳理 Foundry 的核心架构——从数据接入、Ontology(本体)建模到 AIP 智能层。文章力求客观中立,既呈现其设计理念与技术优势,也指出适用边界与潜在风险,供企业架构与技术选型参考。
Dawson Zhu7 天前
人工智能·语言模型·架构·aigc·agi
Agent 响应延迟优化:从推理引擎到系统架构的四层优化模型TL;DR:Agent 的响应速度从来不是"换个更快的模型"就能解决的单点问题,而是一个贯穿推理引擎、上下文、编排逻辑、系统架构的分层系统工程。本文梳理每一层的优化手段、可量化的收益、落地代价与典型坑点,并给出优先级排序与评估框架,帮助你在真实项目中做出可权衡的取舍。
AI砖家7 天前
人工智能·语言模型·ai编程·claude·codex
我用 Codex + GPT-6 Astra 搭了一条自动化剪辑流水线,从安装到批量出片全流程分享做知识分享类视频的博主应该都有同感:剪辑是最消耗时间的环节。一条 60 秒的口播视频,从转录、挑片段、对字幕到导出,手动操作下来一两个小时就没了。