大语言模型

空 白II1 天前
大语言模型·qwen
9.20 大语言模型研究简报:Qwen Code v0.24.1从 Coding Agent 走向统一 Agent Runtime北京时间 2026 年 9 月 19 日 16:18:42 正式发布了 Qwen Code v0.24.1。
空 白II3 天前
大语言模型·claude
9.19 大语言模型研究简报:Anthropic × Accenture 把“第三方评测者”直接嵌入前沿模型研发流程北京时间 2026 年 9 月 19 日 04:05,Anthropic 宣布与 Accenture 建立 Embedded Evaluation 合作机制。
空 白II4 天前
openai·大语言模型
9.17 大语言模型研究简报:openAI 公开模型失配报告框架北京时间 2026 年 9 月 17 日 01:00 openAI 公开了模型失配报告框架,其原文链接为
空 白II4 天前
大语言模型·grok build
9.17 大语言模型研究简报:Grok Build 引入正式 Agent 系统发布Grok Build 在北京时间2026 年 9 月 17 日 03:00发布了正式的跨对话记忆 Agent ,原文链接为
prog_61037 天前
人工智能·llm·大语言模型·agent
【笔记】用agent手搓agent(一)今天我们从cursor手搓cursor进入下一个篇章,开始向泛化的agent去开发agent,进一步开始研究agent,向RSI进发。
澳鹏Appen7 天前
人工智能·大语言模型·智能体·大模型推理
AppenTalk | 当AI推理不再只是模型的事:Dan Roth谈智能体的真正边界Oracle首席AI科学家Dan Roth的回答比大多数人想象的更严格。在近期与澳鹏的对谈中,Roth提出:许多AI领域最棘手的问题,已不再是模型层面的问题,而是系统层面的问题。一个LLM可以生成恰好得出正确答案的token序列,但这与“推理”的形式意义之间存在根本区别。
prog_610312 天前
人工智能·笔记·大语言模型·agent
【笔记】用cursor手搓cursor(十)本来准备开源自己的agent,但是测试以后还不是特别满意,尤其是coding上还欠点火候,还需要再打磨打磨再出开源第一个commit。目前使用的是qwen3.6:35b,token生成速度已经非常快了,它可以配置好自动approve的规则以后持续自主学习,然后写问答到知识数据库,推理的时候再通过知识数据库读取之前的知识,然后作出更好的行动。比如让它读linux源代码,从一个user space的行为追踪到kernel代码,已经很不错了;或者读取伤寒杂病论让它总结什么病症对应使用什么方剂;或者结合pdfcp
songsong.13 天前
大模型·大语言模型·vibe coding·氛围编程
Vibe Coding实现Supabase + Vercel完整部署本文从零完整记录:Next.js前端项目搭建 → Supabase后端服务配置 → 本地调试验证 → Git托管 → Vercel一键部署,以及部署过程踩过的全部坑,手把手跑通一条完整上线链路。以登录注册为例,这也是Hello‑World般的存在!
指针常量17 天前
人工智能·笔记·大语言模型·后训练
【RL相关笔记】RL 效率综述本综述记录与提升 LLM RL/RLVR 效率相关的已有工作,重点关注难样本处理、信用分配、隐状态信号、rollout 分配和训练动态。
songsong.18 天前
大模型·openai·大语言模型
一个简单通用的ChatLLM类设计与使用大模型的封装调用,希望能帮助你在各种LLM辅助工具开发中快速上手。我们经常需要调用各种大语言模型(LLM)的API来辅助完成一些计算任务,为了方便复用和快速开发,我封装了一个通用的ChatLLM类,支持:
指针常量19 天前
学习·大语言模型·rl·后训练
【RL系列文章】难样本学习等综述:看了很多,总的来说,不利用外部信息的都基本比较扯淡。链接:https://arxiv.org/pdf/2602.01601 本文的核心理论即我们到底选择哪些样本去学习,DAPO的逻辑是把全对全错的去掉,但是这个属于先rollout再评价好坏;本文提出可以事先根据query进行预测答对的概率。本文先证明了一个重要的前提,答对概率越接近50%的题目越具有信息量,优先采样这部分会对训练更有效。 为此,本文设计了一个非常巧妙的纯数学计算的方法,动态的维护题目答对的可能性。已经答过的题的答对概率被更新,未答过
Geek-Chow20 天前
人工智能·大语言模型·mcp
MCP 模型上下文协议:四、概念地图 · 八个概念与五个组件🇬🇧 English version: mcp-guide/03-concept-map.md | 📦 GitHub: https://github.com/geekchow/mcp-explain
deephub20 天前
大语言模型·ai agent·agent runtime·deepseekharness·cordis
DeepSeek Harness 架构解析:从 Preset、Tool Pipeline 到 Agent RuntimeDeepSeek Harness(DSH)不是简单的模型聊天界面,也不只是又一个 Coding Agent。它把 Model Adapter、Tool Registry、Session、Agent Loop、Sandbox、Storage 和 UI 等能力放进插件组合,通过 Cordis 管理组件的加载、卸载、依赖与生命周期。
prog_610322 天前
笔记·大语言模型·agent·vibe-coding·qwen3.8-flash
【笔记】cllama:搜罗万象当LLM api server测qwen3.8:flash-nextTL;DR cllama先别急着看代码。我想先讲个故事。我有一台很普通的服务器——没有 GPU,只有 CPU,但它在公网上,有个公网 IP,可以连着腾讯的 IMA。这台机器常年安静地跑着 bge-m3 做 embedding,把知识库向量化,等着被检索。
EDPJ23 天前
llm·负载均衡·大语言模型·moe
(2024|DeepSeek & 北大,Loss-Free Balancing,每专家偏置,QB)MoE 的无辅助损失负载均衡策略论文地址:https://arxiv.org/abs/2408.15664ICLR 2025:https://openreview.net/forum?id=y1iU5czYpE
天地会珠海分舵24 天前
大语言模型·测评报告·qwen 3.8 flash
Qwen 3.8‑Flash完整实测!从推理编程到多模态!真的能打吗?任务:输出10个以汉字数字结尾的句子,且按照顺序一到十,语句要通顺有意义,且倒数第二个字不能重复且不能是”第”,”是”,”为”
龍德明宇24 天前
大语言模型·ai哲学·负主体性
四个时代之问的存在论根基-龍德明宇7月17日,2026世界人工智能大会上的主旨演讲《携手构建公正合理的全球人工智能治理体系》,提出四个时代之问,并给出四个方向:开放共赢、安全可控、包容并蓄、和衷共济。同日发布的《人工智能合作发展行动计划》,以八项行动将这四个方向落实为具体举措。
今天吃饺子1 个月前
大语言模型·llama·故障诊断
超高创新模型!TF-SAX-Llama 轴承故障诊断近年来,大语言模型火得一塌糊涂,写文案、敲代码、做图样样都行。于是很多人开始琢磨:能不能把大模型用在工业故障诊断上?
prog_61031 个月前
人工智能·笔记·大语言模型·agent
【笔记】用cursor手搓cursor(九)用了一圈,我觉得目前知识库比较接近我的预想的是腾讯的ima,但是管理大规模知识的检索,以及索引的索引,索引的索引的索引…都还是问题,说白了就是思维链通路。
Geek-Chow1 个月前
人工智能·大语言模型·多模态
02 多模态 LLM 是什么:定义、边界与生态位置上一篇讲清了纯文本 LLM 撞上的四堵墙,以及 CLIP 造出了眼睛却没接大脑。这一篇把"接起来之后的那个东西"正式定义出来。