llm

山顶夕景5 小时前
大模型·llm·agent·多模态·moe
【LLM】GLM-5.3-Flash模型MVBench 和 MMVU:我们使用的参数设置为温度=1.0,top_p=0.95,最大上下文长度为 256K 个令牌。对于那些原生支持视频输入的模型,比如 Gemini 3.7 Flash,我们可以直接将原始视频作为输入进行评估。而对于那些不支持视频输入的模型,我们会采用默认的 1 帧每秒的提取策略。如果提取出的帧数超过 API 的最大限制,我们会在整个视频范围内进行均匀采样,直到达到这个最大帧数限制为止。
武子康8 小时前
人工智能·llm·agent
把生产 Agent 事故 Trace 变成可重放的回归测试集封面 01: 退款事故修完又复发, 5 次转化是永久发布门线上 Agent 把退款工具当作查询工具, 重复创建工单, 引用了错误知识库, 团队修完 Prompt 后在工单里写一句"已解决"。几周后升级模型, 同类错误再次出现。问题不在于团队没有日志, 而在于日志没有被转换成可重放、可判定、与训练隔离的测试资产。
武子康8 小时前
人工智能·llm·agent
开放权重之后,为什么 Agent 仍然无法复现:真正缺的是可重放行为证据同一个开放模型、同一条用户指令,两支团队做出的 Agent 可能完全不像同一个系统。一支能在工具超时后换路重试、验证外部状态再结束;另一支遇到 403 仍继续编造"操作已完成"。差别未必来自权重。系统 Prompt、工具 Schema、权限、失败样本、数据混合方式与评测器,都可能改变最后的行为。
tachibana29 小时前
人工智能·ai·大模型·llm·agent
AI Agent 的记忆机制摘要:在人工智能从传统的“单轮对话生成”迈向“自主决策智能体(Autonomous Agent)”的过程中,记忆机制(Memory Mechanism) 是决定 Agent 是否具备长周期任务执行能力、个性化交互能力以及自主演进能力的核心分水岭。
CoderJia程序员甲11 小时前
ai·大模型·llm·github·ai教程
GitHub 热榜项目 - 周榜(2026-08-30)生成于:2026-08-30共发现热门项目: 18 个Token赞助:siliconflow前些天发现了一个巨牛的人工智能学习网站,通俗易懂,风趣幽默,忍不住分享一下给大家。点击跳转到网站。
tachibana212 小时前
人工智能·ai·大模型·llm·agent
Agent 的长短期记忆系统摘要:大语言模型(LLM)本身是无状态(Stateless)的概率推理引擎,单次请求结束后即失去上下文。要让 Agent 具备跨会话的持续进化、个性化交互与复杂长任务规划能力,必须为其构建一套类脑的长短期记忆系统(Memory System)。
北落L12 小时前
llm
Embedding:从 Token 到向量表示上一篇介绍了 Token。文本进入大模型后,通常会经历以下过程:例如:但 Token ID 只是词表中的索引,并不直接携带可解释的语义。假设:
leeyi14 小时前
llm·aigc·agent
Eino + DeepFlux 实战全景复盘:100 篇,从 5 分钟 Demo 到企业级平台(第100篇-E86)这是第 100 篇,收官篇。不拆新源码——反过来,把 99 篇走过的路和 DeepFlux 这个真实仓库放在一起盘一遍。
阡之尘埃1 天前
人工智能·python·深度学习·语言模型·llm·微调·千问
Python数据分析案例85——大模型微调全流程(SFT的LoRA微调)有一年没更新了,最近学习了大模型的微调的流程,总结一下。我们都知道大模型的训练分为三个阶段,预训练,SFT和RHLF。让deepseek总结一下:
tachibana21 天前
人工智能·ai·大模型·llm·agent
复杂任务怎么做的任务拆分?摘要:在构建大语言模型(LLM)驱动的自主智能体(Agent)和企业级复杂应用系统时,开发者面临的核心瓶颈往往不是模型基座的单次生成能力,而是面对跨越多个领域、依赖多工具交互、耗时较长的“复杂长链路任务”时系统的崩溃与失控。
tachibana21 天前
人工智能·ai·大模型·llm·agent
ReAct、Plan-and-Execute、Reflection 三种范式有什么核心区别摘要:构建一个稳定、高可用且具备复杂推理能力的智能体(Agent),核心难点不在于大模型(LLM)基座本身,而在于认知控制流与规划执行范式(Cognitive Architecture)的设计。
EDPJ1 天前
llm·负载均衡·大语言模型·moe
(2024|DeepSeek & 北大,Loss-Free Balancing,每专家偏置,QB)MoE 的无辅助损失负载均衡策略论文地址:https://arxiv.org/abs/2408.15664ICLR 2025:https://openreview.net/forum?id=y1iU5czYpE
桃西西呀2 天前
人工智能·llm·agent
GPT-5.6 的 ultra 模式凭什么开 4 个 Agent 并行跑?——多智能体协作,是把"一个聪明人"换成"一个团队"本文从一个你大概率已经遇到的真实场景开始,逐个用事实和数据解决。最后你会发现:2026 年 8 月密集刷屏的 GPT-5.6 ultra(4-Agent 并行)、刚曝光的 OpenAI Astra(多智能体长程协作)、拿下 ARC-AGI-3 满分 的 NVIDIA AVO,踩中的是同一套被低估的原理——单模型的上限,正在被"系统"接管。
澄怀2 天前
llm·agent
Agent 说「我已经改好文件了」,这句话到底能不能信?用 AI 编程工具的人多半见过这个场面:它一路说得很笃定——「已定位到问题」「已修改 shipping.ts」「测试已通过」——你一看文件,一个字没动。
夫唯不争,故无尤也2 天前
llm·agent·强化学习·rl·opd
On-Policy Distillation(OPD)和reinforcement (RL)结合你这里说的 OPD,在当前 LLM 后训练 / Agent 语境里,通常指 On-Policy Distillation,在线策略蒸馏。
武子康3 天前
人工智能·llm·agent
h3.c 的 fast 模式到底删了什么:六个计算轴不能混成一个开关很多推理工具把优化收进一个 fast=true。速度变快后,用户只看到总耗时下降,却不知道程序少算了哪些部分,也不知道画面出错时应该撤回哪个开关。
GoCoding3 天前
llm·agent
Qwen3.8-27B 部署Qwen3.8-27B 是 Qwen 开源的多模态稠密(Dense)模型,于 2026-08-14 发布。
leeyi3 天前
llm·aigc·agent
Eino ADK——Agent 的完整生命周期:从创建到中断恢复(第98篇-E84)上一篇 讲了数据库迁移怎么不翻车。但 Agent 本身是怎么跑起来的?创建、执行、工具调用、中断、恢复——这些生命周期节点 Eino ADK 怎么管?