LLM 选型指南:Agent 场景下大模型的核心能力评估框架摘要Agent 场景下的大模型选型,绝不是跑几个 Benchmark 那么简单。ChatBot 时代,模型只需要"回答得好";Agent 时代,模型还要"行动得对"——工具调用是否稳定、多轮上下文是否连贯、长程任务是否不跑偏、成本是否扛得住,每一项都可能成为系统级瓶颈。本文从推理能力、工具调用稳定性、上下文管理、成本效率四大维度出发,构建一套可操作的 Agent 模型评估框架,并对 GPT-5、Claude Opus 4、DeepSeek-V4、Qwen3.5 四款主流模型在 Agent 场景下的表现进行