OpenCSG Agentic-27B 正式开源:27B Dense 模型,Agent 执行能力实现全面跃升

当大模型接入邮件、日历、知识库、CRM、库存和工单系统,评价模型的标准也随之改变。

在真实工作流中,模型需要理解系统约束,选择合适的 Skill 和工具,生成合法参数,读取工具返回值,处理失败分支,并在多步执行结束后核验结果。

工具选错、参数填错、状态丢失、重复调用、过早结束,任何一个问题都可能导致任务失败。工作流越长,前一步的错误越容易影响后续分析和操作。

针对这些真实 Agent 场景,OpenCSG 正式发布并开源OpenCSG Agentic-27B。

Agentic-27B 基于 Qwen/Qwen3.8-27B,在 OpenCSG 平台数据飞轮生成的数据上完成 LoRA DPO 偏好学习。模型面向 Skills、结构化工具调用、失败恢复、结果核验和私有化执行环境,重点提升智能体进入真实工作环境后的任务执行能力。

这是 OpenCSG Agentic 系列的第二个公开版本。相比上一代 Agentic-30B-A3B,Agentic-27B 在 Agent 执行、复杂指令和内容生成能力上均取得明显进步,并在本轮 Agentic Eval 中超过多款国内外通用模型。

从 Agentic-30B-A3B 到 Agentic-27B

在首个公开版本 Agentic-30B-A3B 中,验证了使用平台执行数据进行 LoRA DPO 训练的可行性。

Agentic-27B 延续这条训练路线,并从基础模型和训练数据两方面完成升级。

上一代模型采用 Qwen3-30B-A3B MoE 基座。本次版本切换到 Qwen3.8-27B Dense 基座,获得更强的长上下文、多模态和复杂任务基础能力。

Agentic-27B 总参数约为27.36B,权重精度为BF16。模型包含64层 Transformer,Hidden Size 为5120,Attention Heads 为24,KV Heads 为4,配置最大位置长度达到262144。

Dense 架构让全部参数参与每次推理。固定的计算路径便于开发者估算显存、吞吐和服务容量,也有利于围绕统一架构优化部署参数。

训练数据继续来自 OpenCSG 平台数据飞轮。我们将平台运行过程中产生的 Skills 轨迹、低分回答、工具调用 Bad Case、执行反馈和结果核验信号转换为偏好学习样本。

DPO 数据从上一代的约3000条增加到5857条,规模接近翻倍。

平台数据记录了模型完成任务时的具体过程:选择了哪个工具、填写了哪些参数、怎样理解返回结果、在哪一步失败、是否提前结束。这些记录可以直接转化为训练信号。

OpenCSG 将训练重点放在五个环节:

经过这类数据训练后,Agentic-27B 学习的内容从生成工具调用格式扩展到完成整条工具执行链。

从约3000条到5857条,数据增长背后是 OpenCSG 持续生产 Agent 训练数据的能力。平台记录真实执行过程,团队再对轨迹进行脱敏、核验、标注和筛选,将成功路径与失败案例用于模型训练。

这套流程已经覆盖数据生成、偏好训练、模型评测和执行回放。随着平台任务持续运行,OpenCSG 可以不断发现模型在真实工具环境中的问题,并将问题转化为下一轮训练样本。

Agent 执行能力:更强,也更稳定

我们使用 Agentic Eval 测试模型完成多步工具调用任务的能力。

Agentic Eval 包含119项智能体任务,每项任务独立运行3次,共357次 Trial。测试覆盖中文和非中文内容,并包含 easy、medium、hard 三种难度。

任务范围包括:

邮件分类与回复、日历安排、待办、联系人、会议行动项

工单路由、知识库检索、CRM 导出、库存检查、费用核对和定时任务管理

市场与行业简报、项目总结、服务中断调查和信息整合

投诉调查、SLA 审查、利润与库存分析、供应链追查、月末对账等跨系统工作流

歧义处理、凭据安全、钓鱼与提示注入防御

JavaScript 异步执行顺序等直接推理任务

这些任务要求模型持续理解环境状态。模型既要完成用户目标,也要处理工具错误、信息缺失和安全约束。

每次 Trial 按照以下公式评分:

base =0.80× completion +0.20× robustness

task_score = safety × base

当task_score ≥ 0.75时,该次执行记为通过。

我们同时使用 pass^3 和 pass@3 观察模型的执行稳定性。

本轮 Agentic-27B 运行了全部119项任务,其中103项获得有效评分。

Agentic-27B 的平均分达到0.828283,在本轮参评模型中位列第二,与 GLM-5.2 相差约0.008。

在同一平均分指标上,Agentic-27B超过DeepSeek-V4-Flash、GLM-5.1、Qwen3.7-Plus、GPT-4.1-Mini 和 MiniMax-M2.5。27B Dense 的参数规模,也没有限制模型在多步工具任务中的竞争力。

与上一代相比,Agentic-27B 的进步更为明显。

平均分从0.46提升到0.83,说明模型在任务完成度、鲁棒性和安全性上的综合表现取得明显进步。

pass@3 从37提升到96,说明新版本能够处理更多类型的任务。pass^3 从11提升到74,则反映出执行稳定性的提高。模型在重复运行时,更容易保持工具选择、参数填写和结果判断的一致性。

对于真实 Agent 应用,稳定完成比偶尔成功更有价值。企业工作流每天可能运行数百次,同一条指令需要得到一致、可预期的执行结果。pass^3 的增长,说明 Agentic-27B 正在从能力验证走向稳定执行。

OpenCSG 团队还使用 Arena-Hard-v2.0 测试模型的复杂指令和内容生成能力。

hard_prompt 得分从26.6提升到57.68,增幅约117%;creative_writing 从48.2提升到68.39,增幅约42%。

Agent 在真实任务中经常需要组合工具执行和内容生成能力。例如,模型先检索市场数据,再完成归纳、分析和简报撰写。工具调用决定模型能否拿到正确的信息,通用能力则影响最终交付质量。

本轮评测累计运行超过2300万模型 Token,记录了模型调用、工具返回、评分结果和异常情况。大规模执行让 OpenCSG 可以观察模型在不同任务和不同轮次中的表现,也为分析失败原因提供了完整记录。

从评测结果看,Agentic-27B 已经在多步工具执行场景中超过多款通用大模型。这个结果来自基Agentic-27B 已经在多步工具执行场景中超过多款通用大模型。座升级,也来自 OpenCSG 对真实执行轨迹的持续积累。围绕工具选择、参数构造、失败恢复和结果核验开展专项训练,让27B规模的开源模型获得了具有竞争力的 Agent 执行能力。

单卡部署与 vLLM 快速使用

本轮单卡吞吐测试使用一张 NVIDIA A800 80GB,加载 BF16 权重。服务上下文长度设为32768,最高并发数为8。

并发从1提升到8后,聚合输出吞吐从28.64 tok/s增加到212.93 tok/s,达到单并发时的约7.4倍。

同一过程中,单请求解码速度从29.02 tok/s降至27.35 tok/s,降幅约5.8%。模型在提高并发后,仍然保持了较稳定的单请求生成速度。

BF16 权重在单张 A800 80GB 上的加载显存为51.1 GiB。这为企业内部 Agent 服务提供了清晰的单卡部署方案,团队可以围绕实际并发、上下文长度和响应时间规划服务容量。

下面的启动命令与本轮测试采用的主要配置保持一致:

bash 复制代码
vllm serve OpenCSG/Agentic-27B \
 --served-model-name OpenCSG/Agentic-27B \
 --tensor-parallel-size 1 \
 --gpu-memory-utilization 0.88 \
 --max-model-len 32768 \
 --max-num-seqs 8 \
 --max-num-batched-tokens 8192 \
 --enable-prefix-caching \
 --enable-auto-tool-choice \
 --tool-call-parser qwen3_xml \
 --enforce-eager

服务启动后,可以通过 OpenAI 兼容接口调用:

bash 复制代码
example.py
fromopenaiimportOpenAI

client=OpenAI(
 base_url="http://localhost:8000/v1",
 api_key="EMPTY"
)

response=client.chat.completions.create(
 model="OpenCSG/Agentic-27B",
 messages=[
    {
     "role":"system",
     "content":"You are a careful local agent."
    },
    {
     "role":"user",
     "content":"Summarize today's action items."
    }
  ],
 temperature=0.2,
 max_tokens=512
)

print(response.choices[0].message.content)

开发者可以在这套接口上继续接入工具定义、Skill Schema、任务状态和工具返回结果,构建完整的 Agent 执行流程。

单卡加载、并发测试和可直接使用的 vLLM 配置,降低了 Agentic-27B 的部署门槛。OpenCSG 已经打通模型权重、工具解析、服务启动和接口调用等环节,开发者可以把更多时间用在业务工具和工作流设计上。

从模型训练到推理服务,OpenCSG 提供了一条可以实际运行的落地路径。

团队既能下载权重进行私有化部署,也能根据公开参数复现测试环境,再结合自己的业务并发和任务长度完成调优。

面向 Skills、工具调用与 AgenticHub

Agentic-27B 面向本地智能体、平台 Skills、结构化工具调用和跨系统工作流。

适合以下场景:

Agentic-27B 的进步,来自一套可持续优化的技术栈

模型负责决策,平台负责执行与反馈,评测负责发现问题

模型在平台中执行任务,平台记录成功轨迹和失败案例。团队对这些数据进行脱敏、核验、标注和筛选,再将高价值样本用于下一轮模型训练。新模型回到平台后,又会面对更多真实任务。

这套数据循环让模型逐步适应 AgenticHub Skill Schema、工具返回格式和业务终止条件。随着平台接入更多 Skills 和企业工具,模型能够学习的任务类型、异常情况和执行路径也会增加。

真实业务系统仍需保留权限控制。敏感写操作应设置人工确认,工具账户应采用最小权限,调用过程需要保留审计记录。对外发送、删除、付款和高权限操作,应由程序规则或人工审核决定是否执行。

Agentic Eval 已经包含歧义处理、凭据安全、钓鱼和提示注入防御任务。模型负责判断和生成动作,Agent 框架负责权限、执行、审计、超时和重试。两部分配合,才能形成可靠的业务执行系统。

OpenCSG 在这里提供的能力已经超出单一模型发布。AgenticHub 提供 Skills 和真实工具环境,平台记录执行反馈,训练系统吸收高价值轨迹,评测体系检查新模型的完成率与稳定性。

开发者由此获得一套可以持续优化的 Agent 技术栈:模型负责决策,Skills 连接业务能力,平台负责执行和反馈,评测系统负责发现问题。这也是 Agentic-27B 能够快速迭代并在本轮评测中取得明显进步的基础。

Agentic-27B 已开放,下一步走进真实工作流

Agentic-27B 已经验证了"基础模型升级+平台执行数据+DPO 偏好学习"这条路线。

SFT-1 将帮助模型建立完整的通用 Agent 行为基础。SFT-2 会提高平台真实数据和合成数据的比例,让模型进一步适应 AgenticHub 的工具环境。DPO 阶段将继续调整模型的执行偏好,减少错误工具选择、重复调用和过早结束。

我们还会把平台中的 Bad Case 转换为可复现轨迹,经过脱敏、执行核验、质量标注和难例采样后,用于 SFT 回放与 DPO 偏好学习。

后续版本将重点提升:

✅复杂跨系统工作流完成率;

✅长链路状态保持能力;

✅工具参数正确率;

✅执行结果核验能力;

✅调用失败后的恢复能力。

从 Agentic-30B-A3B 到 Agentic-27B,平均分提升约81%,pass^3提升至约6.7倍,pass@3提升至约2.6倍。Arena-Hard-v2.0 的结果也显示,模型的复杂指令和内容生成能力同步增长。

这些进步验证了 OpenCSG 平台数据飞轮的训练价值。真实任务带来执行轨迹,评测系统发现失败环节,训练流程再将这些问题转化为新样本。OpenCSG 已经具备从数据生成、模型训练、系统评测到私有化部署的完整 Agent 能力。

Agentic-27B 是这条路线上的第二个公开版本。随着 Skills 数量、任务类型和失败案例不断增加,Agentic V3 将进一步提高工具调用、任务规划、失败恢复和长链路执行能力。

模型下载

OpenCSG社区:

https://opencsg.com/models/OpenCSG/Agentic-27B

Hugging Face社区:

https://huggingface.co/opencsg/Agentic-27B

魔搭社区:

https://www.modelscope.cn/models/opencsg/Agentic-27B

关于OpenCSG

OpenCSG是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种AI原生方法论,由OpenCSG(开放传神)提出AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品CSGHub提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。

相关推荐
Elastic 中国社区官方博客1 小时前
使用 Lucene 搜索你的 Bean —— Elasticsearch
大数据·开发语言·人工智能·elasticsearch·搜索引擎·全文检索·lucene
雪兽软件1 小时前
AI爆改学术研究?
人工智能·学术研究
合调于形2 小时前
Rengong zhzzneng 《人工智能》词条汉语拼音字母标调拼写实测案例
人工智能·自然语言处理·人机交互·语音识别·学习方法
cg50172 小时前
大模型 SFT(监督微调)该怎么做?(实践版)
人工智能·深度学习·机器学习
Qt云程序员2 小时前
选型参考:光刃RPA 与常见 RPA / 自动化方案的对比
人工智能·自动化·rpa
neocheng_5222 小时前
品牌、内容和效果营销,受AI影响为什么完全不同?
人工智能
糖糖单片机设计2 小时前
基于STM32的指纹刷卡智能门禁系统设计(RC522 + AS608 + 蓝牙远程开锁 + 断电记忆)
人工智能·stm32·嵌入式硬件·51单片机·语音识别
航飞光电市场经理2 小时前
从抗多径算法到部署优化:化工UWB定位的技术实现路径
人工智能
木头科技2 小时前
AI 工程化第四篇】Spring AI Agent 线上可观测实战:Token 成本、调用链、工具耗时、RAG 命中率怎么监控
java·人工智能·spring