9B开源干翻30B:NeoHorse-1实测tau²-Bench 90.82,4B消费级显卡可跑

90.82分对76.64分,9B参数对30B参数,工具调用榜上小模型把大模型甩开14分。这不是跑分游戏里的四舍五入误差,而是2026年9月8日开源的NeoHorse-1交出的真实答卷。这款由基元律动联合无问芯穹、清华大学、北京大学、香港中文大学与阿里巴巴共同推出的开源模型,只有4B和9B两个版本,却在十项智能体基准均分上拿到69.04分,超过同档Qwen3.5的65.60分和30B规模Muse Glimmer的67.86分。它不拼通用问答,不拼写诗写小说,它只干一件事,就是把多步骤任务从头跑到尾。本文把它的榜单差距、训练路线、上下文账本和本地部署路径全部拆开,全部给出可以直接照抄的命令和选型结论。

一、9B凭什么干翻30B:先看三张榜单的差距

先把数字摆在桌上,差距大到没法用误差解释。在工具调用和多轮交互最集中的两项上,NeoHorse-1的9B版本在tau²-Bench拿到90.82分,同场Qwen3.5是88.04分,30B的Muse Glimmer只有76.64分。在PinchBench上,NeoHorse-1是82.25分,Qwen3.5是74.55分,Muse Glimmer是71.35分。十项基准算总账,NeoHorse-1均分69.04分,Muse Glimmer是67.86分,Qwen3.5是65.60分。也就是说参数只到别人三分之一的模型,总分反而更高,工具链路上的优势更是断层。

这个结果说明智能体任务的胜负手不在参数堆料,而在训练语料是不是真实干活留下来的。通用大模型吃的语料多是网页文本和问答对,考试很强,干活容易断在第二步。NeoHorse-1吃的语料是大量真实执行轨迹,包括工具返回报错后怎么换参数重试,多轮搜索后怎么合并结论,代码跑不通时怎么看日志定位。这种语料让它在需要连打十几个工具的任务上特别稳。下面这张表把四款同场模型的公开成绩做了归拢,方便一眼看清差距到底在哪。

对比维度 NeoHorse-1-9B Qwen3.5同档 Muse Glimmer 30B 星火X2.5
出品方 基元律动联合高校与企业 阿里通义 Meta 科大讯飞
参数规模 9B另有4B版 9B档 30B 4B端侧
开源协议 Apache-2.0可商用 开源权重 Apache-2.0 端侧开源
上下文长度 26万可扩至101万 系列最高百万级 13万级 旗舰25万级
十项基准均分 69.04 65.60 67.86 62.22
工具调用单项 90.82大幅领先 88.04紧随 76.64明显落后 77.72偏弱

从表中可以看出,分野主要在训练路径而非参数规模。如果你要的是写代码、调工具、跑深搜这种多步骤自动化,9B这个版本是目前开源里完成度最高的选择之一。如果你要的是通用多模态和更宽的适用面,另外两家各有长处。选型时先问自己一个问题,任务是考一句话答对,还是考十步连续做对,前者看通用榜,后者就看这张表。

二、Agent-Native到底练了什么:把完成任务本身当目标

很多模型是先练通用问答,再补一点工具调用微调,属于先学会说话再学干活。NeoHorse-1反过来,它把完成任务本身作为训练目标,官方叫法是Agent-Native后训练。核心语料是Harness产生的结构化执行轨迹,加上路由信号课程和在策略蒸馏。翻译成人话就是,模型看的不是标准答案,而是别人干活的全过程,包括走弯路、报错、换路、再跑通的全记录。

这种练法带来三个直接变化。第一是工具调用更准,参数缺了会主动补,工具报错会换种写法重试,而不是直接停下来说我不会。第二是规划更实在,会把大目标拆成小步骤,先搜资料再写代码,先跑通再优化,而不是一上来就写一大段跑不通的代码。第三是校验意识更强,中间结果会自己检查一遍,对不上就回头重跑。官方披露的训练链路里,路由信号课程负责让模型学会什么时候该搜、什么时候该算、什么时候该写,蒸馏环节把大模型跑通的长链路压缩进小参数。这也是9B能赢30B的根本原因,干活能力是练出来的,不是堆出来的。对于开发者来说,这意味着你可以用更小的显存拿到更稳的多步执行,特别适合做电脑操作、深度搜索、代码生成这类需要连续调用的场景。

三、26万到101万:上下文这笔账到底怎么算

NeoHorse-1原生支持262144 tokens上下文,可扩展至约101万。这个数字对智能体任务非常关键,因为多步骤任务的历史记录很吃上下文。一次深度搜索可能就要读几十个网页,一次代码任务可能要读整个仓库目录加报错日志,上下文小了,跑到第五步就把第一步忘了,只能反复重查。

按中文粗略折算,26万tokens大约能装下几十万汉字,或者一个中型代码仓库的核心文件加最近的执行日志,或者几十篇网页全文加模型自己的思考过程。扩展到101万之后,可以把更大规模的项目、更长的操作录屏文字版、更完整的检索结果一次性放在工作记忆里。对于企业用户来说,这种容量的直接价值是减少外挂的切片和总结流程,不用自己写复杂的记忆压缩。对于个人开发者来说,26万原生已经够跑大多数任务,101万扩展留给超长项目和批量离线任务。需要注意的是,上下文开得越大,显存和推理延迟都会涨,日常任务建议先用原生长度,遇到超大仓库和长周期调研再开扩展。下面讲部署时会给出具体的长度配置方法,照着改一个数字就行。

四、本地实测:4B版本消费级显卡能不能跑

这是大家最关心的落地问题。答案是4B版本可以在消费级显卡上运行,9B版本建议用显存更充足的多卡环境。权重已经在HuggingFace、ModelScope和GitHub三处开放,推理框架方面SGLang、vLLM、Ollama都已支持,协议是Apache-2.0,权重免费下载,没有授权费和按量调用费,成本集中在自己的显卡和算力上。因为可以在局域网内运行,请求不出内网,对数据合规要求高的团队很友好。

以ModelScope加SGLang为例,拉取和启动只需要两步。先用命令行把权重拉到本地,再用推理框架指定上下文长度启动服务。下面这段是可以直接照抄的启动示例,重点看最后两个长度参数,日常任务和超长任务改这里就行。

bash 复制代码
modelscope download --model TokenRhythm/NeoHorse-1-9B --local_dir ./NeoHorse-1-9B
python -m sglang.launch_server --model-path ./NeoHorse-1-9B --context-length 262144 --host 127.0.0.1 --port 8000

启动后服务就跑在本地8000端口,后续调用全部走内网。踩过的坑主要有两个,第一个是显存不足时不要硬上9B,先用4B验证流程,流程跑通再升级显卡。第二个是上下文长度不要一上来就拉满,长度翻倍显存占用涨得很快,先用26万原生长度,超长任务再按需扩展。本地部署的好处是调参自由,温度、长度、并发都可以自己控,不用看云端队列脸色。

五、三步把它塞进你的Agent:OpenAI SDK直接调本地服务

本地服务跑起来之后,接入工作量很小。因为SGLang和vLLM都兼容OpenAI接口,只需要把调用地址指向本地服务就行,原来的业务代码几乎不用改。下面这段是标准的调用写法,把地址改成本地,把模型名改成本地路径,剩下的工具定义和对话逻辑保持不变。

python 复制代码
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="local-only")
resp = client.chat.completions.create(
    model="NeoHorse-1-9B",
    messages=[{"role": "user", "content": "把这个仓库的报错日志读完,定位根因并给出修复补丁"}],
    tools=[{"type": "function", "function": {"name": "run_shell", "parameters": {"type": "object", "properties": {"cmd": {"type": "string"}}}}}],
    temperature=0.2,
    max_tokens=4096,
)
print(resp.choices[0].message.content)

实际使用时建议把温度设低一点,多步任务求稳不求花活。工具定义保持和原来一致,搜索、抓取、代码执行、表格处理都可以按需注册。平台内置的开箱工具可以直接开,自定义工具可以对接本地文件读写、数据库查询和业务接口。Agent运行模式建议高风险业务先用规划确认模式,让模型先输出计划,人确认后再执行,低风险批量任务再开全自动。实测下来,它在工具报错后的自救能力明显强于通用模型,很多过去要人工介入改提示词的断点,现在它自己换参数就能过去。

六、和Qwen3.5们怎么选:一张场景对照表

选模型不要只看总分,要看自己的任务长什么样。下面这张表按真实场景给出建议,对号入座就行。如果你的任务是每天要跑几百次的多步骤自动化,优先看工具调用和稳定性,NeoHorse-1是首选。如果你的任务是图文混合理解和端侧常驻,另外两家各有优势。价格方面,开源权重都是免费下载,成本差在显存和运维,不在授权。

你的场景 首选 理由 配置建议
多工具自动化办公 NeoHorse-1-9B 工具调用90.82断层领先 本地SGLang部署,原生26万上下文
深度搜索加代码生成 NeoHorse-1-9B 真实轨迹训练,多轮稳 温度0.2,加重试和校验
消费级显卡个人玩 NeoHorse-1-4B 单卡可跑流程完整 先用4B验证再升级9B
原生多模态图文视频 Qwen系同档 多模态底座更宽 按官方多模态文档接
本地常驻轻量助手 端侧4B档 包体小响应快 Ollama一键跑

从生态看,NeoHorse-1的SGLang、vLLM、Ollama三件套已经齐了,主流工作流都能直接插进去。对于已经有Agent框架的团队,替换成本就是改个地址和模型名,半天就能跑完回归。对于新起项目的团队,建议直接按Agent-Native思路设计,把任务拆成搜、读、算、写、验五个标准节点,每个节点配好工具和重试,模型会自己把链路跑完。

七、避坑清单:上线前先看这三件事

第一是显存规划。不要在消费级单卡上硬跑9B加101万上下文,一定会爆显存。正确姿势是4B加26万先验证业务闭环,确认任务真的需要更长记忆再加卡上9B,超长扩展只给批量离线任务开。第二是协议合规。Apache-2.0允许商用、修改和二次分发,但二次分发时必须保留原有许可和版权声明,企业发版前让法务看一眼声明文件,不要删掉。第三是别拿它去比通用问答和写诗。它是为完成任务训练的,强项是调用、规划、深搜和代码,长文本闲聊和多模态创作不是它的主战场,拿短板去比长板没有意义。

最后给一个最小落地清单,照着做半天就能上线。第一步拉权重并用SGLang起服务,第二步用上面的SDK代码调通一次真实任务,第三步把温度固定0.2并加上工具失败重试,第四步做一次断网和报错演练,看模型会不会自己换路,第五步再决定是否扩上下文和加卡。跑通之后你会发现,智能体的稳定性瓶颈很多时候不在提示词,而在模型有没有见过足够多的干活过程。这款9B小模型证明了一件事,把干活过程喂足,小参数也能把大参数拉下马。

相关推荐
TonyLee0172 小时前
扩散模型初探(二)
人工智能·扩散模型
行者全栈架构师2 小时前
WorkBuddy 实战:50 份简历 30 分钟筛完,还能自动出评估报告
人工智能·算法·微信
狠活科技2 小时前
GPT Image 2.5 发布:AI 生图又进化了
人工智能·gpt·ai作画·aigc·image2.5
程xu袁2 小时前
AI写歌词和AI作曲有什么区别?想做完整歌曲,AI音乐工具怎么选?
人工智能
ACME20442 小时前
破产财产处置新规落地,管理人如何选聘拍卖机构?
人工智能
AI让世界更懂你2 小时前
计算机专业研究生核心能力培养(6)——论文写作的表达与打磨
人工智能
风之清扬2 小时前
Agent学习之四-初识Agent CLI
人工智能·科技·学习
零依赖极客3 小时前
Day 9·1 KV 也量化——q8 KV 把缓存与 decode 带宽压到一半
c语言·开发语言·arm开发·人工智能·缓存·矩阵
陈童学哦3 小时前
AI术语大全
人工智能