开源大模型追踪:中电信人工智能Xing4.0-29B-A4B:SWE-bench 75.0逼近Qwen3.6-35B

一、模型速览

项 规格
模型 Xing4.0-29B-A4B(星辰系列,前身 TeleChat)
发布方 中电信人工智能科技(TeleAI)
参数量 29B 总参 / 4B 激活(64 路由专家 + 1 共享,每 token 激活 4)
上下文 原生 256K,可扩 512K
架构 mHC + MLA + MTP,40 层,隐藏 3584
许可 Apache-2.0
显存 BF16 ~58GB;4-bit ~15GB(单卡 24GB 可跑)
训练底座 昇腾 910C + MindSpore(国产全栈)
开源 2026-09-17(HF / ModelScope / 魔乐)

一句话定位:面向 Agent 的轻量 MoE,单张消费级显卡就能私有化跑长上下文智能体。

这里要先说清一个容易混淆的点:总参 29B 听着比 7B 大,但本地跑得快不快,看的是"每 token 激活"而不是"总参"。Xing4.0 每 token 只点亮 4B 专家,推理算力开销接近一个 4B 稠密模型,显存却要装下全部 29B 权重------所以量化后单卡能跑,但原始 BF16 必须多卡。换句话说,它的"聪明"来自大权重库,"便宜"来自稀疏激活,两者分开看才不会误判部署门槛。

本周(9/17--9/24)可单卡部署的开源模型里,它是 Agent 向最值得做的一篇。本专栏此前写过 Nex-N2.5-mini(35B/3B,9/14)、K2-Horizon-7B(7B,9/7)、Apodex-1.1-mini(35B,8/31),Xing4.0 以 29B/4B + 原生 Agent 调优 + Apache-2.0,正好补齐"机房级之外、桌面级能跑的 Agent 基座"这一档------而且它是国产算力全栈训出来的,对信创场景格外对症。

二、核心亮点

1. 4B 激活干翻 2--3 倍体量的 Agent 友商。 在官方评测里,Xing4.0-29B-A4B 的 SWE-bench Verified 75.0 仅落后 Qwen3.6-35B-A3B(76.0)1 分,却把 Gemma4-26B-A4B(53.0)甩开 22 分;Terminal-Bench 2.1 57.5 同时超过 Qwen3.6(51.5)和 Gemma4(30.0);Claw-Eval 76.55 是三者最高(来源:中电信模型卡)。这意味着"修真实仓库 bug + 跑终端命令"这类最高频的本地 Agent 场景,29B/4B 已经够用,不必为分数硬上 35B。

2. 4-bit 量化把部署门槛从集群砍到桌面。 FP16 整包约 60GB,消费级显卡根本扛不住;官方 4-bit 量化把显存压到约 15GB(较 FP16 降约 75%),RTX 3090 / 4090 这类 24GB 卡直接单卡跑长上下文任务,硬件成本从数万元级 A100 降到数千元级 RTX 40 系(来源:中电信 09-22 发布 / 经济参考报)。对中小企业和"数据不出域"的客服、财务场景,这是把 Agent 从 PPT 拽进生产系统的关键一跳。

3. mHC + MLA + MTP 三件套专治长程 Agent。 MLA 压缩 KV 缓存(长上下文才跑得动),MTP 多 token 预测增强生成连贯性并兼作投机解码提速,mHC(流形约束超连接)稳住 40 层深层训练------三者合力让模型在多步规划、工具调用、长会话下不"走丢计划"(来源:官方架构说明)。这正是它 Terminal-Bench / DeepresearchBII 反超同尺寸友商的结构性原因。

4. 国产全栈训练 + 跨芯一键部署。 首个该体量完全基于昇腾 910C + MindSpore 训练的开源模型,整网训练吞吐较开箱提升约 96%;推理侧基于 FlagOS 统一栈已在昇腾、沐曦、摩尔线程、平头哥、海光等 6 款国产芯片完成跨芯适配,提供 vLLM-plugin-FL / SGLang-plugin-FL 插件(来源:官方 / 经济参考报)。信创环境要"自主可控基座"的团队,这是目前少有的、训练到推理全链路国产可查的公开权重。

5. 对主流 Agent 框架零改造接入。 权重已针对 OpenCode、Claude Code、OpenClaw、Hermes 做格式对齐,开发者不用改工程就能挂上现有工作流;微调走 LLaMA-Factory / MindFormers,沿用熟悉工具链(来源:官方 README)。

三、部署实战

重要前提:Xing4.0 是自定义架构,Transformers / vLLM 均需 trust_remote_code(会执行仓库代码,生产请固定 commit);vLLM / SGLang / llama.cpp / KTransformers 的官方适配 PR 截至发布仍 pending,需走 PR 分支而非稳定版。本机无 GPU,以下为代码与命令,未做实测。

方式一:Transformers 单机推理(最通用,需 trust_remote_code)

bash 复制代码
pip install transformers torch modelscope
bash 复制代码
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

path = "XingChen-AGI/Xing4.0-29B-A4B"
tokenizer = AutoTokenizer.from_pretrained(path, trust_remote_code=True)
# 自定义 mHC+MLA+MTP 架构,必须 trust_remote_code
model = AutoModelForCausalLM.from_pretrained(
    path, trust_remote_code=True, device_map="auto", torch_dtype=torch.bfloat16
)

messages = [{"role": "user", "content": "用 Python 写一个快速排序,并加注释。"}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
model_inputs = tokenizer(text, return_tensors="pt").to(model.device)
generated_ids = model.generate(
    **model_inputs, top_p=0.95, temperature=1.0,
    repetition_penalty=1.05, max_new_tokens=4096
)
response = tokenizer.decode(generated_ids[0], skip_special_tokens=False,
                            spaces_between_special_tokens=False)
# 模型默认开启 thinking,输出含思考链;最终回答在 </think> 标记之后
answer = response.split("</think>")[-1].strip() if "</think>" in response else response
print(answer)

方式二:vLLM 起 OpenAI 兼容服务(适合并发 Agent)

bash 复制代码
# 需先切到含 xing4 支持的 vLLM PR 分支(官方主分支尚未合入)
pip install git+https://github.com/vllm-project/vllm@xing4-support   # 示意,以官方 PR 为准
bash 复制代码
vllm serve XingChen-AGI/Xing4.0-29B-A4B \
  --host 0.0.0.0 --port 8000 \
  --served-model-name Xing4.0-29B-A4B \
  --tensor-parallel-size 2 \
  --trust-remote-code \
  --max-model-len 262144 \
  --gpu-memory-utilization 0.90 \
  --reasoning-parser xing4 --tool-call-parser xing4 \
  --speculative-config '{"method":"mtp","num_speculative_tokens":1}'

说明:--tensor-parallel-size 2 是因为 BF16 整包约 58--60GB,需 2×24GB 或 1×80GB;单张 24GB 卡请改用 4-bit GGUF / INT4 量化版本(约 15GB),否则放不下。MTP 投机解码走 --speculative-config,xing4 解析器负责思考链与工具调用。

python 复制代码
# 服务起来后用 OpenAI 客户端对话(pip install openai)
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
# 代码 / Agent 任务把 temperature 降到 0.8;复杂推理用 1.0
r = client.chat.completions.create(
    model="Xing4.0-29B-A4B",
    messages=[{"role": "user",
               "content": "帮我对比两个开源模型的 API 成本,输出带数据表格的选型报告。"}],
    temperature=0.8, top_p=0.95, max_tokens=4096,
)
print(r.choices[0].message.content)

方式三:单卡 24GB 走 GGUF(llama.cpp,PR 待合入)

bash 复制代码
# 下载社区/官方 GGUF 量化(4-bit 约 15GB),用 llama.cpp PR 分支启动
llama-server -m Xing4.0-29B-A4B-Q4_K_M.gguf \
  -c 262144 --host 0.0.0.0 --port 8080

选型建议:纯本地离线用 Transformers / GGUF 最省心;要做 Agent 并发服务用 vLLM(注意 PR 分支);信创环境走 FlagOS 的 vLLM-plugin-FL / SGLang-plugin-FL。

补充一个提速细节:模型默认开启 thinking(思考链),输出会先吐一大段推理再给答案。对延迟敏感的场景(比如客服实时应答),可通过 chat template 参数关掉 thinking 直接出结果;代价是复杂任务准确率会掉,建议按"简单任务关、难任务开"切。上面 Python 示例已用 </think> 标记兜底解析,万一标记名与本地权重不一致,直接打印 response 看一眼真实分隔符即可,别硬切。

四、性能测评

模型 总参/激活 SWE-bench Verified Terminal-Bench 2.1 Claw-Eval 单卡 24GB 可跑
Xing4.0-29B-A4B 29B/4B 75.0 57.5 76.55 4-bit≈15GB ✓
Qwen3.6-35B-A3B 35B/3B 76.0 51.5 74.54 需量化
Gemma4-26B-A4B 26B/4B 53.0 30.0 71.49 ---

数据来源:中电信官方模型卡(厂商自报,含温度/上下文/跑次配置);SuperCLUE 智能体得分 Xing4.0 93.52(第 3,与 Qwen3.8-27B 94.49、Qwen3.6-35B-A3B 94.04 差距 <1 分)。

三维度看:

  • 推理速度:厂商称单卡 4-bit 约 30 tok/s(来源:中电信 09-22 发布);BF16 多卡更高但未公布具体值。需要提醒的是,30 tok/s 是 4-bit + 单卡 24GB 的厂商口径,开 thinking 时因为要先生成整段推理链,首字延迟会明显变大------真正卡顿感来自 TTFT 而非持续吞吐。本机无 GPU,未实测,此数仅作参考,欢迎读者在自有硬件验证;若你实测偏差较大,多半是量化档位或上下文长度不同,属正常。
  • 显存:BF16 ~58--60GB(2×24GB 或 1×80GB);4-bit ~15GB(单卡 24GB);FP8 介于二者。MLA 压缩 KV 让长上下文的显存增幅可控。
  • 生成质量:Agent 三项(SWE-bench / Terminal-Bench / Claw-Eval)均逼近或超过体量更大的 Qwen3.6-35B-A3B,长程研究(DeepresearchBII 60.80)也略胜;短板在数学(AIME2026 90.0 落后 Qwen3.6 的 92.7)与指令跟随(IFBench 69.67 落后 Gemma4 的 72.67)。一句话:它是"Agent / 代码执行基座",不是"通才问答机"。

数据口径提醒:以上基准全部为厂商自报,官方模型卡已附评测配置;第三方独立复测尚未铺开,选型时建议以 SWE-bench / Terminal-Bench 的社区复跑为准,别被单点分数带节奏。tok/s 为厂商口径、非本机实测。

五、使用建议

部署档位速查:

  • 单卡 24GB(3090/4090):4-bit GGUF / INT4 ≈15GB,本地 Agent、数据不出域

  • 2×24GB 或 1×80GB:BF16 满血,长上下文 + 高并发

  • 信创环境:FlagOS 插件 + 国产芯片(昇腾/沐曦/摩尔线程等)一键部署

  • 多卡机房:不划算,29B 体量本就不该上集群

  • 适用场景:私有化代码助手、终端/运维 Agent、客服智能体(套餐变更、账单查询)、财务报表解析、投标文件拆解等"数据不出域"的高频业务;中小企业低成本 Agent 落地;信创环境自主可控基座。

  • 不适用场景:纯通识问答(数学/指令跟随弱于同尺寸友商);超长程多步规划(DeepresearchBII 60.80 尚可但不如 1T+ 旗舰);需要稳定 vLLM 主分支支持的团队(当前 PR 待合入,得自己维护分支)。

  • 调优提示:① 代码/Agent 任务 temperature 设 0.8,复杂推理设 1.0;② 单卡务必走 4-bit,给 KV cache 留余量;③ 接 Agent 框架用官方 xing4 解析器,否则思考链/工具调用不解析;④ 想要满血质量上 2 卡 BF16,但性价比不如单卡 4-bit。

相关推荐
liferecords2 小时前
专家池 8→128 只慢 5%:Ai2 开源万亿参数 MoE 训练框架 Olmo-core 3
人工智能·开源·大模型·moe
小马9262 天前
KV Cache 瘦身 437 倍:DeepSeek V4.1-Flash 的推理效率革命
大模型·moe·kv cache·deepseek·推理优化·ai基础设施
智码看视界3 天前
开源大模型追踪:腾讯混元Hy4preview,FP8 770GB 落地企业私有化,Apache 2.0 无字段限制
开源·vllm·开源大模型·apache2.0·fp8量化·腾讯混元hy4·agent推理
梅雅达编程笔记3 天前
开源模型的安全悖论——越开放,越危险?
llama·qwen·开源大模型·ai安全·模型越狱·权重投毒·大模型治理
GitCode官方4 天前
“开源共生 共赢未来”2026北京昇腾生态先锋中心系列活动之算子实操工坊成功举办
人工智能·开源·昇腾·atomgit
super大力张5 天前
# MOE 肽类药物设计(十二):柔性肽怎么 Dock?从 Conformational Search 到 General Dock
cadd·moe·药物设计·肽设计
AI模力圈12 天前
从级联架构到生成式推荐:推荐算法演进与昇腾落地
推荐算法·昇腾·生成式推荐
super大力张14 天前
# MOE 肽类药物设计(八):让自定义非天然氨基酸真正可用——Rotamer Library 怎么建立?
cadd·moe
智码看视界14 天前
从零训出 7B 数学大模型全开源:ZGCM-1-7B 部署、实测与微调全记录
数学推理·本地部署·开源大模型·lora微调·zgcm-1-7b·256k长上下文