一、模型速览
| 项 | 规格 |
|---|---|
| 模型 | Xing4.0-29B-A4B(星辰系列,前身 TeleChat) |
| 发布方 | 中电信人工智能科技(TeleAI) |
| 参数量 | 29B 总参 / 4B 激活(64 路由专家 + 1 共享,每 token 激活 4) |
| 上下文 | 原生 256K,可扩 512K |
| 架构 | mHC + MLA + MTP,40 层,隐藏 3584 |
| 许可 | Apache-2.0 |
| 显存 | BF16 ~58GB;4-bit ~15GB(单卡 24GB 可跑) |
| 训练底座 | 昇腾 910C + MindSpore(国产全栈) |
| 开源 | 2026-09-17(HF / ModelScope / 魔乐) |
一句话定位:面向 Agent 的轻量 MoE,单张消费级显卡就能私有化跑长上下文智能体。
这里要先说清一个容易混淆的点:总参 29B 听着比 7B 大,但本地跑得快不快,看的是"每 token 激活"而不是"总参"。Xing4.0 每 token 只点亮 4B 专家,推理算力开销接近一个 4B 稠密模型,显存却要装下全部 29B 权重------所以量化后单卡能跑,但原始 BF16 必须多卡。换句话说,它的"聪明"来自大权重库,"便宜"来自稀疏激活,两者分开看才不会误判部署门槛。
本周(9/17--9/24)可单卡部署的开源模型里,它是 Agent 向最值得做的一篇。本专栏此前写过 Nex-N2.5-mini(35B/3B,9/14)、K2-Horizon-7B(7B,9/7)、Apodex-1.1-mini(35B,8/31),Xing4.0 以 29B/4B + 原生 Agent 调优 + Apache-2.0,正好补齐"机房级之外、桌面级能跑的 Agent 基座"这一档------而且它是国产算力全栈训出来的,对信创场景格外对症。
二、核心亮点
1. 4B 激活干翻 2--3 倍体量的 Agent 友商。 在官方评测里,Xing4.0-29B-A4B 的 SWE-bench Verified 75.0 仅落后 Qwen3.6-35B-A3B(76.0)1 分,却把 Gemma4-26B-A4B(53.0)甩开 22 分;Terminal-Bench 2.1 57.5 同时超过 Qwen3.6(51.5)和 Gemma4(30.0);Claw-Eval 76.55 是三者最高(来源:中电信模型卡)。这意味着"修真实仓库 bug + 跑终端命令"这类最高频的本地 Agent 场景,29B/4B 已经够用,不必为分数硬上 35B。
2. 4-bit 量化把部署门槛从集群砍到桌面。 FP16 整包约 60GB,消费级显卡根本扛不住;官方 4-bit 量化把显存压到约 15GB(较 FP16 降约 75%),RTX 3090 / 4090 这类 24GB 卡直接单卡跑长上下文任务,硬件成本从数万元级 A100 降到数千元级 RTX 40 系(来源:中电信 09-22 发布 / 经济参考报)。对中小企业和"数据不出域"的客服、财务场景,这是把 Agent 从 PPT 拽进生产系统的关键一跳。
3. mHC + MLA + MTP 三件套专治长程 Agent。 MLA 压缩 KV 缓存(长上下文才跑得动),MTP 多 token 预测增强生成连贯性并兼作投机解码提速,mHC(流形约束超连接)稳住 40 层深层训练------三者合力让模型在多步规划、工具调用、长会话下不"走丢计划"(来源:官方架构说明)。这正是它 Terminal-Bench / DeepresearchBII 反超同尺寸友商的结构性原因。
4. 国产全栈训练 + 跨芯一键部署。 首个该体量完全基于昇腾 910C + MindSpore 训练的开源模型,整网训练吞吐较开箱提升约 96%;推理侧基于 FlagOS 统一栈已在昇腾、沐曦、摩尔线程、平头哥、海光等 6 款国产芯片完成跨芯适配,提供 vLLM-plugin-FL / SGLang-plugin-FL 插件(来源:官方 / 经济参考报)。信创环境要"自主可控基座"的团队,这是目前少有的、训练到推理全链路国产可查的公开权重。
5. 对主流 Agent 框架零改造接入。 权重已针对 OpenCode、Claude Code、OpenClaw、Hermes 做格式对齐,开发者不用改工程就能挂上现有工作流;微调走 LLaMA-Factory / MindFormers,沿用熟悉工具链(来源:官方 README)。
三、部署实战
重要前提:Xing4.0 是自定义架构,Transformers / vLLM 均需
trust_remote_code(会执行仓库代码,生产请固定 commit);vLLM / SGLang / llama.cpp / KTransformers 的官方适配 PR 截至发布仍 pending,需走 PR 分支而非稳定版。本机无 GPU,以下为代码与命令,未做实测。
方式一:Transformers 单机推理(最通用,需 trust_remote_code)
bash
pip install transformers torch modelscope
bash
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
path = "XingChen-AGI/Xing4.0-29B-A4B"
tokenizer = AutoTokenizer.from_pretrained(path, trust_remote_code=True)
# 自定义 mHC+MLA+MTP 架构,必须 trust_remote_code
model = AutoModelForCausalLM.from_pretrained(
path, trust_remote_code=True, device_map="auto", torch_dtype=torch.bfloat16
)
messages = [{"role": "user", "content": "用 Python 写一个快速排序,并加注释。"}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
model_inputs = tokenizer(text, return_tensors="pt").to(model.device)
generated_ids = model.generate(
**model_inputs, top_p=0.95, temperature=1.0,
repetition_penalty=1.05, max_new_tokens=4096
)
response = tokenizer.decode(generated_ids[0], skip_special_tokens=False,
spaces_between_special_tokens=False)
# 模型默认开启 thinking,输出含思考链;最终回答在 </think> 标记之后
answer = response.split("</think>")[-1].strip() if "</think>" in response else response
print(answer)
方式二:vLLM 起 OpenAI 兼容服务(适合并发 Agent)
bash
# 需先切到含 xing4 支持的 vLLM PR 分支(官方主分支尚未合入)
pip install git+https://github.com/vllm-project/vllm@xing4-support # 示意,以官方 PR 为准
bash
vllm serve XingChen-AGI/Xing4.0-29B-A4B \
--host 0.0.0.0 --port 8000 \
--served-model-name Xing4.0-29B-A4B \
--tensor-parallel-size 2 \
--trust-remote-code \
--max-model-len 262144 \
--gpu-memory-utilization 0.90 \
--reasoning-parser xing4 --tool-call-parser xing4 \
--speculative-config '{"method":"mtp","num_speculative_tokens":1}'
说明:
--tensor-parallel-size 2是因为 BF16 整包约 58--60GB,需 2×24GB 或 1×80GB;单张 24GB 卡请改用 4-bit GGUF / INT4 量化版本(约 15GB),否则放不下。MTP 投机解码走--speculative-config,xing4解析器负责思考链与工具调用。
python
# 服务起来后用 OpenAI 客户端对话(pip install openai)
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
# 代码 / Agent 任务把 temperature 降到 0.8;复杂推理用 1.0
r = client.chat.completions.create(
model="Xing4.0-29B-A4B",
messages=[{"role": "user",
"content": "帮我对比两个开源模型的 API 成本,输出带数据表格的选型报告。"}],
temperature=0.8, top_p=0.95, max_tokens=4096,
)
print(r.choices[0].message.content)
方式三:单卡 24GB 走 GGUF(llama.cpp,PR 待合入)
bash
# 下载社区/官方 GGUF 量化(4-bit 约 15GB),用 llama.cpp PR 分支启动
llama-server -m Xing4.0-29B-A4B-Q4_K_M.gguf \
-c 262144 --host 0.0.0.0 --port 8080
选型建议:纯本地离线用 Transformers / GGUF 最省心;要做 Agent 并发服务用 vLLM(注意 PR 分支);信创环境走 FlagOS 的 vLLM-plugin-FL / SGLang-plugin-FL。
补充一个提速细节:模型默认开启 thinking(思考链),输出会先吐一大段推理再给答案。对延迟敏感的场景(比如客服实时应答),可通过 chat template 参数关掉 thinking 直接出结果;代价是复杂任务准确率会掉,建议按"简单任务关、难任务开"切。上面 Python 示例已用 </think> 标记兜底解析,万一标记名与本地权重不一致,直接打印 response 看一眼真实分隔符即可,别硬切。
四、性能测评
| 模型 | 总参/激活 | SWE-bench Verified | Terminal-Bench 2.1 | Claw-Eval | 单卡 24GB 可跑 |
|---|---|---|---|---|---|
| Xing4.0-29B-A4B | 29B/4B | 75.0 | 57.5 | 76.55 | 4-bit≈15GB ✓ |
| Qwen3.6-35B-A3B | 35B/3B | 76.0 | 51.5 | 74.54 | 需量化 |
| Gemma4-26B-A4B | 26B/4B | 53.0 | 30.0 | 71.49 | --- |
数据来源:中电信官方模型卡(厂商自报,含温度/上下文/跑次配置);SuperCLUE 智能体得分 Xing4.0 93.52(第 3,与 Qwen3.8-27B 94.49、Qwen3.6-35B-A3B 94.04 差距 <1 分)。
三维度看:
- 推理速度:厂商称单卡 4-bit 约 30 tok/s(来源:中电信 09-22 发布);BF16 多卡更高但未公布具体值。需要提醒的是,30 tok/s 是 4-bit + 单卡 24GB 的厂商口径,开 thinking 时因为要先生成整段推理链,首字延迟会明显变大------真正卡顿感来自 TTFT 而非持续吞吐。本机无 GPU,未实测,此数仅作参考,欢迎读者在自有硬件验证;若你实测偏差较大,多半是量化档位或上下文长度不同,属正常。
- 显存:BF16 ~58--60GB(2×24GB 或 1×80GB);4-bit ~15GB(单卡 24GB);FP8 介于二者。MLA 压缩 KV 让长上下文的显存增幅可控。
- 生成质量:Agent 三项(SWE-bench / Terminal-Bench / Claw-Eval)均逼近或超过体量更大的 Qwen3.6-35B-A3B,长程研究(DeepresearchBII 60.80)也略胜;短板在数学(AIME2026 90.0 落后 Qwen3.6 的 92.7)与指令跟随(IFBench 69.67 落后 Gemma4 的 72.67)。一句话:它是"Agent / 代码执行基座",不是"通才问答机"。
数据口径提醒:以上基准全部为厂商自报,官方模型卡已附评测配置;第三方独立复测尚未铺开,选型时建议以 SWE-bench / Terminal-Bench 的社区复跑为准,别被单点分数带节奏。tok/s 为厂商口径、非本机实测。
五、使用建议
部署档位速查:
-
单卡 24GB(3090/4090):4-bit GGUF / INT4 ≈15GB,本地 Agent、数据不出域
-
2×24GB 或 1×80GB:BF16 满血,长上下文 + 高并发
-
信创环境:FlagOS 插件 + 国产芯片(昇腾/沐曦/摩尔线程等)一键部署
-
多卡机房:不划算,29B 体量本就不该上集群
-
适用场景:私有化代码助手、终端/运维 Agent、客服智能体(套餐变更、账单查询)、财务报表解析、投标文件拆解等"数据不出域"的高频业务;中小企业低成本 Agent 落地;信创环境自主可控基座。
-
不适用场景:纯通识问答(数学/指令跟随弱于同尺寸友商);超长程多步规划(DeepresearchBII 60.80 尚可但不如 1T+ 旗舰);需要稳定 vLLM 主分支支持的团队(当前 PR 待合入,得自己维护分支)。
-
调优提示:① 代码/Agent 任务 temperature 设 0.8,复杂推理设 1.0;② 单卡务必走 4-bit,给 KV cache 留余量;③ 接 Agent 框架用官方 xing4 解析器,否则思考链/工具调用不解析;④ 想要满血质量上 2 卡 BF16,但性价比不如单卡 4-bit。