技术栈

单卡部署

智码看视界
3 小时前
昇腾·moe·开源大模型·智能体agent·本地推理·xing4.0-29b-a4b·单卡部署
开源大模型追踪:中电信人工智能Xing4.0-29B-A4B:SWE-bench 75.0逼近Qwen3.6-35B一句话定位:面向 Agent 的轻量 MoE,单张消费级显卡就能私有化跑长上下文智能体。这里要先说清一个容易混淆的点:总参 29B 听着比 7B 大,但本地跑得快不快,看的是"每 token 激活"而不是"总参"。Xing4.0 每 token 只点亮 4B 专家,推理算力开销接近一个 4B 稠密模型,显存却要装下全部 29B 权重——所以量化后单卡能跑,但原始 BF16 必须多卡。换句话说,它的"聪明"来自大权重库,"便宜"来自稀疏激活,两者分开看才不会误判部署门槛。
我是有底线的