本文介绍如何在本地环境搭建一个小说续写的环境,采用Opencode + 云平台部署私有模型的方式来进行。
部署私有模型
在本地环境或在云平台上租用GPU资源,部署私有模型。主要是考虑到性价比,以及减少公有模型对小说题材内容等各方面的限制。
这里选用的是Modelscope的Limu520/Huihui-Qwen3.8-27B-abliterated-UD-Q4_K_XL模型。下载之后,采用llama.cpp推理框架来进行部署。
运行以下命令安装llama.cpp
curl -LsSf https://llama.app/install.sh | sh
然后运行以下命令来启动模型服务:
llama serve \
-m /path/Qwen3.8-27B-abliterated-UD-Q4_K_XL/Huihui-Qwen3.8-27B-abliterated-UD-Q4_K_XL.gguf \
-md /path/Qwen3.8-27B-abliterated-UD-Q4_K_XL/Qwen3.8-27B-DFlash2-Q4_K_M.gguf \
--spec-type draft-dflash \
--spec-draft-n-max 7 \
-ngl 99 -ngld 99 \
-fa on \
--jinja \
--host 0.0.0.0 \
--port 8888 \
--alias qwen3.8-27b \
--ctx-size 131072 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--reasoning-budget 0
这里除了加载主模型外,还加载了DFLASH模型,这个模型提供了推测解码的功能,通过小模型打草稿,大模型验证的方式,加快Token生成的速度。这里面ctx-size是控制上下文长度,在我采用的5090 32G显卡,这个长度是一个比较合适的数值。模型服务运行后,能稳定提供大约50+ Token/s的速度。
opencode运行
配置好模型之后,就可以在Opencode里面添加该模型,只要在Opencode的对话窗口里提供模型访问地址让其自动添加即可。另外还需要让opencode安装**opencode-novel-plugin这个插件,这个插件** 提供了3个专用Agent、7个工具、5个Skill(含武侠专项) ,覆盖从故事概念到成稿的完整工作流。它明确对武侠小说创作有专门优化 ,并融合了"优先级分层上下文(P0/P1/P2)"等机制。安装后通过 /novel-init 等命令启动。
最后在Opencode里面指定要参考的小说,让其按照风格来创作,或者进行续写等即可。