轻量级 AI 代码生成平台搭建实战:Ollama 本地模型 + Continue.dev + Open Code Review 的低成本方案
本文面向小型企业和独立开发者,提供一套低成本、轻量级的 AI 代码生成平台搭建方案。核心思路是复用成熟开源工具 + 本地模型 + 按需调用云端 API,替代从零构建全栈平台,将硬件和软件成本控制在最低水平。
一、方案设计思路
1.1 小型企业的真实需求
大型企业自建代码生成平台需要 MySQL、Redis、Elasticsearch、MinIO、沙箱运行时等一整套基础设施,部署复杂、运维成本高。但对于 5-50 人的小型开发团队,真实需求其实很简单:
- 代码补全:在 IDE 中实时获得代码建议
- 代码对话:针对当前项目提问、解释代码、生成代码片段
- 代码审查:在提交 PR 时获得自动化的 AI 审查意见
- 数据安全:代码不发送到第三方服务器(可选,取决于行业)
类比:大企业方案像盖一栋带中央空调、电梯和地下车库的写字楼,而小团队只需要一个精装修的办公室------功能齐全,但不追求体量和奢华。
1.2 架构方案
┌───────────────────────────────────────────────────────────────┐
│ 轻量级架构 │
│ │
│ ┌─────────────────────────┐ ┌─────────────────────────┐ │
│ │ IDE 层(开发者机器) │ │ CI/CD 层(可选) │ │
│ │ │ │ │ │
│ │ ┌───────────────────┐ │ │ ┌───────────────────┐ │ │
│ │ │ Continue.dev │ │ │ │ Open Code Review │ │ │
│ │ │ (VS Code/JetBrains)│ │ │ │ (PR 审查) │ │ │
│ │ └────────┬──────────┘ │ │ └────────┬──────────┘ │ │
│ └───────────┼─────────────┘ └───────────┼─────────────┘ │
│ │ │ │
│ ▼ ▼ │
│ ┌────────────────────────────────────────────────────────┐ │
│ │ 模型接入层 │ │
│ │ ┌─────────────┐ ┌─────────────┐ ┌───────────────┐ │ │
│ │ │ Ollama │ │ 云端 API │ │ 免费 API 层 │ │ │
│ │ │ (本地模型) │ │ (按需调用) │ │ (Gemini/Groq) │ │ │
│ │ └─────────────┘ └─────────────┘ └───────────────┘ │ │
│ └────────────────────────────────────────────────────────┘ │
│ │
│ 核心原则:能用本地模型的用本地,本地不够的走云端, │
│ 云端也要优先用免费额度。 │
└───────────────────────────────────────────────────────────────┘
1.3 与传统自建方案的对比
| 维度 | 传统自建方案 | 轻量级方案 |
|---|---|---|
| 基础设施 | MySQL + Redis + ES + MinIO + 沙箱 | 无需额外基础设施 |
| 部署复杂度 | 微服务集群,K8s 编排 | 单机部署,几条命令 |
| 硬件要求 | GPU 服务器集群 | 消费级 GPU 或 Mac 即可 |
| 月度成本 | 数千至数万美元 | 0 到几百美元 |
| 适用团队 | 50 人以上 | 1-50 人 |
| 搭建周期 | 数周至数月 | 1-3 天 |
| 维护成本 | 需要专职运维 | 几乎无需维护 |
注:
博客:
https://blog.csdn.net/badao_liumang_qizhi
二、核心工具选型
2.1 三大核心组件
| 组件 | 推荐工具 | 作用 | 许可协议 |
|---|---|---|---|
| 本地模型运行时 | Ollama | 在本地运行开源代码模型 | MIT |
| IDE 助手 | Continue.dev | VS Code/JetBrains 中的代码补全和对话 | Apache 2.0 |
| 代码审查 | Open Code Review | PR 级别的 AI 代码审查 | Apache 2.0 |
2.2 备选工具
| 场景 | 备选工具 | 特点 |
|---|---|---|
| 终端 AI 编程 | OpenCode | 192K★,支持 Gemini/Groq/Ollama 三条免费路线 |
| 私有化部署平台 | MonkeyCode(长亭科技) | 浏览器即用,支持团队协作和需求 SPEC 管理 |
| 轻量级 PR 审查 | CodeOtter | 自托管 PR 审查,无需付费 SaaS |
| 极简编码 Agent | WrenCode | 单 Python 文件实现的轻量级 Agent |
三、环境搭建
3.1 硬件要求
| 场景 | 最低配置 | 推荐配置 |
|---|---|---|
| 个人开发(轻量补全) | 16GB RAM,无 GPU | 32GB RAM,RTX 4060 |
| 团队共享(多人使用) | 32GB RAM + RTX 4090 | 64GB RAM + RTX 4090×2 |
| Mac 用户 | M1 16GB | M2/M3 32GB+ |
关键参考数据:
- 8GB RAM :可运行
qwen2.5-coder:1.5b(约 1GB),提供基础代码补全 - 16GB RAM :可运行
qwen2.5-coder:7b(约 4.5GB),具备较好的代码理解能力 - 32GB RAM :可运行
qwen2.5-coder:14b,满足大多数开发场景 - 24GB 显存 GPU :可运行
Qwen3.6-27B,在单卡上达到最佳编码质量 - Qwen3-Coder-30B(Q4_K_M 量化):需要约 17.3 GiB 磁盘和 26GB 内存
3.2 第一步:安装 Ollama
bash
# macOS / Linux
curl -fsSL https://ollama.ai/install.sh | sh
# Windows
# 从 https://ollama.com/download 下载安装包
# 验证安装
ollama --version
启动 Ollama 服务:
bash
ollama serve
# 默认监听 http://localhost:11434
3.3 第二步:下载代码模型
根据硬件条件选择模型:
bash
# 低配(8GB RAM)- 基础补全
ollama pull qwen2.5-coder:1.5b
# 中配(16GB RAM)- 日常开发
ollama pull qwen2.5-coder:7b
# 高配(32GB RAM)- 高质量代码生成
ollama pull qwen2.5-coder:14b
# 如果有独立 GPU(24GB 显存)
ollama pull qwen3-coder:30b-a3b-q4_K_M
Qwen3-Coder 是阿里开源的高性能编码模型,在 Aider benchmark 上达到 73.7% 的通过率,是目前开源代码模型中的领先者。
验证模型可用:
bash
ollama run qwen2.5-coder:7b "写一个Java的快速排序"
3.4 第三步:安装 Continue.dev
VS Code:在扩展市场搜索 "Continue" 安装。
JetBrains:在插件市场搜索 "Continue" 安装。
安装完成后,创建配置文件 ~/.continue/config.yaml:
yaml
name: My Config
version: 0.0.1
schema: v1
models:
# 代码补全专用(小模型,快速响应)
- name: 代码补全
provider: ollama
model: qwen2.5-coder:1.5b
roles:
- autocomplete
defaultCompletionOptions:
contextLength: 2048
maxTokens: 256
temperature: 0.1
# 对话/代码生成专用(大模型,高质量)
- name: 代码对话
provider: ollama
model: qwen2.5-coder:7b
roles:
- chat
- edit
- apply
defaultCompletionOptions:
contextLength: 8192
maxTokens: 2048
temperature: 0.3
# 嵌入模型(用于 @codebase 检索)
- name: 嵌入
provider: ollama
model: nomic-embed-text
roles:
- embed
context:
- provider: code
- provider: docs
- provider: diff
- provider: terminal
- provider: codebase
- provider: folder
slashCommands:
- name: review
description: 审查当前文件
prompt: "请审查以下代码,指出问题并给出改进建议"
- name: test
description: 生成单元测试
prompt: "请为以下代码生成完整的单元测试"
- name: explain
description: 解释代码
prompt: "请解释以下代码的功能和实现原理"
配置说明:
- 代码补全模型使用小模型(1.5b),追求低延迟(<300ms)
- 对话模型使用大模型(7b/14b),追求高质量
@codebase让 Continue 能够检索整个代码库,提供上下文感知的建议- 自定义 slash 命令可以固化团队常用的工作流
3.5 第四步:验证 IDE 集成
- 打开 VS Code,点击左侧 Continue 图标
- 在模型选择器中确认显示 "代码补全" 和 "代码对话"
- 在代码中输入函数签名,暂停后应出现补全建议
- 打开 Continue 对话框,输入问题验证对话功能
常见问题 :如果模型列表为空,检查 Ollama 是否正在运行(curl http://localhost:11434),以及 Continue 配置中的 provider: ollama 是否正确。
四、CI/CD 代码审查集成
4.1 安装 Open Code Review
阿里巴巴开源的 Open Code Review 是一款工程化 AI 代码审查工具,采用"确定性模块 + LLM Agent"混合架构,精准定位问题、严控误报率。
bash
# 全局安装
npm install -g @alibaba-group/open-code-review
# 验证安装
ocr --version
4.2 配置模型
bash
# 配置模型提供商
ocr config provider
# 选择 OpenAI 兼容接口(可指向 Ollama)
# 配置具体模型
ocr config model
# 输入模型名称,如 qwen2.5-coder:7b
如果使用 Ollama 作为后端,需要将 API 地址指向本地:
bash
# Ollama 提供了 OpenAI 兼容的 API
export OPENAI_API_BASE=http://localhost:11434/v1
export OPENAI_API_KEY=ollama # 任意值,Ollama 不验证
4.3 使用方式
bash
# 工作区模式:审查所有 staged/unstaged/untracked 改动
ocr review
# 分支对比:审查 feature-branch 相对于 main 的改动
ocr review --from main --to feature-branch
# 单个 commit 审查
ocr review --commit abc123
Open Code Review 的审查流程是:Git diff → 文件选择 → 文件分束 → 规则匹配 → LLM Agent 生成评论 → 行级定位 → 反思校验。整个流程一个中等规模的 PR 大约 1-3 分钟完成。
4.4 集成到 GitHub Actions
yaml
# .github/workflows/ai-review.yml
name: AI Code Review
on:
pull_request:
types: [opened, synchronize]
jobs:
review:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v4
with:
fetch-depth: 0
- name: Setup Node.js
uses: actions/setup-node@v4
with:
node-version: '22'
- name: Install Open Code Review
run: npm install -g @alibaba-group/open-code-review
- name: Run AI Review
env:
OPENAI_API_BASE: ${{ secrets.OPENAI_API_BASE }}
OPENAI_API_KEY: ${{ secrets.OPENAI_API_KEY }}
run: |
ocr review --from origin/${{ github.base_ref }} --to HEAD
五、成本估算与优化
5.1 硬件成本
| 方案 | 一次性投入 | 适用规模 |
|---|---|---|
| 纯 CPU(16GB RAM 笔记本) | 已有设备,0 元 | 1-3 人,基础补全 |
| 单卡 GPU 工作站 | ¥8,000-15,000(RTX 4060/4070) | 3-10 人,日常开发 |
| Mac Studio M2 Ultra | ¥30,000+ | 10-20 人,高质量生成 |
| 团队共享 GPU 服务器 | ¥50,000-100,000 | 20-50 人,企业级 |
5.2 软件成本
| 组件 | 成本 |
|---|---|
| Ollama | 免费(MIT) |
| Continue.dev | 免费(Apache 2.0) |
| Open Code Review | 免费(Apache 2.0) |
| 本地模型(Qwen2.5-Coder) | 免费(Apache 2.0) |
5.3 云端 API 兜底(可选)
当本地模型无法满足需求时,可以配置云端 API 作为兜底:
| Provider | 免费额度 | 适用场景 |
|---|---|---|
| Google Gemini | 每天 1M tokens(Gemini 1.5 Flash) | 个人日常使用 |
| Groq | 免费 API,无严格 token 总量限制 | 高频调用,速度优先 |
| DeepSeek | 约 ¥1/百万输入 tokens | 高质量代码生成 |
在 Continue.dev 的配置中,可以设置云端模型作为 fallback:
yaml
models:
- name: 代码对话
provider: ollama
model: qwen2.5-coder:7b
roles: [chat, edit]
- name: 云端兜底
provider: openai
model: deepseek-chat
apiBase: https://api.deepseek.com/v1
apiKey: ${DEEPSEEK_API_KEY}
roles: [chat]
类比:这就像家里做饭(本地模型)为主,偶尔点外卖(云端 API)为辅。日常三餐在家做,成本最低;偶尔想吃大餐或者家里没食材时,点一份外卖应急。
5.4 成本对比
| 方案 | 月度成本(10 人团队) |
|---|---|
| GitHub Copilot Business | 19 × 10 = 190/月 |
| Cursor Business | 40 × 10 = 400/月 |
| 本文轻量级方案 | 约 $0-50/月(仅云端兜底时) |
六、生产运维
6.1 团队共享 Ollama 服务
如果团队成员共用一台 GPU 服务器,需要将 Ollama 配置为网络可访问:
bash
# 在 GPU 服务器上设置
export OLLAMA_HOST=0.0.0.0
ollama serve
团队成员在各自机器的 Continue 配置中指向服务器地址:
yaml
models:
- name: 代码对话
provider: ollama
model: qwen2.5-coder:7b
apiBase: http://gpu-server:11434
roles: [chat, edit]
6.2 模型切换策略
| 任务类型 | 推荐模型 | 理由 |
|---|---|---|
| 代码补全 | qwen2.5-coder:1.5b | 低延迟,快速响应 |
| 代码解释 | qwen2.5-coder:7b | 平衡质量与速度 |
| 代码生成/重构 | qwen2.5-coder:14b 或 qwen3-coder:30b | 高质量输出 |
| 代码审查 | qwen2.5-coder:7b | 足够发现常见问题 |
6.3 常见问题排查
| 问题 | 原因 | 解决方案 |
|---|---|---|
| 补全延迟高 | 模型过大 | 换用更小的补全模型(1.5b) |
| 代码质量差 | 模型能力不足 | 升级到 14b 或 30b 模型 |
| Ollama 内存不足 | 模型超出 RAM | 使用更低量化版本(Q4_K_M) |
| Continue 无法连接 | Ollama 未运行 | 检查 ollama serve 状态 |
七、总结
本文提供了一套面向小型企业的轻量级 AI 代码生成平台搭建方案,核心要点如下:
| 维度 | 方案 |
|---|---|
| 本地模型 | Ollama + Qwen2.5-Coder/Qwen3-Coder |
| IDE 集成 | Continue.dev(VS Code/JetBrains) |
| 代码审查 | Open Code Review(CI/CD 集成) |
| 硬件要求 | 16GB RAM 起步,推荐 32GB+ |
| 软件成本 | 全部免费开源 |
| 月度成本 | 0(纯本地)到 50(含云端兜底) |
| 搭建周期 | 1-2 天 |
这套方案的核心设计哲学是复用成熟开源工具,不重复造轮子。大型企业自建平台需要数周的开发和持续的运维投入,而小型团队通过这些工具的组合,可以在 1-2 天内获得 80% 的功能覆盖,且几乎没有持续成本。
下一步建议:
- 先在 1-2 台开发机上验证 Ollama + Continue.dev 的效果
- 根据团队反馈决定是否需要共享 GPU 服务器
- 在 CI/CD 中集成 Open Code Review,提升代码审查效率
- 根据实际使用情况,选择性配置云端 API 作为兜底
参考资源: