轻量级 AI 代码生成平台搭建实战:Ollama 本地模型 + Continue.dev + Open Code Review 的低成本方案

轻量级 AI 代码生成平台搭建实战:Ollama 本地模型 + Continue.dev + Open Code Review 的低成本方案

本文面向小型企业和独立开发者,提供一套低成本、轻量级的 AI 代码生成平台搭建方案。核心思路是复用成熟开源工具 + 本地模型 + 按需调用云端 API,替代从零构建全栈平台,将硬件和软件成本控制在最低水平。

一、方案设计思路

1.1 小型企业的真实需求

大型企业自建代码生成平台需要 MySQL、Redis、Elasticsearch、MinIO、沙箱运行时等一整套基础设施,部署复杂、运维成本高。但对于 5-50 人的小型开发团队,真实需求其实很简单:

  • 代码补全:在 IDE 中实时获得代码建议
  • 代码对话:针对当前项目提问、解释代码、生成代码片段
  • 代码审查:在提交 PR 时获得自动化的 AI 审查意见
  • 数据安全:代码不发送到第三方服务器(可选,取决于行业)

类比:大企业方案像盖一栋带中央空调、电梯和地下车库的写字楼,而小团队只需要一个精装修的办公室------功能齐全,但不追求体量和奢华。

1.2 架构方案

复制代码
┌───────────────────────────────────────────────────────────────┐
│                    轻量级架构                                 │
│                                                               │
│  ┌─────────────────────────┐  ┌─────────────────────────┐   │
│  │   IDE 层(开发者机器)    │  │   CI/CD 层(可选)       │   │
│  │                         │  │                         │   │
│  │  ┌───────────────────┐  │  │  ┌───────────────────┐  │   │
│  │  │  Continue.dev     │  │  │  │  Open Code Review │  │   │
│  │  │  (VS Code/JetBrains)│  │  │  │  (PR 审查)       │  │   │
│  │  └────────┬──────────┘  │  │  └────────┬──────────┘  │   │
│  └───────────┼─────────────┘  └───────────┼─────────────┘   │
│              │                            │                  │
│              ▼                            ▼                  │
│  ┌────────────────────────────────────────────────────────┐  │
│  │              模型接入层                                  │  │
│  │  ┌─────────────┐  ┌─────────────┐  ┌───────────────┐  │  │
│  │  │ Ollama      │  │ 云端 API    │  │ 免费 API 层   │  │  │
│  │  │ (本地模型)   │  │ (按需调用)  │  │ (Gemini/Groq) │  │  │
│  │  └─────────────┘  └─────────────┘  └───────────────┘  │  │
│  └────────────────────────────────────────────────────────┘  │
│                                                               │
│  核心原则:能用本地模型的用本地,本地不够的走云端,           │
│           云端也要优先用免费额度。                             │
└───────────────────────────────────────────────────────────────┘

1.3 与传统自建方案的对比

维度 传统自建方案 轻量级方案
基础设施 MySQL + Redis + ES + MinIO + 沙箱 无需额外基础设施
部署复杂度 微服务集群,K8s 编排 单机部署,几条命令
硬件要求 GPU 服务器集群 消费级 GPU 或 Mac 即可
月度成本 数千至数万美元 0 到几百美元
适用团队 50 人以上 1-50 人
搭建周期 数周至数月 1-3 天
维护成本 需要专职运维 几乎无需维护

注:

博客:

https://blog.csdn.net/badao_liumang_qizhi

二、核心工具选型

2.1 三大核心组件

组件 推荐工具 作用 许可协议
本地模型运行时 Ollama 在本地运行开源代码模型 MIT
IDE 助手 Continue.dev VS Code/JetBrains 中的代码补全和对话 Apache 2.0
代码审查 Open Code Review PR 级别的 AI 代码审查 Apache 2.0

2.2 备选工具

场景 备选工具 特点
终端 AI 编程 OpenCode 192K★,支持 Gemini/Groq/Ollama 三条免费路线
私有化部署平台 MonkeyCode(长亭科技) 浏览器即用,支持团队协作和需求 SPEC 管理
轻量级 PR 审查 CodeOtter 自托管 PR 审查,无需付费 SaaS
极简编码 Agent WrenCode 单 Python 文件实现的轻量级 Agent

三、环境搭建

3.1 硬件要求

场景 最低配置 推荐配置
个人开发(轻量补全) 16GB RAM,无 GPU 32GB RAM,RTX 4060
团队共享(多人使用) 32GB RAM + RTX 4090 64GB RAM + RTX 4090×2
Mac 用户 M1 16GB M2/M3 32GB+

关键参考数据:

  • 8GB RAM :可运行 qwen2.5-coder:1.5b(约 1GB),提供基础代码补全
  • 16GB RAM :可运行 qwen2.5-coder:7b(约 4.5GB),具备较好的代码理解能力
  • 32GB RAM :可运行 qwen2.5-coder:14b,满足大多数开发场景
  • 24GB 显存 GPU :可运行 Qwen3.6-27B,在单卡上达到最佳编码质量
  • Qwen3-Coder-30B(Q4_K_M 量化):需要约 17.3 GiB 磁盘和 26GB 内存

3.2 第一步:安装 Ollama

bash 复制代码
# macOS / Linux
curl -fsSL https://ollama.ai/install.sh | sh

# Windows
# 从 https://ollama.com/download 下载安装包

# 验证安装
ollama --version

启动 Ollama 服务:

bash 复制代码
ollama serve
# 默认监听 http://localhost:11434

3.3 第二步:下载代码模型

根据硬件条件选择模型:

bash 复制代码
# 低配(8GB RAM)- 基础补全
ollama pull qwen2.5-coder:1.5b

# 中配(16GB RAM)- 日常开发
ollama pull qwen2.5-coder:7b

# 高配(32GB RAM)- 高质量代码生成
ollama pull qwen2.5-coder:14b

# 如果有独立 GPU(24GB 显存)
ollama pull qwen3-coder:30b-a3b-q4_K_M

Qwen3-Coder 是阿里开源的高性能编码模型,在 Aider benchmark 上达到 73.7% 的通过率,是目前开源代码模型中的领先者。

验证模型可用:

bash 复制代码
ollama run qwen2.5-coder:7b "写一个Java的快速排序"

3.4 第三步:安装 Continue.dev

VS Code:在扩展市场搜索 "Continue" 安装。

JetBrains:在插件市场搜索 "Continue" 安装。

安装完成后,创建配置文件 ~/.continue/config.yaml:

yaml 复制代码
name: My Config
version: 0.0.1
schema: v1

models:
  # 代码补全专用(小模型,快速响应)
  - name: 代码补全
    provider: ollama
    model: qwen2.5-coder:1.5b
    roles:
      - autocomplete
    defaultCompletionOptions:
      contextLength: 2048
      maxTokens: 256
      temperature: 0.1

  # 对话/代码生成专用(大模型,高质量)
  - name: 代码对话
    provider: ollama
    model: qwen2.5-coder:7b
    roles:
      - chat
      - edit
      - apply
    defaultCompletionOptions:
      contextLength: 8192
      maxTokens: 2048
      temperature: 0.3

  # 嵌入模型(用于 @codebase 检索)
  - name: 嵌入
    provider: ollama
    model: nomic-embed-text
    roles:
      - embed

context:
  - provider: code
  - provider: docs
  - provider: diff
  - provider: terminal
  - provider: codebase
  - provider: folder

slashCommands:
  - name: review
    description: 审查当前文件
    prompt: "请审查以下代码,指出问题并给出改进建议"
  - name: test
    description: 生成单元测试
    prompt: "请为以下代码生成完整的单元测试"
  - name: explain
    description: 解释代码
    prompt: "请解释以下代码的功能和实现原理"

配置说明:

  • 代码补全模型使用小模型(1.5b),追求低延迟(<300ms)
  • 对话模型使用大模型(7b/14b),追求高质量
  • @codebase 让 Continue 能够检索整个代码库,提供上下文感知的建议
  • 自定义 slash 命令可以固化团队常用的工作流

3.5 第四步:验证 IDE 集成

  1. 打开 VS Code,点击左侧 Continue 图标
  2. 在模型选择器中确认显示 "代码补全" 和 "代码对话"
  3. 在代码中输入函数签名,暂停后应出现补全建议
  4. 打开 Continue 对话框,输入问题验证对话功能

常见问题 :如果模型列表为空,检查 Ollama 是否正在运行(curl http://localhost:11434),以及 Continue 配置中的 provider: ollama 是否正确。


四、CI/CD 代码审查集成

4.1 安装 Open Code Review

阿里巴巴开源的 Open Code Review 是一款工程化 AI 代码审查工具,采用"确定性模块 + LLM Agent"混合架构,精准定位问题、严控误报率。

bash 复制代码
# 全局安装
npm install -g @alibaba-group/open-code-review

# 验证安装
ocr --version

4.2 配置模型

bash 复制代码
# 配置模型提供商
ocr config provider
# 选择 OpenAI 兼容接口(可指向 Ollama)

# 配置具体模型
ocr config model
# 输入模型名称,如 qwen2.5-coder:7b

如果使用 Ollama 作为后端,需要将 API 地址指向本地:

bash 复制代码
# Ollama 提供了 OpenAI 兼容的 API
export OPENAI_API_BASE=http://localhost:11434/v1
export OPENAI_API_KEY=ollama  # 任意值,Ollama 不验证

4.3 使用方式

bash 复制代码
# 工作区模式:审查所有 staged/unstaged/untracked 改动
ocr review

# 分支对比:审查 feature-branch 相对于 main 的改动
ocr review --from main --to feature-branch

# 单个 commit 审查
ocr review --commit abc123

Open Code Review 的审查流程是:Git diff → 文件选择 → 文件分束 → 规则匹配 → LLM Agent 生成评论 → 行级定位 → 反思校验。整个流程一个中等规模的 PR 大约 1-3 分钟完成。

4.4 集成到 GitHub Actions

yaml 复制代码
# .github/workflows/ai-review.yml
name: AI Code Review

on:
  pull_request:
    types: [opened, synchronize]

jobs:
  review:
    runs-on: ubuntu-latest
    steps:
      - uses: actions/checkout@v4
        with:
          fetch-depth: 0

      - name: Setup Node.js
        uses: actions/setup-node@v4
        with:
          node-version: '22'

      - name: Install Open Code Review
        run: npm install -g @alibaba-group/open-code-review

      - name: Run AI Review
        env:
          OPENAI_API_BASE: ${{ secrets.OPENAI_API_BASE }}
          OPENAI_API_KEY: ${{ secrets.OPENAI_API_KEY }}
        run: |
          ocr review --from origin/${{ github.base_ref }} --to HEAD

五、成本估算与优化

5.1 硬件成本

方案 一次性投入 适用规模
纯 CPU(16GB RAM 笔记本) 已有设备,0 元 1-3 人,基础补全
单卡 GPU 工作站 ¥8,000-15,000(RTX 4060/4070) 3-10 人,日常开发
Mac Studio M2 Ultra ¥30,000+ 10-20 人,高质量生成
团队共享 GPU 服务器 ¥50,000-100,000 20-50 人,企业级

5.2 软件成本

组件 成本
Ollama 免费(MIT)
Continue.dev 免费(Apache 2.0)
Open Code Review 免费(Apache 2.0)
本地模型(Qwen2.5-Coder) 免费(Apache 2.0)

5.3 云端 API 兜底(可选)

当本地模型无法满足需求时,可以配置云端 API 作为兜底:

Provider 免费额度 适用场景
Google Gemini 每天 1M tokens(Gemini 1.5 Flash) 个人日常使用
Groq 免费 API,无严格 token 总量限制 高频调用,速度优先
DeepSeek 约 ¥1/百万输入 tokens 高质量代码生成

在 Continue.dev 的配置中,可以设置云端模型作为 fallback:

yaml 复制代码
models:
  - name: 代码对话
    provider: ollama
    model: qwen2.5-coder:7b
    roles: [chat, edit]

  - name: 云端兜底
    provider: openai
    model: deepseek-chat
    apiBase: https://api.deepseek.com/v1
    apiKey: ${DEEPSEEK_API_KEY}
    roles: [chat]

类比:这就像家里做饭(本地模型)为主,偶尔点外卖(云端 API)为辅。日常三餐在家做,成本最低;偶尔想吃大餐或者家里没食材时,点一份外卖应急。

5.4 成本对比

方案 月度成本(10 人团队)
GitHub Copilot Business 19 × 10 = 190/月
Cursor Business 40 × 10 = 400/月
本文轻量级方案 约 $0-50/月(仅云端兜底时)

六、生产运维

6.1 团队共享 Ollama 服务

如果团队成员共用一台 GPU 服务器,需要将 Ollama 配置为网络可访问:

bash 复制代码
# 在 GPU 服务器上设置
export OLLAMA_HOST=0.0.0.0
ollama serve

团队成员在各自机器的 Continue 配置中指向服务器地址:

yaml 复制代码
models:
  - name: 代码对话
    provider: ollama
    model: qwen2.5-coder:7b
    apiBase: http://gpu-server:11434
    roles: [chat, edit]

6.2 模型切换策略

任务类型 推荐模型 理由
代码补全 qwen2.5-coder:1.5b 低延迟,快速响应
代码解释 qwen2.5-coder:7b 平衡质量与速度
代码生成/重构 qwen2.5-coder:14b 或 qwen3-coder:30b 高质量输出
代码审查 qwen2.5-coder:7b 足够发现常见问题

6.3 常见问题排查

问题 原因 解决方案
补全延迟高 模型过大 换用更小的补全模型(1.5b)
代码质量差 模型能力不足 升级到 14b 或 30b 模型
Ollama 内存不足 模型超出 RAM 使用更低量化版本(Q4_K_M)
Continue 无法连接 Ollama 未运行 检查 ollama serve 状态

七、总结

本文提供了一套面向小型企业的轻量级 AI 代码生成平台搭建方案,核心要点如下:

维度 方案
本地模型 Ollama + Qwen2.5-Coder/Qwen3-Coder
IDE 集成 Continue.dev(VS Code/JetBrains)
代码审查 Open Code Review(CI/CD 集成)
硬件要求 16GB RAM 起步,推荐 32GB+
软件成本 全部免费开源
月度成本 0(纯本地)到 50(含云端兜底)
搭建周期 1-2 天

这套方案的核心设计哲学是复用成熟开源工具,不重复造轮子。大型企业自建平台需要数周的开发和持续的运维投入,而小型团队通过这些工具的组合,可以在 1-2 天内获得 80% 的功能覆盖,且几乎没有持续成本。

下一步建议:

  1. 先在 1-2 台开发机上验证 Ollama + Continue.dev 的效果
  2. 根据团队反馈决定是否需要共享 GPU 服务器
  3. 在 CI/CD 中集成 Open Code Review,提升代码审查效率
  4. 根据实际使用情况,选择性配置云端 API 作为兜底

参考资源:

博客: https://blog.csdn.net/badao_liumang_qizhi

相关推荐
BOBY_KEJI1 小时前
AI交互技术赋能线下展示终端:多模式智能运行机制解析
人工智能
java资料站1 小时前
十三、SpringAl 知识库AI问答系统简单实现
人工智能
该逃避避1 小时前
Chrome 插件开发实战指南
人工智能
larance1 小时前
[菜鸟教程] 机器学习教程十课-Python 机器学习应用
人工智能·python·机器学习
Aloudata1 小时前
Metric Layer 建设指南:如何先从核心指标层启动企业语义工程
大数据·人工智能·数据分析·data agent·语义层
聪明蛋子哟1 小时前
不仅仅是向量检索:结合知识图谱与Tool Calling的混合增强生成(Hybrid RAG)方案
人工智能·算法·知识图谱
雪兽软件2 小时前
AI如何玩转太空探索?
人工智能·太空探索
jerryinwuhan2 小时前
HV-DGTF数据治理框架
大数据·人工智能