目录
[第二步:VS Code 的灵魂------Continue 插件](#第二步:VS Code 的灵魂——Continue 插件)
[1. 强制启用"代码库感知 (Embeddings)"](#1. 强制启用“代码库感知 (Embeddings)”)
[2. "RAG + 本地索引"是关键](#2. “RAG + 本地索引”是关键)
[3. 混合接入策略 (Hybrid Strategy)](#3. 混合接入策略 (Hybrid Strategy))

如果您喜欢此文章,请收藏、点赞、评论,谢谢,祝您快乐每一天。
将 Copilot 换成本地模型,不仅是为了省钱,更是为了极致的隐私安全 和完全离线的开发体验 。在 VS Code 中实现这一目标,目前最成熟的路径是:Ollama (引擎) + Continue (插件) + 优秀的本地模型。
以下是我的"保姆级"本地化接入方案,贴出来供你实战参考:
第一步:本地算力中心------Ollama
Ollama 是目前本地模型运行最稳定的引擎。
- 下载安装 :ollama.com。
- 拉取模型 :打开终端,根据你的内存(RAM/VRAM)大小拉取模型:
- 入门级 (8GB-16GB 内存) :
ollama run qwen2.5-coder:7b(目前 7B 级别代码能力最强,性价比极高)。 - 进阶级 (24GB+ 显存) :
ollama run qwen2.5-coder:14b或deepseek-coder-v2。
- 入门级 (8GB-16GB 内存) :
- 设置 API 服务 :Ollama 默认会在
http://localhost:11434开启服务,这就是你的"本地云"。
第二步:VS Code 的灵魂------Continue 插件
别再去尝试那些配置复杂的自定义脚本了,Continue 是目前 VS Code 上最强的开源 AI 编程插件,完美替代 Copilot。
- 安装 :在 VS Code 插件市场直接搜索
Continue安装。 - 配置本地后端 :
- 点击侧边栏的 Continue 图标,打开设置 (
config.json)。 - 添加你的 Ollama 模型:
- 点击侧边栏的 Continue 图标,打开设置 (
{
"models": [
{
"title": "Local Qwen 2.5 Coder",
"provider": "ollama",
"model": "qwen2.5-coder:7b"
}
],
"tabAutocompleteModel": {
"title": "Tab Autocomplete",
"provider": "ollama",
"model": "qwen2.5-coder:7b"
}
}

第三步:告别"只会用云端补全"------我的实战建议
很多人觉得本地模型"笨",那是因为你没给它喂数据。要让本地模型媲美 Copilot,你需要以下三步:
1. 强制启用"代码库感知 (Embeddings)"
本地模型之所以补全不准,是因为它"看不见"你的全局代码。
- 在 Continue 的配置中,启用 Embeddings Provider。
- Continue 会在本地建立索引(Vector Database),当你问它问题时,它会先搜索你的代码上下文,再传给 Ollama。这样它补全出来的代码就是"你项目风格的"。
2. "RAG + 本地索引"是关键
别只依赖补全模型。当你需要修改大型逻辑时,使用 @Codebase 命令(Continue 特有功能)。它会把你的整个代码仓库进行本地 Embedding 向量化。只要本地索引建得好,本地模型回答问题的精准度可以达到 GPT-4 的 90%。
3. 混合接入策略 (Hybrid Strategy)
不要追求 100% 本地化,要追求"隐私优先,性能补充"。
- 私密/敏感代码:指定使用 Ollama 运行的本地模型。
- 重构/复杂架构设计:通过 Continue 接入 DeepSeek/Claude 的 API(仅在必要时)。
- 开关切换:在 Continue 的右下角,一键切换模型。平时写业务逻辑用本地 7B 模型,卡壳时切到云端大模型,既省钱又保护了隐私。
方案对比:"红蓝军"配置清单
| 需求 | 解决方案 | 优点 |
|---|---|---|
| 基础补全 | qwen2.5-coder:7b (Ollama) |
零延迟,彻底离线,不花钱 |
| 项目级重构 | @Codebase + Ollama |
安全,不触碰敏感商业代码 |
| 疑难杂症 | Claude 3.5 Sonnet (API) | 解决本地模型无法处理的复杂逻辑 |
避坑指南
- 内存溢出 :如果你只有 8GB 内存,千万别跑 30B 以上的模型,VS Code 会卡死。Qwen 2.5 Coder 7B 是 8GB 内存的最佳选择。
- GPU 加速:确保 Ollama 正确识别了你的显卡。如果是 NVIDIA 显卡,Ollama 会自动调用 CUDA;如果是 Mac M 系列,它会使用 Unified Memory,速度飞快。
- 别忘了
.continueignore:就像.gitignore一样,在根目录创建.continueignore,把不需要扫描的大文件、二进制文件加进去,能极大提升本地模型的补全速度。
如果您喜欢此文章,请收藏、点赞、评论,谢谢,祝您快乐每一天。