想拥有一个完全由自己掌控的 AI 助手,又不愿承担隐私泄露风险和订阅费用?通过本地部署 Ollama,你可以轻松使用开源大模型。本文会从零讲解 Ollama 环境的搭建过程,并说明如何将它用于本地开发。

Ollama 是一个开源的本地 LLM 运行框架,支持各种主流大模型,如 Qwen3.5、Llama3、Mistral 等。它基于 Docker 和 Rust 构建,提供简单的命令行接口和 Web UI。
# 检查 Docker 是否已安装docker --version# 未安装时,MacOS 用户可以从 Docker Desktop 官网下载:# https://www.docker.com/products/docker-desktop
# macOSbrew install ollama# Linux (Ubuntu/Debian)curl -fsSL https://ollama.com/install.sh | sh# Windows 用户请访问官网下载安装包:# https://ollama.com/download
# 启动 Ollamaollama serve# 后台运行(可选)ollama serve &# 查看已安装模型ollama list# 拉取模型(默认是 CPU 优化版本)ollama pull qwen3.5ollama pull llama3.2:3bollama pull mistral
# 开始对话ollama run qwen3.5# 退出对话Ctrl+D 或输入 /exit# 指定版本ollama run qwen3.5:7b
# 设置上下文长度(默认 4096)OLLAMA_NUM_GPU_LAYERS=0 ollama serve# 设置最大并发请求数OLLAMA_MAX_CONCURRENT_REQUESTS=4 ollama serve
import requestsfrom langchain_ollama import ChatOllama# 创建聊天实例llm = ChatOllama(model="qwen3.5", base_url="http://localhost:11434")# 进行对话response = llm.invoke("你好,请介绍一下 Ollama")print(response)
// 使用 OpenAI 格式的 Node 客户端const response = await fetch("http://localhost:11434/api/generate", {method: "POST",headers: { "Content-Type": "application/json" },body: JSON.stringify({model: "qwen3.5",prompt: "你好,请介绍一下 Ollama",stream: false})});const result = await response.json();console.log(result.response);
安装 Ollama 插件,即可在编辑器中直接使用本地模型进行代码辅助、文档生成等。
| 模型名称 | 适用场景 | 内存需求 |
|---|---|---|
| qwen3.5:7b | 通用对话、代码 | ~7GB |
| qwen3.5:14b | 多模态与复杂任务 | ~14GB |
| llama3.2:3b | 快速响应与轻量设备 | ~3GB |
| mistral | 欧洲用户推荐 | ~4GB |
--num-gpu-layers 参数指定 GPU 层数OLLAMA_MAX_LOADED_MODELS 并发模型数量的控制OLLAMA_NUM_PARALLEL 设置并发请求数# 清理缓存ollama rm <model-name>ollama pull <model-name># 重启服务ollama serve
# 使用更小的模型ollama pull llama3.2:3bollama run llama3.2:3b
# 设置袋里OLLAMA_ORIGINS="http://localhost" ollama serve
Ollama 是一个简单、高效的本地 LLM 运行框架,无需复杂配置即可快速投入使用。支持多种主流模型,提供丰富的 API 接口,适合开发者和个人用户。
若要获得最佳性能,建议对 Ollama 和模型版本进行定期更新。
AI 技术爱好者撰写
许可协议:MIT License
可通过[email protected]联系
推荐阅读:
持续更新的本文档,内容整理自实际部署经验。