本地运行 Ollama 大模型:零费用开启 AI 开发之路

作者:袖梨 2026-07-29

零成本踏上 AI 开发之旅:在本地部署 Ollama 大模型

简介

想拥有一个完全由自己掌控的 AI 助手,又不愿承担隐私泄露风险和订阅费用?通过本地部署 Ollama,你可以轻松使用开源大模型。本文会从零讲解 Ollama 环境的搭建过程,并说明如何将它用于本地开发。

本地部署 Ollama 大模型:零成本开启 AI 开发之旅

认识 Ollama

Ollama 是一个开源的本地 LLM 运行框架,支持各种主流大模型,如 Qwen3.5、Llama3、Mistral 等。它基于 Docker 和 Rust 构建,提供简单的命令行接口和 Web UI。

环境准备

1. Docker 安装

# 检查 Docker 是否已安装docker --version# 未安装时,MacOS 用户可以从 Docker Desktop 官网下载:# https://www.docker.com/products/docker-desktop

2. 安装 Ollama

# macOSbrew install ollama# Linux (Ubuntu/Debian)curl -fsSL https://ollama.com/install.sh | sh# Windows 用户请访问官网下载安装包:# https://ollama.com/download

3. 启动服务

# 启动 Ollamaollama serve# 后台运行(可选)ollama serve &# 查看已安装模型ollama list# 拉取模型(默认是 CPU 优化版本)ollama pull qwen3.5ollama pull llama3.2:3bollama pull mistral

使用 Ollama

1. 命令行交互

# 开始对话ollama run qwen3.5# 退出对话Ctrl+D 或输入 /exit# 指定版本ollama run qwen3.5:7b

2. 设置环境变量

# 设置上下文长度(默认 4096)OLLAMA_NUM_GPU_LAYERS=0 ollama serve# 设置最大并发请求数OLLAMA_MAX_CONCURRENT_REQUESTS=4 ollama serve

本地开发

1. Python API 使用

import requestsfrom langchain_ollama import ChatOllama# 创建聊天实例llm = ChatOllama(model="qwen3.5", base_url="http://localhost:11434")# 进行对话response = llm.invoke("你好,请介绍一下 Ollama")print(response)

2. JavaScript/TypeScript 使用

// 使用 OpenAI 格式的 Node 客户端const response = await fetch("http://localhost:11434/api/generate", {method: "POST",headers: { "Content-Type": "application/json" },body: JSON.stringify({model: "qwen3.5",prompt: "你好,请介绍一下 Ollama",stream: false})});const result = await response.json();console.log(result.response);

3. VS Code 扩展

安装 Ollama 插件,即可在编辑器中直接使用本地模型进行代码辅助、文档生成等。

配置建议

1. 模型选择

模型名称适用场景内存需求
qwen3.5:7b通用对话、代码~7GB
qwen3.5:14b多模态与复杂任务~14GB
llama3.2:3b快速响应与轻量设备~3GB
mistral欧洲用户推荐~4GB

2. 性能优化

  • 使用 --num-gpu-layers 参数指定 GPU 层数
  • 设置 OLLAMA_MAX_LOADED_MODELS 并发模型数量的控制
  • 使用 OLLAMA_NUM_PARALLEL 设置并发请求数

常见问题

1. 加载模型失败

# 清理缓存ollama rm <model-name>ollama pull <model-name># 重启服务ollama serve

2. 内存不足

# 使用更小的模型ollama pull llama3.2:3bollama run llama3.2:3b

3. 网络问题

# 设置袋里OLLAMA_ORIGINS="http://localhost" ollama serve

总结

Ollama 是一个简单、高效的本地 LLM 运行框架,无需复杂配置即可快速投入使用。支持多种主流模型,提供丰富的 API 接口,适合开发者和个人用户。

若要获得最佳性能,建议对 Ollama 和模型版本进行定期更新。

AI 技术爱好者撰写
许可协议:MIT License
可通过[email protected]联系

推荐阅读:

  • 官方 Ollama 文档
  • LangChain Ollama 集成
  • LLM 本地部署实践指南

持续更新的本文档,内容整理自实际部署经验。

相关文章

精彩推荐