本地运行大模型最直接的方式,是在本机安装 Ollama 后用 ollama run llama3 这样的命令把模型拉起来并进入交互。Ollama 是一个把模型权重、推理运行时和命令行封装在一起的轻量工具,支持 macOS、Linux 和 Windows,让你不需要配置复杂的深度学习环境就能在笔记本上跑起 7B 级别的开源模型。对于想做本地知识库、离线助手,或只是想把 API 调用成本降下来的开发者来说,它几乎是零门槛的入口。本文先讲清楚安装步骤,再给出最小可运行的调用示例,随后聊模型目录、上下文长度与显存的关系,最后把新手最容易踩的三个坑——模型拉不下来、上下文超长报错、显存不足——逐一拆开。跟着做一遍,你就能在本机拥有一个随时可用的对话模型,也不必再为每次调用云端大模型而付费。

一、安装 Ollama 并校验本机环境
在动手之前,先确认你的系统满足最低要求。Ollama 官方支持 macOS 11 以上、带 AVX2 指令集的 x86 Linux,以及 Windows 10/11 的 22H2 及以上版本。无论哪种平台,建议预留至少 8GB 内存。
安装方式分两种。macOS 和 Windows 直接下载官方 dmg / exe 安装包最省事,双击后在菜单栏或系统托盘里能看到常驻图标,代表后台服务已经启动。Linux 用户则推荐一行官方脚本,它会自动处理依赖并注册服务:
curl -fsSL https://ollama.com/install.sh | sh
脚本会创建 systemd 服务,并默认监听 11434 端口。装完不要急着下载模型,先校验版本,确认命令行已经正确注入 PATH:
ollama --version
如果终端回显类似 ollama version 0.3.0 的字段,说明安装成功。要是提示 command not found,多半是安装脚本没有把二进制写进 PATH,可以手动把 /usr/local/bin 加回环境变量再试。到这一步,本地大模型运行所需的基础环境就准备好了,下一节我们用代码把它真正跑起来,并验证服务是否正常监听。
二、用 REST API 与 SDK 把模型接入代码
很多新手以为 Ollama 只能聊天,其实它把本地推理封装成了一套兼容 OpenAI 风格的 HTTP 接口,因此你完全可以用熟悉的请求方式把模型嵌进自己的程序。服务启动后,所有调用都打向本机 11434 端口的 /api/generate 或 /api/chat。下面这段 Python 用最朴素的 requests 发起一次生成请求,不依赖任何第三方 SDK:
import requests
resp = requests.post(
"http://localhost:11434/api/generate",
json={"model": "llama3", "prompt": "用一句话解释什么是向量数据库"}
)
print(resp.json())
如果你更习惯 OpenAI 的调用风格,可以借道 OpenAI 官方客户端并改掉 base_url,这样现有项目几乎零改动就能切换到本地模型。想系统学这套接口字段,可以参考 OpenAI API 教程,里面把鉴权、流式返回和消息结构都拆得很细。在代码里集成本地大模型的好处是请求不出本机,既不用付 token 费用,也不会把业务数据发到外部服务器,对隐私和成本都更友好。当你确认接口能正常返回文本,就可以进入交互模式做更多尝试,把模型真正用起来。
三、用 ollama run 进入交互式对话
不想写代码时,ollama run 是最快验证模型是否可用的方式。它会在终端里拉起一个 REPL 会话。第一次运行会先下载模型权重,体积从几 GB 到十几 GB 不等,耐心等进度条走完:
ollama run llama3
进入会话后,直接打字提问即可,例如「帮我写一段快速排序的 Python 代码」。想退出时输入 /bye。如果你想换更小的模型,比如 3B 级别的 qwen2:1.5b,只要把名字换掉就能拉取。本地下载的模型会缓存在模型目录里,重复运行不会再次下载,这点和云端按次计费完全不同。ollama 还提供 ollama list 查看已装模型、ollama pull 单独拉取、ollama rm 删除不再需要的模型,这几个命令配合起来就能管理你本机的整个模型仓库。当交互结果符合预期,说明推理链路已经完全打通,接下来考虑把它接到更具体的开发任务上。
四、把本地模型接到 AI 编程工作流
本地大模型真正的价值,往往体现在把它当作一个随叫随到的编程搭档。借助 Ollama 的兼容接口,你可以让编辑器里的 AI 插件指向本机地址。比如 Continue、Cline 这类开源插件,只要在配置里把 API Base URL 填成 http://localhost:11434,模型就从云端切换到了本地。做 AI 编程时,建议给模型明确的上下文边界:把相关文件片段贴进提示词,并要求它只输出改动的函数,这样能显著降低幻觉。关于如何更有章法地用 AI 辅助开发,AI 编程技能教程 里有一套从环境到落地的完整路径。需要提醒的是,本地小模型在复杂架构推理上仍弱于云端大模型,遇到大型重构还是要交叉验证输出结果,别盲目信任。
五、配置模型目录、上下文长度与显存
默认情况下,Ollama 把模型放在用户目录下的隐藏文件夹,macOS 是 ~/.ollama,Linux 一般在 /usr/share/ollama。如果你的系统盘空间紧张,可以设置环境变量 OLLAMA_MODELS 把模型仓库指到更大的磁盘:
export OLLAMA_MODELS=/data/ollama/models
上下文长度决定了模型一次能「记住」多少前文。通过 Modelfile 构建自定义模型时,可以用 PARAMETER num_ctx 8192 把窗口从默认 2048 调大,代价是显存占用几乎线性上升。下面是构建带大上下文的自定义模型的例子:
ollama create myllama -f ./Modelfile
Modelfile 内容示例:
FROM llama3
PARAMETER num_ctx 8192
运行时的显存瓶颈也很关键。7B 模型在 4-bit 量化下约需 4–6GB 显存,上下文开得越大、并发越高,占用越高。一旦超出显存,Ollama 会回退到 CPU 甚至直接报错退出。遇到这种情况,优先调小 num_ctx,或换更小的量化版本,而不是盲目加内存。把目录、上下文和显存这三件事理顺,本地大模型才真正稳定可用。

总结
Ollama 把本地大模型的门槛降到了「装好、run 一下、接进代码」三步。新人最容易栽在三个地方:一是模型名写错或网络拉不下来,先用 ollama list 确认本地到底有哪些模型;二是上下文开太大导致显存爆掉,按需调小 num_ctx 比堆硬件更划算;三是对本地小模型的推理能力预期过高,复杂任务记得人工复核。把安装、调用、集成、配置这条链路走通,再结合编程狮上的 AI 实战内容继续深挖,你就有了一台属于自己的、随时响应的本地大模型机器,既能省 API 费用,也能守住数据隐私。
延伸学习
- 人工智能教程 先把大模型基础概念铺平
- 大模型本地部署笔记 可对照真实部署踩坑
- AI 编程助手横向对比 看不同助手的取舍
常见问题
Q:拉取模型时一直卡在 0% 或报错 model not found 怎么办?
A:先确认模型名拼写,llama3、qwen2 这类标签必须完全一致;网络不稳可换镜像源或重试。也可用 ollama pull 单独拉取,观察具体报错再处理。
Q:运行时提示上下文超长或显存不足该怎么调?
A:优先在 Modelfile 里调小 num_ctx,例如降到 4096 或 2048;或改用更小量化版本。若仍爆显存,说明模型超出本机硬件上限,建议换 3B 级别模型。
Q:Ollama 默认把模型存哪,怎么改到别的盘?
A:默认在用户目录 ~/.ollama(macOS/Linux)。设置环境变量 OLLAMA_MODELS 指向新路径,再重启服务即可让后续下载落到指定磁盘。

免费 AI IDE



