Ollama 入门:在本地跑一个属于自己的大模型
平时我们调用大模型,一般都是:
Java 程序
↓
HTTP API
↓
OpenAI / DeepSeek / Claude
↓
返回结果
这种方式非常方便,但也意味着:
需要联网
需要 API Key
可能产生费用
数据需要发送到服务器
如果我们希望:
直接在自己的电脑上运行大模型。
就可以使用:
Ollama
一、Ollama 是什么?
Ollama 可以简单理解成:
一个帮助我们在本地下载、运行和管理大模型的工具。
它把原本比较麻烦的:
下载模型
配置运行环境
加载模型
GPU 加速
启动推理服务
提供 API
进行了封装。
最终我们只需要一条命令:
ollama run qwen3
就可以直接和模型聊天。
Ollama 当前支持 macOS、Windows 和 Linux,本地运行的模型数据不会因为推理本身自动发送到远程服务器。(Ollama )
整体可以理解成:
你的应用
↓
Ollama API
↓
本地模型
↓
CPU / GPU
二、Ollama 有什么用?
对于开发者来说,Ollama 最大的价值就是:
本地运行大模型
比如以前:
Spring Boot
↓
DeepSeek API
↓
互联网
现在可以变成:
Spring Boot
↓
Ollama
↓
本地 Qwen / Llama / Gemma
特别适合:
学习大模型开发
测试 Spring AI
开发 RAG
开发 Agent
搭建本地知识库
处理隐私数据
离线环境部署
三、安装 Ollama
安装非常简单。
Windows 可以直接下载安装程序,也可以在 PowerShell 中执行:
irm https://ollama.com/install.ps1 | iex
Linux:
curl -fsSL https://ollama.com/install.sh | sh
macOS 也可以直接从官网下载应用。官方当前 Windows 版本要求 Windows 10 或更高版本。(Ollama )
安装完成以后执行:
ollama -v
如果能够看到版本信息,说明安装成功。
四、运行第一个大模型
安装 Ollama 以后,就可以下载模型。
例如:
ollama run qwen3
第一次执行时,如果本地没有模型,Ollama 会自动下载。
下载完成以后:
>>> 你好
你好!有什么可以帮助你的吗?
这样,我们已经在自己的电脑上运行了一个大模型。
Qwen3 在 Ollama 中提供多个不同参数规模的版本,并支持 thinking、工具调用等能力。(Ollama )
五、模型大小是什么意思?
你可能会看到:
qwen3:4b
qwen3:8b
qwen3:14b
qwen3:32b
这里的:
4B
8B
14B
32B
可以简单理解成:
模型参数规模
通常模型越大:
能力更强
推理更慢
占用内存更多
对显卡要求更高
所以本地开发不一定非要追求最大的模型。
普通电脑可以先从:
ollama run qwen3:4b
或者其他较小模型开始。
六、常用 Ollama 命令
查看已经下载的模型:
ollama list
下载模型:
ollama pull qwen3
运行模型:
ollama run qwen3
删除模型:
ollama rm qwen3
查看正在运行的模型:
ollama ps
开发阶段基本掌握这些就够用了。
七、Ollama 不只是命令行
真正开发项目时,我们当然不会让 Java 去执行:
ollama run qwen3
Ollama 本身提供了 HTTP API。
默认情况下,本地服务通常可以通过:
http://localhost:11434
访问。
例如调用聊天接口:
curl http://localhost:11434/api/chat \
-d '{
"model": "qwen3",
"messages": [
{
"role": "user",
"content": "Java 中 HashMap 是什么?"
}
]
}'
官方模型页面也直接提供了 /api/chat 的调用示例。(Ollama )
所以整个过程其实就是:
Java
↓
HTTP
↓
localhost:11434
↓
Ollama
↓
Qwen3
↓
返回结果
这和调用云端大模型 API 的方式非常像。
最大的区别只是:
以前:
Java → Internet → 大模型厂商
现在:
Java → localhost → Ollama → 本地模型
八、Ollama 可以运行哪些模型?
Ollama 并不是一个大模型。
这一点一定要分清楚。
Ollama
更像:
大模型运行平台
而:
Qwen
Llama
Gemma
才是真正的大模型。
例如:
ollama run qwen3
也可以:
ollama run llama3.2
或者:
ollama run gemma3
Ollama 官方模型库目前提供 Qwen3、Llama 3.2、Gemma 3 等多个模型系列。(Ollama )
所以可以理解成:
Qwen3
↑
|
Java → Ollama ── Llama
|
↓
Gemma
以后想换模型,通常只需要换一个模型名称。
九、Ollama 和 Spring AI
如果你正在学习 Spring AI,那么 Ollama 非常适合拿来做实验。
架构可以变成:
Controller
↓
ChatClient
↓
Spring AI
↓
Ollama
↓
Qwen3
也就是说:
Spring AI
负责:
ChatClient
ChatMemory
Advisor
RAG
Tool Calling
而:
Ollama
负责:
在本地真正运行大模型
这样学习 Spring AI 时,就不一定需要每次都调用收费 API。
十、本地模型的优缺点
Ollama 最大的优势是:
部署简单
本地运行
开发方便
容易切换模型
适合学习和实验
而本地模型也有明显限制:
吃内存
吃显存
模型越大要求越高
普通电脑速度可能较慢
能力可能不如大型云端模型
所以实际项目中并不是:
本地模型一定比云模型好
而是根据场景选择。
例如:
学习 / 测试 / 隐私场景
↓
Ollama
高并发 / 超大模型 / 强推理
↓
云端 API
十一、总结
Ollama 最核心的作用其实非常简单:
降低本地运行大模型的门槛。
以前想在电脑上运行一个大模型,可能需要处理:
Python
CUDA
模型权重
推理框架
GPU 配置
服务部署
现在使用 Ollama:
ollama run qwen3
就能快速开始。
整个开发关系可以记成:
Spring Boot
↓
Spring AI
↓
Ollama
↓
Qwen / Llama / Gemma
↓
CPU / GPU
所以如果后面准备学习:
Spring AI
RAG
ChatMemory
Embedding
Tool Calling
Agent
Ollama 都非常适合充当我们的:
本地大模型运行环境。
学完 Ollama 之后,下一步就可以直接进入:
Spring Boot
+
Spring AI
+
Ollama
+
Qwen
真正让 Java 项目调用自己电脑上的本地大模型。