首页
/
工具详情
Ollama使用全指南
一、平台介绍
Ollama 是一款开源的本地大模型运行管理器。它支持一键部署 GGUF 量化 LLM,并自动适配 NVIDIA、AMD 及 Mac Metal 等硬件加速。所有推理均在本地离线执行,确保数据不上传至第三方服务器,无云端托管、无在线 SaaS 服务。
- 核心定位:纯本地客户端程序,无在线后台。
- 模型库地址:https://ollama.com/library
- 核心优势:数据隐私安全,完全断网可用,规避 API 费用。
二、主要功能
- 极简模型管理
- 支持单行命令进行拉取、运行、删除、导出模型。
- 自动进行 4bit/8bit 量化压缩,显著降低硬件门槛。
- 跨平台全适配
- 完美支持 Windows、macOS、Linux 系统。
- 即使无独立显卡,CPU 亦可运行轻量级模型。
- OpenAI 兼容 API
- 本地端口默认为
11434。 - 可无缝对接 Dify、AnythingLLM、LangChain 及自定义代码。
- 离线对话
- 支持断网环境下完全离线使用 AI。
- 提供命令行交互式聊天模式。
- 自定义模型封装
- 支持编写
Modelfile。 - 可自定义微调提示词、参数设置及上下文长度。
- 硬件自动调度
- 自动识别显卡显存。
- 支持负载均衡,可限制 CPU/内存占用,防止资源耗尽。
- 批量服务
- 支持后台常驻
ollama serve。 - 允许多个程序并发调用本地模型。
三、适用人群
✅ 适合场景
- 开发者:构建本地 RAG、Agent、AI 工具原型,规避云端 API 费用与数据泄露风险。
- 办公/学生:本地私密写作、代码生成、知识库构建,敏感文档不传到外网。
- 私有化团队:内网服务器部署,实现企业数据本地闭环。
- AI 爱好者:低成本测试 Llama3、Qwen、DeepSeek、Mistral 等开源模型。
- 离线场景:网络受限或无网络环境下使用 AI。
❌ 不适合场景
- 高并发公网商用服务:并发性能弱于 vLLM 或 TGI,不适合大规模公网 API 接口。
- 无本地电脑用户:仅希望网页在线聊天的用户。
- 文生图/视频需求:Ollama 主打文本大模型,原生多模态支持有限。
四、免费&付费、定价页面
💰 收费规则(全程 100% 免费无付费套餐)
- 软件本体:开源免费,无订阅、无 Token 计费、无会员、无功能锁。
- 模型资源:全部免费下载,仅消耗本地硬盘与内存资源,无任何线上扣费。
- 商业定位:无官方云服务,因此不存在定价页面。
官方说明:Ollama 是本地开源工具,无付费商业套餐,官网无 pricing 页面。
🔗 官方关键链接
- 官网主页:https://ollama.com
- 下载页:https://ollama.com/download
- 模型库:https://ollama.com/library
- 官方文档:https://docs.ollama.com
五、如何使用(极简步骤)
1. 安装软件
- Windows:官网下载 exe 安装包。
- macOS:下载 dmg 或执行
brew install ollama。 - Linux:执行
curl -fsSL https://ollama.com/install.sh | sh。 - 验证安装:终端执行
ollama --version。
2. 拉取模型
bash
ollama pull qwen2:7b # 中文 7B 通用 ollama pull llama3:8b # 英文通用 ollama pull codellama:7b # 代码专用 ollama pull qwen2:7b # 中文 7B 通用 ollama pull llama3:8b # 英文通用 ollama pull codellama:7b # 代码专用
3. 命令行对话
bash
ollama run qwen2:7b # 输入问题,输入 /bye 退出对话 ollama run qwen2:7b # 输入问题,输入 /bye 退出对话
4. 启动 API 服务
bash
ollama serve # API 地址 http://localhost:11434/v1 # 兼容 OpenAI 请求格式 ollama serve # API 地址 http://localhost:11434/v1 # 兼容 OpenAI 请求格式
注意:默认仅监听本机访问。
5. 常用管理命令
bash
ollama list # 查看本地模型 ollama rm qwen2:7b # 删除模型 ollama ps # 查看运行中模型 ollama list # 查看本地模型 ollama rm qwen2:7b # 删除模型 ollama ps # 查看运行中模型
6. API 请求 JSON 示例
json
{
"model": "qwen2:7b",
"messages": [
{"role":"user","content":"简要介绍 Ollama"}
],
"temperature": 0.7,
"stream": false
}
{
"model": "qwen2:7b",
"messages": [
{"role":"user","content":"简要介绍 Ollama"}
],
"temperature": 0.7,
"stream": false
}
六、避坑点
- 国内模型下载极慢
- 模型源在海外,大文件易中断。
- 解决方案:配置终端代理、离线手动导入 GGUF 模型文件。
- C 盘爆满
- 模型默认存储于
C:\Users\用户名\.ollama\models。 - 解决方案:提前设置环境变量
OLLAMA_MODELS迁移至其他磁盘。
- 硬件门槛踩坑
- 7B 模型最低建议 8G 内存,13B 建议 16G。
- 无独显 CPU 运行速度极慢,大模型易卡顿死机。
- 局域网/远程无法访问 API
- 默认仅监听
127.0.0.1。 - 解决方案:启动服务前配置环境变量:
OLLAMA_HOST=0.0.0.0 ollama serve。
- 无鉴权,公网暴露高危
- 开放
0.0.0.0后任何人可调用本地模型。 - 解决方案:公网部署必须加 Nginx 密码或 IP 白名单。
- 端口 11434 冲突
- 其他程序占用端口会启动失败。
- 解决方案:可修改
OLLAMA_HOST=127.0.0.1:11435更换端口。
- 并发能力弱
- 多程序同时调用会排队阻塞,不适合线上高并发业务场景。
- 无原生图形界面
- 纯命令行/API 工具,可视化需搭配 Dify、Open WebUI 等第三方前端。
- 系统资源占满蓝屏
- Ollama 默认吃满内存。
- 解决方案:通过环境变量限制内存,后台不要同时开大型软件。
- 模型商用权限区分
- Ollama 本身免费,但部分模型(如 Llama 系列)有商用限制。
- 提示:Qwen、DeepSeek 可免费商用,使用前请核对模型协议。
暂无评论