首页 / 详情
Site icon

Ollama

基本信息

Ollama 网站截图预览

工具详情

Ollama使用全指南

一、平台介绍

Ollama 是一款开源的本地大模型运行管理器。它支持一键部署 GGUF 量化 LLM,并自动适配 NVIDIA、AMD 及 Mac Metal 等硬件加速。所有推理均在本地离线执行,确保数据不上传至第三方服务器,无云端托管、无在线 SaaS 服务。

  • 核心定位:纯本地客户端程序,无在线后台。
  • 模型库地址:https://ollama.com/library
  • 核心优势:数据隐私安全,完全断网可用,规避 API 费用。

二、主要功能

  1. 极简模型管理
  • 支持单行命令进行拉取、运行、删除、导出模型。
  • 自动进行 4bit/8bit 量化压缩,显著降低硬件门槛。
  1. 跨平台全适配
  • 完美支持 Windows、macOS、Linux 系统。
  • 即使无独立显卡,CPU 亦可运行轻量级模型。
  1. OpenAI 兼容 API
  • 本地端口默认为 11434
  • 可无缝对接 Dify、AnythingLLM、LangChain 及自定义代码。
  1. 离线对话
  • 支持断网环境下完全离线使用 AI。
  • 提供命令行交互式聊天模式。
  1. 自定义模型封装
  • 支持编写 Modelfile
  • 可自定义微调提示词、参数设置及上下文长度。
  1. 硬件自动调度
  • 自动识别显卡显存。
  • 支持负载均衡,可限制 CPU/内存占用,防止资源耗尽。
  1. 批量服务
  • 支持后台常驻 ollama serve
  • 允许多个程序并发调用本地模型。

三、适用人群

✅ 适合场景

  1. 开发者:构建本地 RAG、Agent、AI 工具原型,规避云端 API 费用与数据泄露风险。
  2. 办公/学生:本地私密写作、代码生成、知识库构建,敏感文档不传到外网。
  3. 私有化团队:内网服务器部署,实现企业数据本地闭环。
  4. AI 爱好者:低成本测试 Llama3、Qwen、DeepSeek、Mistral 等开源模型。
  5. 离线场景:网络受限或无网络环境下使用 AI。

❌ 不适合场景

  1. 高并发公网商用服务:并发性能弱于 vLLM 或 TGI,不适合大规模公网 API 接口。
  2. 无本地电脑用户:仅希望网页在线聊天的用户。
  3. 文生图/视频需求:Ollama 主打文本大模型,原生多模态支持有限。

四、免费&付费、定价页面

💰 收费规则(全程 100% 免费无付费套餐)

  • 软件本体:开源免费,无订阅、无 Token 计费、无会员、无功能锁。
  • 模型资源:全部免费下载,仅消耗本地硬盘与内存资源,无任何线上扣费。
  • 商业定位:无官方云服务,因此不存在定价页面。
官方说明:Ollama 是本地开源工具,无付费商业套餐,官网无 pricing 页面。

🔗 官方关键链接

  • 官网主页:https://ollama.com
  • 下载页:https://ollama.com/download
  • 模型库:https://ollama.com/library
  • 官方文档:https://docs.ollama.com

五、如何使用(极简步骤)

1. 安装软件

  • Windows:官网下载 exe 安装包。
  • macOS:下载 dmg 或执行 brew install ollama
  • Linux:执行 curl -fsSL https://ollama.com/install.sh | sh
  • 验证安装:终端执行 ollama --version

2. 拉取模型

bash

ollama pull qwen2:7b    # 中文 7B 通用
ollama pull llama3:8b   # 英文通用
ollama pull codellama:7b # 代码专用
ollama pull qwen2:7b    # 中文 7B 通用
ollama pull llama3:8b   # 英文通用
ollama pull codellama:7b # 代码专用

3. 命令行对话

bash

ollama run qwen2:7b
# 输入问题,输入 /bye 退出对话
ollama run qwen2:7b
# 输入问题,输入 /bye 退出对话

4. 启动 API 服务

bash

ollama serve
# API 地址 http://localhost:11434/v1
# 兼容 OpenAI 请求格式
ollama serve
# API 地址 http://localhost:11434/v1
# 兼容 OpenAI 请求格式
注意:默认仅监听本机访问。

5. 常用管理命令

bash

ollama list        # 查看本地模型
ollama rm qwen2:7b # 删除模型
ollama ps          # 查看运行中模型
ollama list        # 查看本地模型
ollama rm qwen2:7b # 删除模型
ollama ps          # 查看运行中模型

6. API 请求 JSON 示例

json

{
  "model": "qwen2:7b",
  "messages": [
    {"role":"user","content":"简要介绍 Ollama"}
  ],
  "temperature": 0.7,
  "stream": false
}
{
  "model": "qwen2:7b",
  "messages": [
    {"role":"user","content":"简要介绍 Ollama"}
  ],
  "temperature": 0.7,
  "stream": false
}

六、避坑点

  1. 国内模型下载极慢
  • 模型源在海外,大文件易中断。
  • 解决方案:配置终端代理、离线手动导入 GGUF 模型文件。
  1. C 盘爆满
  • 模型默认存储于 C:\Users\用户名\.ollama\models
  • 解决方案:提前设置环境变量 OLLAMA_MODELS 迁移至其他磁盘。
  1. 硬件门槛踩坑
  • 7B 模型最低建议 8G 内存,13B 建议 16G。
  • 无独显 CPU 运行速度极慢,大模型易卡顿死机。
  1. 局域网/远程无法访问 API
  • 默认仅监听 127.0.0.1
  • 解决方案:启动服务前配置环境变量:OLLAMA_HOST=0.0.0.0 ollama serve
  1. 无鉴权,公网暴露高危
  • 开放 0.0.0.0 后任何人可调用本地模型。
  • 解决方案:公网部署必须加 Nginx 密码或 IP 白名单。
  1. 端口 11434 冲突
  • 其他程序占用端口会启动失败。
  • 解决方案:可修改 OLLAMA_HOST=127.0.0.1:11435 更换端口。
  1. 并发能力弱
  • 多程序同时调用会排队阻塞,不适合线上高并发业务场景。
  1. 无原生图形界面
  • 纯命令行/API 工具,可视化需搭配 Dify、Open WebUI 等第三方前端。
  1. 系统资源占满蓝屏
  • Ollama 默认吃满内存。
  • 解决方案:通过环境变量限制内存,后台不要同时开大型软件。
  1. 模型商用权限区分
  • Ollama 本身免费,但部分模型(如 Llama 系列)有商用限制。
  • 提示:Qwen、DeepSeek 可免费商用,使用前请核对模型协议。


评论

暂无评论