ollama详细介绍

Ollama 是一个开源、跨平台的,可在本地一键运行大语言模型(LLM)的工具,被称为 “大模型界的 Docker”,核心作用是让普通人在自己电脑上一键运行各类开源 AI 大模型,全程离线、数据不出本机。

Ollama 是一个开源、跨平台的,可在本地一键运行大语言模型(LLM)的工具,被称为 “大模型界的 Docker”,核心作用是让普通人在自己电脑上一键运行各类开源 AI 大模型,全程离线、数据不出本机。

官网

ollama.com

核心定位

  • 不是模型本身:它是运行模型的 “容器”。
  • 解决痛点:屏蔽复杂的环境配置、模型格式转换、量化等技术细节。
  • 口号:一行命令,本地跑大模型。

主要特点

  • 模型管理 :像App Store一样,从官方模型库下载、更新、删除模型
  • 一键运行:ollama run deepseek-r1:7b : 一键下载并运行 deepseek-r1
  • 完全本地、隐私安全:所有数据在本机处理,不上传云端。适合处理敏感数据、企业内网、离线场景。
  • 跨平台:支持 Windows / macOS / Linux。
  • 硬件友好:自动适配 CPU / NVIDIA / AMD / Apple Silicon。支持 GGUF 量化,普通电脑(8GB+ 内存)即可跑轻量模型。
  • API服务:开箱即用的RESTful API(端口 11434),兼容 OpenAI 格式,供其他应用调用。可接入 OpenWebUI、LangChain、本地知识库 等应用。
  • 模型定制:通过Modelfile自定义系统提示词、参数、对话模板

可以运行哪些模型?

Ollama官方模型库(ollama.com/library)收录了数百个开源模型:

模型系列 代表模型 特点
DeepSeek deepseek-r1:7b / 14b / 32b 国产顶尖推理模型,数学与代码能力强
Llama llama3.1:8b / 70b Meta出品,综合能力均衡
Qwen qwen2.5:7b / 14b / 72b 阿里通义千问开源版,中文友好
Mistral mistral:7b 轻量高效,适合资源有限的环境
Gemma gemma2:9b / 27b Google出品,学术研究首选
Phi phi3:3.8b / 14b 微软出品,体积小、推理强

📌 注意:这里的7b14b表示模型参数量(70亿、140亿)。参数量越大,模型越聪明,但对硬件要求也越高。

官网模型筛选标签说明

Ollama网站的大模型分类标签/筛选按钮,用来按模型能力类型快速查找模型。它们的含义如下:


标签 含义
Cloud Ollama Cloud(云服务): Ollama官方托管的云端GPU
Embedding 专门用于生成文本向量(embedding)的模型,用于RAG、语义搜索、聚类等任务
Vision 多模态视觉模型,能看懂图片/图像输入,做图像理解、OCR、图生文等
Tools 支持函数调用(Function Calling)或工具使用的模型,能调用外部API、执行操作
Thinking 具备深度推理/思考能力的模型(类似OpenAI的o1系列),擅长逻辑推理、数学、规划

注:cloud模型按订阅收费,适合需要更大模型、更强算力,但本地跑不动的场景。

Ollama vs llama.cpp 的区别

很多初学者会混淆这两个工具:

  • llama.cpp:底层推理引擎,专注于模型的高效运行(尤其是CPU推理),但需要自己处理模型格式转换(GGUF),配置门槛高。
  • Ollama:基于llama.cpp构建,在其之上封装了模型管理、API服务、生态集成等能力,使用体验大幅提升。

打个比方:llama.cpp 是发动机,Ollama 是整车。你当然可以直接用发动机,但Ollama让你坐上驾驶座、插上钥匙就能开走。

典型应用场景

1 个人学习与研究

  • 学习大模型原理,亲手调参观察效果变化
  • 练习Prompt Engineering,测试不同模型的响应差异
  • 作为RAG、Agent等应用开发的后端模型引擎

2 企业私有化部署

  • 构建内部本地知识库(无需把公司文档上传到公网)
  • 打造私密AI客服、内部助手
  • 满足数据合规要求(金融、医疗等行业)

3 开发与测试

  • 替代线上API进行单元测试和集成测试
  • 在无网络环境中开发AI应用
  • 为产品原型提供后端模型能力,快速验证模型

4 教育与演示

  • 课堂教学演示大模型工作原理
  • 做技术分享时展示模型部署流程

Q1:Ollama 和 DeepSeek 是什么关系?

  • DeepSeek 是深度求索公司开发的大语言模型(模型本身)
  • Ollama 是运行工具(用来加载和运行DeepSeek等模型)
  • 类比:DeepSeek ≈ 游戏软件,Ollama ≈ 游戏主机

Q2:没有独立显卡能用吗?

可以。Ollama同时支持GPU和CPU运行:

  • 有NVIDIA显卡:自动使用CUDA加速,速度更快
  • 只有CPU:也能运行,但推荐使用小参数量模型(如7B)或量化版本(如q4),速度可能较慢但可接受

一句话总结

Ollama = 本地大模型的一键启动器 + 管理器 + API 服务。

📺 进阶学习 本文是《Ollama 完全指南》系列教程中的一节。如果你想系统掌握 Ollama 的所有高阶技巧,可以:👉 观看完整的视频教程

ollama