什么是 Ollama?
Ollama 是用于在 macOS、Windows 和 Linux 上运行受支持模型的开源模型运行与分发工具。它提供命令行界面、模型库、Modelfile、原生本地 HTTP API,以及针对部分操作且有文档说明的 OpenAI 兼容 API。
快速了解
| 全称 | Ollama Local LLM Framework |
|---|---|
| 创建时间 | 2023年发布,随着 Llama 2/3 的开源而迅速爆火 |
| 规范文档 | 官方规范 |
工作原理
Ollama 通过简洁的 CLI 和后台服务管理受支持的模型,降低本地模型评测的配置成本。`Modelfile` 可以声明经过核验的基础模型、提示词模板、系统消息、参数、适配器或受支持的本地模型文件。应用既可调用原生 `/api`,也可使用文档列出的 `/v1` 兼容层;OpenAI 兼容接口并非完全等价,应针对固定的 Ollama 版本测试。发送到本地接口的请求可以在本机处理,但模型下载、云端模型、应用遥测、插件、备份和远程回退是独立的数据路径。因此,本地执行可以支持隐私架构,却不会自动保证隐私或合规。
主要特点
- CLI 优先工作流:用简洁命令拉取、检查、创建、运行和删除受支持的模型
- 跨平台运行时:支持 macOS、Windows 和 Linux;实际加速与内存行为取决于版本、设备、驱动、模型和量化
- Modelfile 定制:声明基础模型、提示词行为、运行参数、模板以及受支持的适配器或模型文件
- 两套 API:原生本地 API,以及针对部分接口和功能的 OpenAI 兼容层
- 模型库:发现带版本 Tag 的模型,同时独立核对来源、许可证、模板、上下文行为和资源需求
常见用途
- 受控本地评测:不向托管模型服务商发送推理请求,测试已经批准的提示词和模型版本
- 支持离线的应用:在预先下载并核验所需软件和模型后运行
- 开发与回归测试:在代表性任务上本地验证 AI 工作流,并测量质量、延迟、内存和成本
- 运行外部训练的模型:核对转换、模板、Tokenizer、许可证和质量后,导入受支持的 GGUF 模型文件或适配器
- 本地 RAG 原型:将本地模型接口与单独加固的检索、存储、授权和可观测组件组合
示例
Loading code...常见问题
Ollama 可以在没有独立显卡的电脑上运行吗?
部分模型和平台组合可以在没有独立 GPU 的情况下运行,但不存在通用的“可接受性能”阈值。应针对具体 Ollama 版本、模型版本、量化方式、上下文长度、并发和工作负载进行基准测试,并测量内存压力、延迟、吞吐和输出质量。
Ollama 和 LM Studio 有什么区别?
两者能力有重叠,但工作流侧重不同。Ollama 以 CLI、Modelfile、后台服务和 API 为中心;LM Studio 更强调桌面 GUI,同时也提供开发者功能。应按当前版本比较模型格式支持、许可证、API 行为、硬件性能、更新控制和所需运维模式。
如何让局域网内的其他设备访问我的 Ollama 服务?
除非确实需要远程访问,否则应让 Ollama 保持在回环地址。将 `OLLAMA_HOST` 绑定到非回环接口会暴露本地 API,而该 API 在 localhost 上不要求鉴权。远程访问应置于带身份验证的反向代理或私有网络边界后,并配置 TLS、授权、限流、日志控制和主机防火墙;不能只依赖“位于局域网”。