Ollama 与 LM Studio 对比:哪款本地 AI 工具更适合你?
如果你已经决定在自己的电脑上运行 AI 模型,几乎一定会遇到同样的两个名字:Ollama 和 LM Studio。 它们是 2026 年运行本地大语言模型最主流的两种方式,而大多数指南都会告诉你其中一款“更好”。 这种比较方式并不恰当。
它们面向的是不同人群。 你应该根据自己的实际工作方式来选择,而不是看某张基准测试截图。 本文会详解两者的实际差异、各自适合的人群,以及如何将你选择的工具连接到浏览器,以便使用本地模型与任何网页聊天。
没有赞助,也没有推广返利。 我们只希望你能用上本地 AI,而且两款工具我们都支持。
一句话总结
Ollama 以自动化为先,LM Studio 以探索为先。
Ollama 以 CLI 和本地 API 为核心,不过现在也提供 macOS 和 Windows 聊天应用。
LM Studio 以桌面界面为核心,不过它的 lms CLI 和 llmster 守护进程现在也足以胜任严肃的无头运行场景。
如果你经常使用终端,想要一款可编写脚本并能被其他工具调用的工具,Ollama 会更顺手。 如果你想点击按钮、直观地浏览模型,并且完全不碰命令行,LM Studio 是更容易上手的入口。
两者都可以免费进行本地推理,也都支持 macOS、Windows 和 Linux,但有一个重要例外:当前版本的 LM Studio 不支持 Intel Mac。 两者都支持 Llama、Mistral、Qwen、DeepSeek 和 Gemma 等热门开放权重模型系列,但它们的模型目录、格式、量化版本、提示词模板和运行时默认设置并不完全相同。 本地聊天数据会留在你的电脑上,而可选的云端模型、网络搜索和远程工具则会将相关数据发送到设备之外。 所以,你并不是在“好”与“坏”之间做选择。 你选择的是一种工作流。
Ollama:开发者的默认选择
Ollama 会运行一项本地服务,并同时提供 CLI 和 API。 你可以用两条命令拉取并运行模型:
ollama pull llama3.2
ollama run llama3.2让它成为开发者默认选择的并不是聊天功能,而是围绕聊天功能构建的一切:
- 易于集成。 Ollama 在端口
11434上提供本地 API,因此脚本、编辑器和浏览器扩展无需打开聊天窗口即可使用它。 服务可以持续运行,但默认情况下,模型会在五分钟后从内存中卸载,因此下一次请求仍可能遇到模型加载延迟。 - 可编写脚本。 可重复执行的安装、Dockerfile、CI 流水线和服务部署都很适合它以命令为先的设计。 它的官方 Docker 镜像支持 CPU、NVIDIA、AMD ROCm 和 Vulkan 配置,不过 macOS 上的 Docker Desktop 无法将 Apple GPU 直通给容器。
- 也提供云端模型。 Ollama 可以通过同一套界面向可选的托管模型发送请求,因此你既可以用本地推理处理敏感工作,也可以在需要时租用更多算力。 云端模型的名称和可用性会发生变化,因此请查看当前的 Ollama 云端模型目录,不要依赖旧的模型标签。
代价是,Ollama 的模型管理和集成工作流仍然以命令为先。 它的 macOS 和 Windows 应用现在已经支持聊天、下载、文件附件和上下文长度设置,但在可视化模型发现和精细调优方面,LM Studio 依然强得多。
如果你会编写代码、执行自动化任务、希望其他工具调用你的模型,或者只是更喜欢键盘而不是鼠标,请选择 Ollama。
LM Studio:直观易用的选择
LM Studio 是一款打磨精良的桌面应用。 下载并打开它后,你会直接看到可搜索的模型目录和一个真正的聊天窗口。 完全不需要终端。
它的优势包括:
- 模型发现。 LM Studio 可以搜索 Hugging Face 上受支持的模型及其精选目录,让你比较不同量化版本并一键下载。 如果你还在探索“我到底该运行什么模型?”,它提供的信息比纯终端模型目录更丰富。
- 确实很容易上手。 你可以用滑块调整上下文长度、GPU 卸载和生成参数,而且开箱即用的聊天界面功能完整。 即使你从未打开过终端,也能很快运行一个能力不错的模型。
- 硬件调优。 LM Studio 提供 GPU 卸载、逐 GPU 选择、上下文长度、Flash Attention 和其他模型加载控制项。 它还可以在加载前估算 RAM 和 VRAM 用量。
- MCP 工具。 LM Studio 可以接入本地或远程 MCP 服务器,获得网络搜索和页面读取等能力。 模型可以继续在本地运行,但使用联网工具就不再是离线工作流。
- 也已成长为面向开发者的工具。 GUI 不再是唯一入口。
LM Studio 自带
lmsCLI,而对于 Linux 服务器、GPU 工作站和其他服务部署场景,llmster是官方推荐的无头守护进程。 它的官方 Docker 镜像仍是仅支持 CPU 的技术预览版。
代价是,LM Studio 是专有软件,并且仍以桌面端为先,同时它的 Docker 打包方案还不够成熟。
不过,它的原生无头支持已不再处于实验阶段,并且可以运行一台可配置的本地服务器,默认端口为 1234。
Ollama 仍是基础设施场景中更简单的默认选择,而 LM Studio 则是选择和调优模型时更强大的工作台。
如果你想要 GUI、还在摸索自己喜欢哪些模型,或者只想以最轻松的方式开始,请选择 LM Studio。
并排对比
| Ollama | LM Studio | |
|---|---|---|
| 界面 | 桌面应用 + CLI + API | 桌面应用 + lms CLI + API |
| 最适合 | 构建、自动化、集成 | 探索、聊天、调优 |
| 模型发现 | ollama pull <name> |
可视化 Hugging Face 浏览器 |
| 本地服务器 | 端口 11434;应用或服务默认在登录时启动 |
可配置;默认端口为 1234 |
| 无头运行 | 原生服务和 CLI | 原生 llmster 守护进程 |
| Docker | 官方 CPU 和 GPU 配置 | 仅支持 CPU 的技术预览版 |
| 云端模型 | 可选,按量计费 | 可选,按使用量付费 |
| 工具 / 网络搜索 | 通过客户端和集成 | MCP 服务器和内置选项 |
| 模型格式 | Ollama 模型库,以及受支持的 GGUF 和 Safetensors 导入 | 受支持的 GGUF;Apple Silicon 上还支持 MLX |
| 学习曲线 | 较陡峭(终端) | 平缓(点击操作) |
| 本地使用成本 | 免费 | 个人及企业内部使用免费 |
| 源代码许可证 | Ollama 代码采用 MIT 许可证;模型许可证各不相同 | 桌面应用是专有软件;lms 和 MLX 引擎采用 MIT 许可证 |
性能:操作系统、RAM 和 GPU 会带来哪些影响
对于“哪一款更快?”这个问题,并不存在一个诚实且放之四海皆准的答案。
当两款应用通过相似的 llama.cpp 后端运行同一个 GGUF 文件,并采用相同的上下文和 GPU 卸载设置时,硬件和设置通常比启动器本身更重要。
它们的运行时版本仍可能有所不同,因此你应该对自己的确切模型进行基准测试,不要直接套用其他量化版本或其他电脑的测试结果。
从内存入手,而不是只看参数量
模型权重、上下文或 KV 缓存、运行时开销、视觉输入和并发请求都会占用内存。
一个勉强能放进磁盘的模型文件仍可能无法加载,而增加上下文长度可能会额外占用数 GB 内存。
Ollama 明确提醒,更长的上下文需要更多内存,而 LM Studio 可以在加载前运行 lms load --estimate-only <model>。
以下 Q4 模型文件大小是用于规划的粗略参考,并非保证:
| 模型规模 | 典型 Q4 权重大小 | 合理的总内存目标 |
|---|---|---|
| 1B-4B | 1-3GB | 小上下文场景需要 8GB |
| 7B-8B | 4-6GB | 16GB |
| 12B-14B | 8-10GB | 16-24GB |
| 20B-32B | 12-22GB | 32GB 或更多 |
| 70B | 40-50GB | 64GB 或更多 |
请为操作系统、浏览器和上下文缓存预留内存。 混合专家模型也可能不符合这些规律,因为总参数量、活跃参数量和已存储权重描述的是不同概念。
macOS:Apple Silicon 和 Intel Mac
Apple Silicon 往往是最容易配置的笔记本电脑方案,因为 GPU 可以访问与 CPU 相同的统一内存池。 两款工具都通过 Metal 加速推理,LM Studio 还可以运行受支持的 MLX 模型。 统一内存容量决定了能装下哪些模型,而内存带宽意味着在内存容量相近时,Pro、Max 或 Ultra 芯片的生成速度可能比基础款芯片更快。 芯片代际、模型架构、量化方式和上下文仍然会影响性能,因此仅凭“M 系列”并不能判断性能。
| Mac 配置 | 实用起点 |
|---|---|
| 8GB Apple Silicon | 1B-4B Q4 模型和适中上下文;关闭其他内存占用较高的应用 |
| 16GB Apple Silicon | 可轻松运行 7B-8B Q4;限制上下文时可运行部分 12B-14B 模型 |
| 24GB Apple Silicon | 可轻松运行 12B-14B Q4;如果估算后仍有余量,也可运行部分更大模型 |
| 32GB-36GB Apple Silicon | 可运行许多 20B-32B 量化模型 |
| 64GB+ Apple Silicon | 运行量化后的 70B 级模型开始变得切实可行,但速度会因芯片等级而有很大差异 |
Ollama 支持 macOS 14+,可在 Apple M 系列芯片上使用 CPU 和 GPU 加速,也可在 Intel Mac 上仅使用 CPU 推理。 LM Studio 要求 macOS 14+ 和 Apple Silicon,不支持 Intel Mac。 因此,在 Intel Mac 上,Ollama 是这两款工具中的唯一选择,但仅使用 CPU 的生成速度通常会比 Apple Silicon 上的 Metal 加速慢得多。
Windows 和 Linux:NVIDIA、AMD、Intel 和纯 CPU
如果使用独立 GPU,最快的配置通常是选择能够完整装入 VRAM 且无需将部分层溢出到系统 RAM 的最大模型。 部分 CPU/GPU 卸载可以运行更大的模型,但通过总线传输计算任务会降低速度。
在 Windows x64 上,两款工具都支持本地 CPU 和 GPU 推理,而 LM Studio 要求 AVX2,并建议至少配备 16GB RAM 和 4GB 独立 VRAM。 LM Studio 还明确支持原生 Windows ARM;如果你准备在 ARM Windows 电脑上选择 Ollama,请先确认其当前提供的平台安装包。 Linux 提供最丰富的无头和容器方案,两款工具均提供 x64 和 ARM64 安装包。 在两种桌面操作系统上,NVIDIA 通常都比较容易配置,而受支持的 AMD 设备和驱动要求在 Windows 与 Linux 之间存在更多差异。
| 硬件 | 预期情况 |
|---|---|
| NVIDIA GPU | 通常是 Windows 或 Linux 上最简单的加速方案,但 CUDA 支持取决于当前的驱动程序和 GPU 要求。 |
| AMD GPU | 部分硬件可通过 ROCm 运行,Vulkan 则覆盖其他配置,但购买硬件前必须核对具体 GPU 和操作系统的支持列表。 |
| Intel 或其他 Vulkan GPU | 支持情况取决于具体设备和驱动程序,因此应将其视为需要实际测试的配置,而不是普遍保证。 |
| 仅使用 CPU | 较小的量化模型可以运行,但生成速度通常较慢,而且会争用系统 RAM 带宽;LM Studio 在 x64 Windows 和 Linux 上要求 AVX2。 |
粗略按照独立显存来判断,4GB-8GB 属于小模型范围,12GB-16GB 很适合 7B-14B 量化模型,而 24GB 则为许多 20B-32B 模型提供了空间。 要让量化后的 70B 模型完全在 GPU 上运行,通常需要工作站级 VRAM 或多块 GPU。 请务必查看最新的 Ollama GPU 支持矩阵和 LM Studio 系统要求,因为 AMD 和较旧 NVIDIA GPU 的兼容性取决于驱动程序和具体设备代际。
如何公平比较 Ollama 和 LM Studio
请使用完全相同的 GGUF 文件和量化版本、提示词、上下文长度、采样设置及 GPU 卸载程度。
先预热模型一次,避免模型加载时间影响生成速度,然后使用同一提示词至少重复测试三次。
同时比较提示词处理速度和每秒生成的 token 数,并观察内存使用情况以及所有层是否都留在 GPU 上。
使用 Ollama 时,ollama ps 会显示 CPU/GPU 分配情况和当前上下文。
使用 LM Studio 时,请查看加载估算器和开发者日志。
如果在设置一致的情况下,其中一款工具明显更慢,请先检查运行时版本、GPU 后端、Flash Attention、上下文长度,以及模型是否有一部分回退到 CPU 运行。
实话实说:你不必永远只选一个
很多人会同时使用两款工具。 你可以先用 LM Studio 直观地发现和测试模型,等到需要更简单的脚本编写和部署方式时,再在 Ollama 中复现这套配置。 它们可以共存于同一台电脑,并使用不同的默认端口,但下载的模型文件不会自动共享。
而且,这类比较通常忽略了一个更重要的问题:你用来运行模型的工具,并不是你每天真正花时间使用的工具。 Ollama 和 LM Studio 都是引擎。 你真正想要的是把这个模型_用_在实际工作中,例如处理此刻正在你面前打开的页面。
无论选择哪款,都把它连接到浏览器
终端或桌面聊天窗口中的本地模型很有用。 如果本地模型可以读取你正在浏览的网页、研究论文、合同、文档和竞争对手的定价信息,并且无需复制粘贴就能回答相关问题,它的实用程度会提升到另一个层次。
这正是 SurfMind 所做的事。 它是一款浏览器扩展,可以读取你正在浏览的页面,并让你围绕页面内容展开真正的对话,而对话由你选择的模型驱动。 它将本地模型视为一等公民,因此同时支持 Ollama 和 LM Studio。 下面介绍如何分别接入这两款工具。
如果你选择了 Ollama
启动 Ollama 前,请允许浏览器扩展来源访问:
# Mac/Linux (interactive server)
OLLAMA_ORIGINS="chrome-extension://*,moz-extension://*,safari-web-extension://*" ollama serve
# Windows (PowerShell)
$env:OLLAMA_ORIGINS="chrome-extension://*,moz-extension://*,safari-web-extension://*"; ollama serve如果 Ollama 桌面应用或 Linux 服务已经在运行,请为该服务配置 OLLAMA_ORIGINS 并将其重启,不要再启动第二台服务器。
如果你知道 SurfMind 的扩展 ID,使用其具体扩展来源会比允许所有扩展更加安全。
此设置仅改变浏览器来源访问权限;OLLAMA_HOST 则另行控制服务器是否监听 localhost 以外的地址。
在 SurfMind 中,打开模型选择器 → Custom 标签页 → Add Custom Models,然后选择 Ollama 预设。
它会自动填写所有内容(http://localhost:11434/api/chat)。
保存后,已安装的模型就会显示出来,随时可用。
带截图的完整操作步骤请参阅我们的 Ollama 指南。
如果你选择了 LM Studio
LM Studio 提供 OpenAI 兼容 API。
打开 LM Studio,前往 Developer 标签页,启用 CORS 以允许浏览器访问,加载一个模型,然后启动服务器。
其默认地址为 http://localhost:1234,但端口可以配置。
在 SurfMind 中,打开模型选择器 → Custom 标签页 → Add Custom Models,然后使用通用的 OpenAI-compatible 预设:
- API URL:
http://localhost:1234/v1/chat/completions - Models URL:
http://localhost:1234/v1/models - API Key Header: LM Studio 身份验证已禁用时选择 None
- API Key: LM Studio 身份验证已禁用时留空
LM Studio 默认不要求身份验证。
如果你启用了 LM Studio API 身份验证,请选择 Authorization 并输入生成的 token;SurfMind 会添加 Bearer 方案。
保存后,SurfMind 会列出已加载的模型;如果启用了 LM Studio 的即时加载功能,则会列出所有已下载的模型。
选择一个模型,然后开始与页面聊天。
那么,到底该选哪一个?
- 你会编写代码或执行自动化任务: Ollama。
- 你想要点击操作和精细调优: LM Studio。
- 你使用 Intel Mac: Ollama,但只能使用 CPU 推理。
- 你想在将模型加载到内存前对其进行比较和估算: LM Studio。
- 你确实无法决定: 安装 LM Studio 来探索模型,同时保留 Ollama 用于服务和脚本。
无论选择哪一款,真正的回报都是让模型处理你每天阅读的页面。 今天下午就安装你选择的引擎,将其添加到 SurfMind,然后打开下一篇你本来就打算阅读的文章。
常见问题
Ollama 和 LM Studio 哪个更好?
两者在客观上并无绝对优劣。 如果你需要一项可编写脚本并能被其他工具调用的本地服务,Ollama 更合适。 如果你想要一款友好的桌面应用,并需要可视化模型浏览和详细的加载控制,LM Studio 更合适。 许多人会用 LM Studio 发现模型,再用 Ollama 提供模型服务。
LM Studio 有 CLI 吗?
有。
LM Studio 自带命令行工具 lms,可以下载和加载模型、启动和停止服务器,还可以通过网络管理远程 LM Studio 实例。
从 0.4 版本起,独立的 llmster 守护进程也提供了完全无头的运行方式。
只有 Docker 镜像仍处于技术预览阶段,无头运行本身已不再是技术预览功能。
可以同时使用 Ollama 和 LM Studio 吗?
可以。
它们可以并排安装,并使用不同的默认端口:Ollama 使用 11434,LM Studio 使用 1234。
LM Studio 的端口可以配置,因此请避免将它设为 Ollama 使用的端口。
下载的模型文件会分开存储,因此在一款工具中拉取的模型不会自动出现在另一款工具中。
使用 Ollama 安全吗?
Ollama 的代码是开源的,本地推理不会将提示词或响应发送给 Ollama。
可选的云端模型和网络功能会在设备之外处理相关数据。
本地 API 没有身份验证,因此除非你添加了经过身份验证的代理和适当的网络控制,否则应将其保持绑定在 localhost 上。
OLLAMA_ORIGINS 控制哪些浏览器来源可以调用 API;OLLAMA_HOST 控制它绑定到哪些网络接口。
LM Studio 免费吗?
LM Studio 可供个人和企业内部免费使用,其中包括本地服务器,但其桌面应用是专有软件。 Ollama 的代码免费,并采用 MIT 许可证。 本地推理不按 token 收费,而两款产品目前都提供可选的付费云端推理。 各个模型权重有各自的许可证和使用条款。
Ollama 和 LM Studio 使用相同的模型吗?
两者支持的模型有很大重叠,但并不完全相同。 两者都能运行许多 GGUF 模型;LM Studio 还支持 Apple Silicon 上的 MLX 模型,而 Ollama 除了自有模型库中的软件包外,也可以导入受支持的 GGUF 和 Safetensors 模型。 即使基础模型相同,不同的量化方式、提示词模板、上下文长度、采样器默认设置和运行时版本也可能改变模型质量和速度。
运行本地模型需要 GPU 吗?
不需要,但硬件加速很重要。 纯 CPU 推理最适合有足够系统 RAM 的环境和较小的量化模型。 Apple Silicon 通过 Metal 使用集成 GPU,而受支持的 NVIDIA 和 AMD GPU 则在 Windows 和 Linux 上使用专用加速后端。 可用 RAM 或 VRAM 决定了哪些模型能够加载,而内存带宽、GPU 卸载、上下文长度和模型架构都会显著影响速度。 有关实用的硬件级别建议,请参阅上方的性能部分。
选好你的本地 AI 工具。 然后让它面向整个网络。