Ollama 与 LM Studio 接入:完全离线跑本地模型
本地模型是三条接入路线里唯一"数据不出本机、费用为零"的一条。模型权重跑在你自己电脑上,断网也能对话。
两款工具怎么选
| 对比 | Ollama | LM Studio |
|---|---|---|
| 形态 | 命令行为主 | 图形界面 |
| 上手难度 | 适合习惯终端的用户 | 适合纯小白 |
| 模型管理 | 命令拉取 | 界面搜索下载 |
| 对外服务 | 本地 API 服务 | 本地服务器开关 |
两者干的事一样:把开源模型(Llama、Qwen、DeepSeek 蒸馏版等)跑在本机,并暴露一个本地接口给客户端调用。
接入 Ollama
- 从 Ollama 官方渠道下载安装
- 终端执行拉取命令装一个模型(如
ollama pull qwen类指令,具体模型名见 Ollama 模型库) - 确认 Ollama 服务在运行(默认监听本地端口 11434)
- 客户端设置 → 模型提供方 → 添加 Ollama
- API 主机填
http://localhost:11434(默认即可),保存后模型出现在列表里
接入 LM Studio
- 从官方渠道下载安装,界面里搜一个模型下载
- 打开「本地服务器」页签并启动服务
- 客户端里添加 LM Studio 提供方,主机填它显示的本地地址(通常也是 localhost 加端口)
- 保存后即可选用已下载的模型
硬件参考
- 内存 8GB:能跑 7B 级别的小模型,日常问答可用
- 内存 16GB:13B~14B 级别比较从容
- 显存充足(独立显卡):响应速度显著提升
- 具体跑多大模型,以实际机器表现为准——卡了就换更小的量化版本
适用与局限
适合:隐私敏感内容、离线环境、学习研究、不想花 API 钱。
局限:能力弱于云端旗舰模型;生图、联网搜索等依赖云端的能力没有;首次下载模型占几个 GB 磁盘。
配好本地模型后,它和云端提供方在模型列表里并列,随时切换。订阅与 BYOK 的取舍回顾见接入方式总览。