前言
最近 Qwen3.8 系列模型刚发布,27B 版本的关注度也比较高。如果想在自己的电脑上体验,除了 Ollama 这类命令行工具,也可以试试更直观的 LM Studio。
LM Studio 的使用方式比较简单,从模型搜索、下载到加载运行,基本都可以直接在图形界面里完成。不过实际测试 27B 版本后,对普通显卡来说还是有些吃力,尤其是模型没办法完全放进显存时,生成速度会慢不少。
所以这次就来试试用 LM Studio 在本地运行 Qwen3.8,顺便看看不同大小的模型该怎么选,以及普通显卡实际跑起来效果怎么样。
1 LM Studio 介绍
LM Studio 是一款面向本地大模型的桌面工具,支持 Windows、macOS 和 Linux。下载安装之后,可以直接在软件里搜索和下载模型,并通过图形界面完成模型加载和运行,不需要单独配置复杂的命令行环境。
和 Ollama、llama.cpp 这类本地大模型工具相比,LM Studio 比较明显的特点就是图形化程度更高。模型占用多少内存、上下文长度怎么设置、GPU 卸载多少层,都可以直接在界面中查看和调整,对于刚开始接触本地大模型的用户会更直观一些。
除了直接在 LM Studio 里和模型对话,它还可以启动本地 API 服务,并提供 OpenAI 兼容接口。这样下载到电脑里的模型不只能在 LM Studio 中使用,也可以接入其他支持 OpenAI API 的应用。
2 下载与安装 LM Studio
打开 LM Studio 官网,这里以Windows 版本为例,下载下来:
LM Studio 官网:https://lmstudio.ai/download
下载下来后,双击安装,一路下一步即可,然后进入界面后,点击左下角设置,可以先将语言改为中文:

这样就安装和做好初始准备了!
3 下载并运行体验 Qwen3.8
安装完成后,就可以直接在 LM Studio 中下载模型了。
点击左侧第四个模型搜索,在搜索框中输入 Qwen3.8,可以找到不同参数规模和量化版本的模型:
同一个模型通常会提供 Q4、Q5、Q6、Q8 等不同量化版本。经过量化之后,模型体积会更小,对显存和内存的要求也会降低,更适合在普通电脑上运行。
如果不知道自己的电脑适合哪个版本,可以参考 LM Studio 给出的资源占用提示,再根据自己的显存和内存进行选择。
这次一开始测试的是目前关注度比较高的 Qwen3.8 27B。不过当前测试电脑使用的是 RTX 3060 Ti,只有 8GB 显存,运行 27B 还是比较吃力的:
可以看到,实际生成速度只有 3~4 token/s 左右,日常对话需要等待比较长的时间。不过速度慢主要还是受到当前硬件配置的限制,27B 本身的效果还是不错的。这里也在另一台配备 4×RTX 2080 Ti 22GB 的机器上进行了测试,并将模型接入最近比较热门的 DeepSeek Harness,让它完成一个简单的页面开发任务:

可以看到,整个任务耗时约 6 分 17 秒,然后生成速度平均可以达到 38 token/s 左右。给出的提示词也很简单,只让它制作一个适合国内用户使用的登录页面,最终生成的效果如下:

最终页面的布局比较完整,除了基础的账号登录之外,还主动加入了三种国内比较常见的第三方登录方式,整体 UI 和功能完整度都不错。
所以如果电脑配置足够,27B 还是比较值得体验的。但对于 8GB 显存的普通显卡来说,3~4 token/s 的速度用起来确实有些慢,接下来换一个更小的 Qwen3.8 9B 看看效果。
在搜索框中输入 Qwen3.8 9B,按照点赞进行排序,这里选择下面这个模型:
Noobito45/Qwen3.8-9B-heretic-uncensored-NVFP4-GGUF
这是一个降低拒答倾向的社区微调版本。右侧可以看到 LM Studio 给出了“可能能够完全加载进 GPU 显存”的提示,对于显存有限的电脑,可以优先参考这个提示来选择模型。
这里选择 Q8_0 量化版本,模型大小约 6.99GB,点击下载:
加载完成后,可以通过顶部的下拉框查看和切换当前模型。从模型旁边的功能图标中,也可以看到它支持视觉、工具调用和思考等能力:

先简单发送一句“你好”测试生成速度:
这次速度就明显快了不少,在 RTX 3060 Ti 8GB 上可以达到 21 token/s 左右,日常对话已经比较流畅。
接着测试一下它的视觉能力,上传一张图片让模型识别其中的内容:
可以看到,从回答来看,模型能够比较准确地识别图片中的主要内容,基本和原图一致。
最后再测试一下编码能力,这里给同样制作登录页面的提示词:
写一个好看的登录页面,适合国内用户使用的
将生成的代码复制到 HTML 文件中,再通过浏览器打开看看实际效果:

可以看到,最终生成的页面整体比较简约,布局和视觉效果也都不错。虽然和前面测试的 27B 相比,在细节和完整度上还有一些差距,但考虑到它在 8GB 显存上的运行速度,作为日常本地使用的模型已经比较合适了。
4 开启 LM Studio API 服务
前面我们已经可以直接在 LM Studio 中和模型对话了,不过除了自带的聊天界面之外,LM Studio 还可以启动一个本地 API 服务,让其他软件和应用调用当前运行的模型。
点击左侧的第2个开发者页面,在Server Settings中,修改端口为一个未被windows保留的端口,如12345,然后任务栏右键LM Studio图标,点击启动服务(也可以点击Server Settings左侧的按钮启动服务):

启动后,可以从日志中看到,服务启动成功!这样就可以使用LM Studio的API 服务了,Base URL地址如下:
http://localhost:12345
接下来使用 Cherry Studio 测试一下这个 API 是否能够正常调用。
Cherry Studio 是一款开源的 AI 桌面客户端,支持接入多种在线大模型服务,同时也支持 Ollama、LM Studio 等本地模型。这里正好可以把刚刚启动的 LM Studio API 接进去,看看能不能直接调用本地运行的 Qwen3.8。
Cherry Studio 官网:https://cherryai.com/
打开 Cherry Studio,点击左下角的设置,添加一个新的模型服务商,将前面 LM Studio 的 Base URL 填写进去:
接着获取模型列表,选择前面已经下载并加载的 Qwen3.8 模型,再根据模型实际支持的功能勾选对应能力:

配置完成后返回首页,新建一个助手,并选择刚刚添加的 Qwen3.8 模型进行对话测试:

可以看到,Cherry Studio 已经能够正常调用 LM Studio 中运行的模型并返回回答。这样,本地部署的 Qwen3.8 就不只能在 LM Studio 自带的聊天界面中使用,也可以通过 API 接入其他支持 OpenAI 兼容接口的应用。
5 远程访问本地模型
前面已经成功在 Cherry Studio 中调用了 LM Studio 的 API,不过现在使用的还是 localhost 地址,只能在当前电脑上直接访问。
如果还想在其他电脑上调用,或者出门之后通过笔记本、手机访问家里运行的模型,就需要让这个本地 API 能够从外部访问。
这里可以使用 cpolar 创建一条公网隧道,将 LM Studio 的 12345 端口映射到公网。这样不需要公网 IP,也不需要修改路由器端口转发,就可以获得一个外部能够访问的公网地址。
5.1 什么是cpolar
- cpolar 是一款内网穿透工具,可以将你在局域网内运行的服务(如本地 Web 服务器、SSH、远程桌面等)通过一条安全加密的中间隧道映射至公网,让外部设备无需配置路由器即可访问。
- 广泛支持 Windows、macOS、Linux、树莓派、群晖 NAS 等平台,并提供一键安装脚本方便部署。
5.2 下载安装cpolar
cpolar 官网下载页:https://www.cpolar.com/download
打开 cpolar 官网,根据自己的系统下载对应版本。这里使用的是 Windows,选择Windows项的【立即下载 64-bit】按钮即可:
下载下来是一个压缩包,解压后执行目录种的应用程序,一路默认安装即可,安装完成后,打开cmd窗口输入如下命令确认安装:
cpolar version
如下图:
出现如上版本即代表安装成功!
5.3 注册及登录cpolar web ui管理界面
官网链接:https://www.cpolar.com/
访问 cpolar 官网,点击【免费注册】按钮,进行账号注册:
注册完成后,在浏览器中输入如下地址访问 web ui管理界面:
http://127.0.0.1:9200
如下图:
输入刚才注册好的cpolar账号登录即可进入后台页面:
5.4 创建 LM Studio 公网隧道
进入 cpolar Web 管理界面后,在【隧道管理>创建隧道】中,新建一条 HTTP 隧道,隧道名称可以自定义,本地地址填写LM Studio的访问端口,然后点击创建:

接着,来到状态下的在线隧道列表,可以看到同一隧道2条不同协议的公网地址:
接着,我们将该地址,修改替换掉 Cherry Studio 中配置的LM Studio的API地址,如下图:

可以点击获取模型列表按钮测试是否能成功获取,或者返回聊天对话测试:

可以看到,模型依然能够正常返回回答,说明现在已经可以通过公网地址调用这台电脑上运行的 Qwen3.8。这样即使不在同一个局域网中,也可以在其他电脑或者支持自定义 API 的客户端中配置这个地址,继续使用家里电脑上运行的本地模型。
6 固定二级子域名
前面已经可以通过 cpolar 生成的公网地址远程调用 LM Studio,不过免费随机地址会发生变化。如果只是临时测试没有什么影响,但如果准备长期在 Cherry Studio 或其他客户端中使用,每次地址变化后都需要重新修改 API 地址,会比较麻烦。
这时候可以给刚才创建的 LM Studio 隧道配置一个固定二级子域名,以后直接使用这个固定地址调用即可。
6.1 保留二级子域名
首先登录 cpolar 官网后台,进入【预留】页面:
https://dashboard.cpolar.com/reserved
选择与当前隧道相同的地区,然后填写一个未被占用的二级子域名并保存:
| 配置项 | 填写说明 |
|---|---|
| 地区 | 选择和前面隧道一致的地区,如:China Top |
| 名称 | 自定义二级子域名,例如 lmstudio01,注意:该项不能重复,二级子域名名称是唯一的 |
| 描述 | 填写任意方便辨识的备注即可 |
如下图:
填写完成后,点击【保留】按钮。保留成功后,会得到一个固定的二级子域名。
6.2 修改隧道为子域名方式
接着,回到【隧道管理>隧道列表】下,点击编辑 lmstudio 这条隧道:
将域名类型修改为【二级子域名】,并填写刚才在官网后台保留的二级子域名,然后点击更新按钮:
更新完成后,点击左侧菜单【状态>在线隧道列表】,可以看到 lmstudio 隧道已经变成固定公网地址:
现在就拥有了一个固定不变的公网地址,后续在 Cherry Studio 或其他客户端中使用时,就不需要再频繁修改 API 地址了。不过,由于现在 LM Studio 的 API 已经可以通过公网访问,接下来还需要给接口增加一层 API Key 鉴权,避免公网地址泄露后被其他人直接调用。
7 为 LM Studio API 添加 Token 身份验证
前面已经给 LM Studio 配置好了固定公网地址,不过此时还有一个比较重要的问题:API 默认是没有访问密码的。
如果只是通过 localhost 在本机使用,问题不大。但现在已经通过 cpolar 将接口映射到了公网,如果公网地址被其他人获取,就有可能直接调用电脑上运行的模型,占用本机的 CPU、GPU 和内存资源。
因此,在正式远程使用之前,建议再给 LM Studio API 加上一层 API Token 鉴权:
7.1 开启 API 身份验证
打开 LM Studio,进入左侧的第2个开发者页面,在 Server Settings 中找到 Require Authentication,将其开启:
LM Studio 默认不会要求 API 请求进行身份验证。开启这个选项后,后续通过 REST API 等方式发送的请求都需要携带有效的 API Token,否则将无法正常访问接口。
接着点击下方的 Manage Tokens,进入 Token 管理页面:
进入 Token 管理页面后,点击 Create Token 创建一个新的 Token,名称可以自定义,例如这里填写:
CherryStudio
下面两个选项主要控制 MCP Server 的调用权限。如果这里只通过 Cherry Studio 调用本地模型,不需要 MCP 功能,可以都保持 Deny,不会影响基础模型 API 的调用,接着点击创建:
创建成功后,LM Studio 会生成一串 API Token,将其复制并保存下来,例如我这里显示的为:
sk-lm-lSw12UcG:tcM9vyKRTcnJmYLG5XSu
如下图所示:
Token 创建完成后需要及时复制保存,LM Studio 后续不会再次完整显示该 Token。
7.2 在 Cherry Studio 中配置 Token
接下来重新打开 Cherry Studio,进入前面创建的 LM Studio 模型服务商配置。此时先不填写 API Token,直接点击获取模型列表进行测试:

可以看到,由于 LM Studio 已经开启了身份验证,此时模型列表获取失败,说明未携带 Token 的请求已经被拦截。
接着在 API 密钥一栏中填写刚才创建的 Token,再次点击获取模型列表:
这次已经可以正常获取 LM Studio 中的模型,说明 Token 身份验证配置成功。
这样一来,整个远程调用链路就变成了:
相比直接将没有鉴权的 API 暴露到公网,加入 Token 后,只有持有正确 Token 的客户端才能调用 LM Studio API,也更适合长期远程使用。
总结
整体来看,LM Studio 用来体验 Qwen3.8 还是比较方便的,从模型下载、运行到 API 调用基本都可以直接在图形界面中完成。对于普通显卡来说,重点还是根据自己的显存选择合适的模型大小,不一定参数越大越适合日常使用。
- 模型选择:8GB 显存更适合体积较小的版本,运行速度和使用体验会更均衡。
- 本地调用:LM Studio 可以直接开启 OpenAI 兼容 API,接入 Cherry Studio 等客户端使用。
- 远程访问:配合 cpolar、固定二级子域名和 API Token,可以在外网继续调用家里电脑上的本地模型。
这样一套流程下来,本地大模型就不只是“在电脑上跑起来”,还可以进一步作为自己的私人 API 服务使用。对于想体验本地模型,又不想折腾太多命令行配置的用户来说,LM Studio 算是一个比较容易上手的选择。
感谢您阅读本篇文章,有任何问题欢迎留言交流。cpolar官网-安全的内网穿透工具 | 无需公网ip | 远程访问 | 搭建网站































