最新 Qwen3.8 来了!用 LM Studio 本地跑起来,普通显卡也能玩

前言

最近 Qwen3.8 系列模型刚发布,27B 版本的关注度也比较高。如果想在自己的电脑上体验,除了 Ollama 这类命令行工具,也可以试试更直观的 LM Studio

LM Studio 的使用方式比较简单,从模型搜索、下载到加载运行,基本都可以直接在图形界面里完成。不过实际测试 27B 版本后,对普通显卡来说还是有些吃力,尤其是模型没办法完全放进显存时,生成速度会慢不少。

所以这次就来试试用 LM Studio 在本地运行 Qwen3.8,顺便看看不同大小的模型该怎么选,以及普通显卡实际跑起来效果怎么样。

1 LM Studio 介绍

LM Studio 是一款面向本地大模型的桌面工具,支持 Windows、macOS 和 Linux。下载安装之后,可以直接在软件里搜索和下载模型,并通过图形界面完成模型加载和运行,不需要单独配置复杂的命令行环境。

ab5ba1fe-7cd4-491f-ad98-4af4e8eafb17

和 Ollama、llama.cpp 这类本地大模型工具相比,LM Studio 比较明显的特点就是图形化程度更高。模型占用多少内存、上下文长度怎么设置、GPU 卸载多少层,都可以直接在界面中查看和调整,对于刚开始接触本地大模型的用户会更直观一些。

除了直接在 LM Studio 里和模型对话,它还可以启动本地 API 服务,并提供 OpenAI 兼容接口。这样下载到电脑里的模型不只能在 LM Studio 中使用,也可以接入其他支持 OpenAI API 的应用。

2 下载与安装 LM Studio

打开 LM Studio 官网,这里以Windows 版本为例,下载下来:

LM Studio 官网:https://lmstudio.ai/download

image-20260821182952214

下载下来后,双击安装,一路下一步即可,然后进入界面后,点击左下角设置,可以先将语言改为中文:
image-20260821183114536

这样就安装和做好初始准备了!

3 下载并运行体验 Qwen3.8

安装完成后,就可以直接在 LM Studio 中下载模型了。

点击左侧第四个模型搜索,在搜索框中输入 Qwen3.8,可以找到不同参数规模和量化版本的模型:

image-20260827175214635

同一个模型通常会提供 Q4、Q5、Q6、Q8 等不同量化版本。经过量化之后,模型体积会更小,对显存和内存的要求也会降低,更适合在普通电脑上运行。

如果不知道自己的电脑适合哪个版本,可以参考 LM Studio 给出的资源占用提示,再根据自己的显存和内存进行选择。

这次一开始测试的是目前关注度比较高的 Qwen3.8 27B。不过当前测试电脑使用的是 RTX 3060 Ti,只有 8GB 显存,运行 27B 还是比较吃力的:

image-20260827175523271

可以看到,实际生成速度只有 3~4 token/s 左右,日常对话需要等待比较长的时间。不过速度慢主要还是受到当前硬件配置的限制,27B 本身的效果还是不错的。这里也在另一台配备 4×RTX 2080 Ti 22GB 的机器上进行了测试,并将模型接入最近比较热门的 DeepSeek Harness,让它完成一个简单的页面开发任务:
image-20260827180000242

可以看到,整个任务耗时约 6 分 17 秒,然后生成速度平均可以达到 38 token/s 左右。给出的提示词也很简单,只让它制作一个适合国内用户使用的登录页面,最终生成的效果如下:
image-20260827180144753

最终页面的布局比较完整,除了基础的账号登录之外,还主动加入了三种国内比较常见的第三方登录方式,整体 UI 和功能完整度都不错。

所以如果电脑配置足够,27B 还是比较值得体验的。但对于 8GB 显存的普通显卡来说,3~4 token/s 的速度用起来确实有些慢,接下来换一个更小的 Qwen3.8 9B 看看效果。

在搜索框中输入 Qwen3.8 9B,按照点赞进行排序,这里选择下面这个模型:

Noobito45/Qwen3.8-9B-heretic-uncensored-NVFP4-GGUF

这是一个降低拒答倾向的社区微调版本。右侧可以看到 LM Studio 给出了“可能能够完全加载进 GPU 显存”的提示,对于显存有限的电脑,可以优先参考这个提示来选择模型。

这里选择 Q8_0 量化版本,模型大小约 6.99GB,点击下载:

image-20260827183836128

下载完成后,点击右侧的加载按钮:
image-20260827185121999

加载完成后,可以通过顶部的下拉框查看和切换当前模型。从模型旁边的功能图标中,也可以看到它支持视觉、工具调用和思考等能力:
image-20260827185158892

先简单发送一句“你好”测试生成速度:

image-20260827190229949

这次速度就明显快了不少,在 RTX 3060 Ti 8GB 上可以达到 21 token/s 左右,日常对话已经比较流畅。

接着测试一下它的视觉能力,上传一张图片让模型识别其中的内容:

image-20260827190432908

可以看到,从回答来看,模型能够比较准确地识别图片中的主要内容,基本和原图一致。

最后再测试一下编码能力,这里给同样制作登录页面的提示词:

写一个好看的登录页面,适合国内用户使用的

模型经过思考后,很快就开始生成页面代码:
image-20260827194317629

将生成的代码复制到 HTML 文件中,再通过浏览器打开看看实际效果:
image-20260827194524836

可以看到,最终生成的页面整体比较简约,布局和视觉效果也都不错。虽然和前面测试的 27B 相比,在细节和完整度上还有一些差距,但考虑到它在 8GB 显存上的运行速度,作为日常本地使用的模型已经比较合适了。

4 开启 LM Studio API 服务

前面我们已经可以直接在 LM Studio 中和模型对话了,不过除了自带的聊天界面之外,LM Studio 还可以启动一个本地 API 服务,让其他软件和应用调用当前运行的模型。

点击左侧的第2个开发者页面,在Server Settings中,修改端口为一个未被windows保留的端口,如12345,然后任务栏右键LM Studio图标,点击启动服务(也可以点击Server Settings左侧的按钮启动服务):
image-20260828140401446

启动后,可以从日志中看到,服务启动成功!这样就可以使用LM Studio的API 服务了,Base URL地址如下:

http://localhost:12345

接下来使用 Cherry Studio 测试一下这个 API 是否能够正常调用。

Cherry Studio 是一款开源的 AI 桌面客户端,支持接入多种在线大模型服务,同时也支持 Ollama、LM Studio 等本地模型。这里正好可以把刚刚启动的 LM Studio API 接进去,看看能不能直接调用本地运行的 Qwen3.8。

Cherry Studio 官网:https://cherryai.com/

打开 Cherry Studio,点击左下角的设置,添加一个新的模型服务商,将前面 LM Studio 的 Base URL 填写进去:

image-20260828140738619

接着获取模型列表,选择前面已经下载并加载的 Qwen3.8 模型,再根据模型实际支持的功能勾选对应能力:
image-20260828141154752

配置完成后返回首页,新建一个助手,并选择刚刚添加的 Qwen3.8 模型进行对话测试:
image-20260828141531539

可以看到,Cherry Studio 已经能够正常调用 LM Studio 中运行的模型并返回回答。这样,本地部署的 Qwen3.8 就不只能在 LM Studio 自带的聊天界面中使用,也可以通过 API 接入其他支持 OpenAI 兼容接口的应用。

5 远程访问本地模型

前面已经成功在 Cherry Studio 中调用了 LM Studio 的 API,不过现在使用的还是 localhost 地址,只能在当前电脑上直接访问。

如果还想在其他电脑上调用,或者出门之后通过笔记本、手机访问家里运行的模型,就需要让这个本地 API 能够从外部访问。

这里可以使用 cpolar 创建一条公网隧道,将 LM Studio 的 12345 端口映射到公网。这样不需要公网 IP,也不需要修改路由器端口转发,就可以获得一个外部能够访问的公网地址。

5.1 什么是cpolar

image-20250910114418412

  • cpolar 是一款内网穿透工具,可以将你在局域网内运行的服务(如本地 Web 服务器、SSH、远程桌面等)通过一条安全加密的中间隧道映射至公网,让外部设备无需配置路由器即可访问。
  • 广泛支持 Windows、macOS、Linux、树莓派、群晖 NAS 等平台,并提供一键安装脚本方便部署。

5.2 下载安装cpolar

cpolar 官网下载页:https://www.cpolar.com/download

打开 cpolar 官网,根据自己的系统下载对应版本。这里使用的是 Windows,选择Windows项的【立即下载 64-bit】按钮即可:

image-20250815171202537

下载下来是一个压缩包,解压后执行目录种的应用程序,一路默认安装即可,安装完成后,打开cmd窗口输入如下命令确认安装:

cpolar version

如下图:

image-20250815171446129

出现如上版本即代表安装成功!

5.3 注册及登录cpolar web ui管理界面

官网链接:https://www.cpolar.com/

访问 cpolar 官网,点击【免费注册】按钮,进行账号注册:

image-20250804085039567

进入到如下的注册页面进行账号注册:
image-20260301193227057

注册完成后,在浏览器中输入如下地址访问 web ui管理界面:

http://127.0.0.1:9200

如下图:

image-20250815171734046

输入刚才注册好的cpolar账号登录即可进入后台页面:

image-20250815171846757

5.4 创建 LM Studio 公网隧道

进入 cpolar Web 管理界面后,在【隧道管理>创建隧道】中,新建一条 HTTP 隧道,隧道名称可以自定义,本地地址填写LM Studio的访问端口,然后点击创建:
image-20260828142923244

接着,来到状态下的在线隧道列表,可以看到同一隧道2条不同协议的公网地址:

image-20260828143013308

接着,我们将该地址,修改替换掉 Cherry Studio 中配置的LM Studio的API地址,如下图:
image-20260828143318842

可以点击获取模型列表按钮测试是否能成功获取,或者返回聊天对话测试:
image-20260828143729130

可以看到,模型依然能够正常返回回答,说明现在已经可以通过公网地址调用这台电脑上运行的 Qwen3.8。这样即使不在同一个局域网中,也可以在其他电脑或者支持自定义 API 的客户端中配置这个地址,继续使用家里电脑上运行的本地模型。

6 固定二级子域名

前面已经可以通过 cpolar 生成的公网地址远程调用 LM Studio,不过免费随机地址会发生变化。如果只是临时测试没有什么影响,但如果准备长期在 Cherry Studio 或其他客户端中使用,每次地址变化后都需要重新修改 API 地址,会比较麻烦。

这时候可以给刚才创建的 LM Studio 隧道配置一个固定二级子域名,以后直接使用这个固定地址调用即可。

6.1 保留二级子域名

首先登录 cpolar 官网后台,进入【预留】页面:

https://dashboard.cpolar.com/reserved

选择与当前隧道相同的地区,然后填写一个未被占用的二级子域名并保存:

配置项 填写说明
地区 选择和前面隧道一致的地区,如:China Top
名称 自定义二级子域名,例如 lmstudio01注意:该项不能重复,二级子域名名称是唯一的
描述 填写任意方便辨识的备注即可

如下图:

image-20260828145058202填写完成后,点击【保留】按钮。保留成功后,会得到一个固定的二级子域名。

6.2 修改隧道为子域名方式

接着,回到【隧道管理>隧道列表】下,点击编辑 lmstudio 这条隧道:

image-20260828145317454

将域名类型修改为【二级子域名】,并填写刚才在官网后台保留的二级子域名,然后点击更新按钮:

image-20260828145504144

更新完成后,点击左侧菜单【状态>在线隧道列表】,可以看到 lmstudio 隧道已经变成固定公网地址:

image-20260828145544903

现在就拥有了一个固定不变的公网地址,后续在 Cherry Studio 或其他客户端中使用时,就不需要再频繁修改 API 地址了。不过,由于现在 LM Studio 的 API 已经可以通过公网访问,接下来还需要给接口增加一层 API Key 鉴权,避免公网地址泄露后被其他人直接调用。

7 为 LM Studio API 添加 Token 身份验证

前面已经给 LM Studio 配置好了固定公网地址,不过此时还有一个比较重要的问题:API 默认是没有访问密码的

如果只是通过 localhost 在本机使用,问题不大。但现在已经通过 cpolar 将接口映射到了公网,如果公网地址被其他人获取,就有可能直接调用电脑上运行的模型,占用本机的 CPU、GPU 和内存资源。

因此,在正式远程使用之前,建议再给 LM Studio API 加上一层 API Token 鉴权:

image-20260828151737150

7.1 开启 API 身份验证

打开 LM Studio,进入左侧的第2个开发者页面,在 Server Settings 中找到 Require Authentication,将其开启:

image-20260828152450032

LM Studio 默认不会要求 API 请求进行身份验证。开启这个选项后,后续通过 REST API 等方式发送的请求都需要携带有效的 API Token,否则将无法正常访问接口。

接着点击下方的 Manage Tokens,进入 Token 管理页面:

image-20260828152543689

进入 Token 管理页面后,点击 Create Token 创建一个新的 Token,名称可以自定义,例如这里填写:

CherryStudio

下面两个选项主要控制 MCP Server 的调用权限。如果这里只通过 Cherry Studio 调用本地模型,不需要 MCP 功能,可以都保持 Deny,不会影响基础模型 API 的调用,接着点击创建:

image-20260828152824686

创建成功后,LM Studio 会生成一串 API Token,将其复制并保存下来,例如我这里显示的为:

sk-lm-lSw12UcG:tcM9vyKRTcnJmYLG5XSu

如下图所示:

image-20260828152902565

Token 创建完成后需要及时复制保存,LM Studio 后续不会再次完整显示该 Token。

7.2 在 Cherry Studio 中配置 Token

接下来重新打开 Cherry Studio,进入前面创建的 LM Studio 模型服务商配置。此时先不填写 API Token,直接点击获取模型列表进行测试:
image-20260828153222291

可以看到,由于 LM Studio 已经开启了身份验证,此时模型列表获取失败,说明未携带 Token 的请求已经被拦截。

接着在 API 密钥一栏中填写刚才创建的 Token,再次点击获取模型列表:

image-20260828153312860

这次已经可以正常获取 LM Studio 中的模型,说明 Token 身份验证配置成功。

这样一来,整个远程调用链路就变成了:

image-20260828153454576

相比直接将没有鉴权的 API 暴露到公网,加入 Token 后,只有持有正确 Token 的客户端才能调用 LM Studio API,也更适合长期远程使用。

总结

整体来看,LM Studio 用来体验 Qwen3.8 还是比较方便的,从模型下载、运行到 API 调用基本都可以直接在图形界面中完成。对于普通显卡来说,重点还是根据自己的显存选择合适的模型大小,不一定参数越大越适合日常使用。

  • 模型选择:8GB 显存更适合体积较小的版本,运行速度和使用体验会更均衡。
  • 本地调用:LM Studio 可以直接开启 OpenAI 兼容 API,接入 Cherry Studio 等客户端使用。
  • 远程访问:配合 cpolar、固定二级子域名和 API Token,可以在外网继续调用家里电脑上的本地模型。

这样一套流程下来,本地大模型就不只是“在电脑上跑起来”,还可以进一步作为自己的私人 API 服务使用。对于想体验本地模型,又不想折腾太多命令行配置的用户来说,LM Studio 算是一个比较容易上手的选择。

感谢您阅读本篇文章,有任何问题欢迎留言交流。cpolar官网-安全的内网穿透工具 | 无需公网ip | 远程访问 | 搭建网站

Share:

发表回复

目录

On Key

推荐文章