8G 显卡能玩什么?本地部署一个能听、能说的 AI 赛博女友

前言

8G 显存除了跑大模型,还能玩点什么不一样的?

比如,在本地部署一个能听、能说,还能和你实时语音聊天的 AI 赛博女友

对着麦克风说话,她能听懂你的声音并自然回答,同时驱动人物口型。形象、声音和性格都可以按照自己的喜好调整,还能接入本地大模型,把原本只存在于聊天框里的 AI,变成一个更有真实交流感的数字人。

整套系统的硬件门槛也不算高,使用 8G 显卡就可以运行,普通的消费级显卡也能体验到一套完整的本地 AI 语音交互系统。

1 项目介绍

项目地址:https://github.com/JunWan666/voice-companion-bundle

Voice Companion Bundle 是一套面向 Windows + WSL2 的本地 AI 数字人语音交互整合包,将语音识别、大模型对话、音色克隆、TTS 语音合成和数字人口型同步等功能整合到了一起。

部署完成后,可以直接通过浏览器麦克风与 AI 进行实时语音对话。系统会识别语音内容,交给大模型生成回复,再通过 TTS 合成对应声音,并同步驱动数字人口型。

整个项目主要包含以下几部分:

  1. 语音识别:使用 Faster-Whisper 进行实时语音识别。
  2. 大模型对话:支持 OpenAI 兼容接口,可接入在线 API 或本地大模型。
  3. 语音合成:通过 Qwen3-TTS 实现语音输出和参考音色克隆。
  4. 数字人驱动:使用 LiveTalking + Wav2Lip 实现人物口型同步。
  5. 个性化设置:支持修改助手人设、参考音色和数字人形象。
  6. 一键安装:提供 Windows PowerShell + WSL2 Ubuntu 自动安装流程。

项目整体以本地部署为主,模型、人物、音色、API Key 和运行日志都保存在自己的电脑中。

2 下载部署启动整合包

打开项目的 GitHub Release页面,下载最新版本的 Voice Companion Bundle 整合包。

项目Release地址:https://github.com/JunWan666/voice-companion-bundle/releases/tag/v1.0.1

image-20260821101441489

下载完成后,将压缩包解压到本地目录,解压后进入目录,可以看到一个名称为【setup.ps1】的脚本:

image-20260821101724916

在当前文件夹空白处按住 Shift 键并点击鼠标右键,选择【在此处打开 PowerShell 窗口】:
image-20260821101920030

接着,在PowerShell窗口中,输入【./setup.ps1】命令回车,按照提示完成剩下步骤,如下图:
image-20260821102250365

首次执行setup.ps1脚本会下载安装ubuntu系统和创建好用户,接着再次执行setup.ps1脚本:
image-20260821102356588

接着会根据显卡默认推荐对应档位,以及自动测试推荐更快的下载源,默认回车即可:
image-20260821102503595

这个部分会下载系统依赖,还会下载 Python 包管理环境、开源项目所需资源、数字人相关资源以及Qwen TTS 语音合成资源等,下载完成后如下图:
image-20260821102818841

这里会要求填写一个DeepSeek API的key,默认使用在线的LLM来进行驱动,减少对显卡的资源占用,前往DeepSeek官方创建一个key即可:

https://platform.deepseek.com/api_keys

如下图:
image-20260821103059727

接着回填到终端中,填写后会进行启动数字人服务,启动完成后会自动浏览器打开页面,如下图所示:
image-20260821103155693

这样就部署和启动好了!

3 对话测试与功能介绍

项目启动后,就可以直接测试语音对话效果了。

首先点击页面左上角的设置图标,选择当前使用的麦克风设备:

image-20260821103604101

然后点击【开始】按钮。稍等片刻,数字人会先进行一次语音回应,同时可以看到人物口型也会跟随声音同步变化。

image-20260821103631203

等数字人回答完成后,会出现麦克风,此时可以进行说话,如果环境太嘈杂,可以在设置中设置麦克风的噪声门限:
image-20260821103749767

接着介绍一下功能设置,点击右上角的设置按钮,可以看到助手页面,可以在该页面进行自定义人设:
image-20260821103949126

其次是音频页面,可以上传一段其他的参考音频,进行音色克隆。还有前面提到的噪声门限就是在这里设置:
image-20260821104131581

接着来到形象页面,可以上传一段人物视频,生成新的人物形象,数字人形象稍微吃显存,可以根据需要调整画质:

image-20260821104158042

最后是【服务】页面,这里主要用于配置负责对话的 LLM。项目默认使用 DeepSeek 在线 API,也支持添加其他 OpenAI 兼容服务,后面还可以通过 LM Studio 接入运行在本机的大模型:
image-20260821104414260

到这里,Voice Companion 的基础对话、人物形象、音色和服务配置就都已经了解了。默认使用在线大模型已经可以正常完成对话,接下来再把负责回答的 LLM 换成本地模型,让整套交互链路进一步本地化。

4 使用 LM Studio 部署本地大模型

前面使用的是 DeepSeek 在线 API,虽然使用起来比较方便,但 Voice Companion 同样支持接入运行在本机的大模型。

这里使用 LM Studio 来部署本地模型。它提供了图形化的模型下载、加载和运行界面,不需要手动配置复杂的推理环境,比较适合直接在 Windows 上运行本地大模型。

打开 LM Studio 官网,下载并安装 Windows 版本:

LM Studio 官网:https://lmstudio.ai/download

image-20260821182952214

下载下来后,双击安装,然后进入界面后,点击左下角设置,可以先将语言改为中文:
image-20260821183114536

接着,点击左侧边第4个,这里以 gemma 4模型为例,选择一个点赞较多的无审查版本:
image-20260821183319953

可以看到提示【可能能够完全加载进 GPU 显存】,代表这个模型可以完整的加载进你的显卡显存中,跑起来的速度一般会比较快的,点击侧边按钮下载即可:

image-20260821183431100

下载完成后,在顶部选择要加载的模型,进行加载:
image-20260821183528040

加载完成后,就可以进行对话测试了,这里发了一句【你好】进行测试:
image-20260821183614276

可以看到输出的token速度还是不错的,有34 token/s的速度。到这里本地模型就部署好了!

5 启用LM Studio的API服务并修改数字人走本地模型

点击左侧边栏的第二个,在Server Settings中,修改端口为一个未被windows保留的端口,如12345,然后任务栏右键LM Studio图标,点击启动服务(也可以点击Server Settings左侧的按钮启动服务):
image-20260821184404240

启动后,可以从日志中看到,服务启动成功:
image-20260821184533393

这样就可以使用LM Studio的API 服务了,Base URL地址如下:

http://localhost:12345

接着回到数字人服务页面,右上角设置按钮,进入服务页面,然后点击新增提供商,提供商名称自定义即可,BaseURL填写上面的地址,模型ID先输入任意字符,然后点击拉取模型,再删除刚才输入的任意字符,下拉框选择前面下载好的本地模型,点击测试,测试成功后点击保存并切换:

image-20260821184911694

切换成功后,返回主页,点击开始按钮,等待数字人回答或主动对话测试(可以打开任务管理器查看GPU占用):
image-20260821185229044

可以看到,在数字人生成回答时,GPU 占用会明显上升,说明当前对话已经成功切换到本地 LLM 进行推理。至此,Voice Companion 的语音识别、数字人口型、TTS 以及大模型对话就已经可以在本地协同运行。

6 下载安装cpolar

前面已经完成了 Voice Companion 的本地部署,也成功接入了在线和本地大模型,并测试了语音对话、数字人口型以及相关设置功能。

不过目前这个页面主要还是运行在本地电脑上,如果人在外面,手机切换到移动网络,就无法直接访问这套本地数字人服务。

为了让这个 AI 虚拟伴侣不只停留在电脑里,接下来可以使用 cpolar 内网穿透,把 Voice Companion 的本地 Web 服务映射成一个公网地址。这样即使没有公网 IP,也不用配置复杂的路由器端口转发,在手机、平板或者其他电脑上打开浏览器,就可以远程访问并继续进行语音对话。

6.1 什么是cpolar?

image-20250910114418412

  • cpolar 是一款内网穿透工具,可以将你在局域网内运行的服务(如本地 Web 服务器、SSH、远程桌面等)通过一条安全加密的中间隧道映射至公网,让外部设备无需配置路由器即可访问。
  • 广泛支持 Windows、macOS、Linux、树莓派、群晖 NAS 等平台,并提供一键安装脚本方便部署。

6.2 下载安装cpolar

打开cpolar官网的下载页面:https://www.cpolar.com/download
点击立即下载 64-bit按钮,下载cpoalr的安装包:

image-20250815171202537

下载下来是一个压缩包,解压后执行目录种的应用程序,一路默认安装即可,安装完成后,打开cmd窗口输入如下命令确认安装:

cpolar version

image-20250815171446129

出现如上版本即代表安装成功!

6.3 注册及登录cpolar web ui管理界面

官网链接:https://www.cpolar.com/

访问cpolar官网,点击免费注册按钮,进行账号注册

image-20250804085039567

进入到如下的注册页面进行账号注册:
image-20260301193227057

注册完成后,在浏览器中输入如下地址访问 web ui管理界面:

http://127.0.0.1:9200

image-20250815171734046

输入刚才注册好的cpolar账号登录即可进入后台页面:

image-20250815171846757

7 使用cpolar穿透 Voice Companion

首先,点击【隧道管理】下的【创建隧道】进入创建隧道页面,自定义一个隧道名称,本地地址填写Voice Companion项目的访问端口,然后点击创建即可:

image-20260821190545038

接着,来到状态下的在线隧道列表,可以看到同一隧道2条不同协议的公网地址:
image-20260821190717761

这里以https进行访问测试:

image-20260821190934744

可以看到,通过公网地址访问后,语音对话、数字人口型和模型回复都可以正常工作。这样一来,Voice Companion 就不再局限于本地电脑,在外网环境下也可以通过浏览器随时访问和使用。

8 固定二级子域名

前面通过 cpolar 已经可以生成公网地址并正常访问 Voice Companion,不过免费生成的随机域名可能会发生变化。如果希望长期保存一个固定的访问地址,可以继续配置 cpolar 的固定二级子域名。

8.1 保留二级子域名

首先登录 cpolar 官网后台,进入【预留】页面:

https://dashboard.cpolar.com/reserved

选择与当前隧道相同的地区,然后填写一个未被占用的二级子域名并保存:

配置项 填写说明
地区 选择和前面隧道一致的地区,如:China Top
名称 自定义二级子域名,例如 voice01注意:该项不能重复,二级子域名名称是唯一的
描述 填写任意方便辨识的备注即可

如下图:
image-20260823150629971填写完成后,点击【保留】按钮。保留成功后,会得到一个固定的二级子域名。

8.2 修改隧道为子域名方式

接着,回到【隧道管理>隧道列表】下,点击编辑7860这条隧道:

image-20260823150907778

将域名类型修改为【二级子域名】,并填写刚才在官网后台保留的二级子域名,然后点击更新按钮:

image-20260823150938382

更新完成后,点击左侧菜单【状态>在线隧道列表】,可以看到 7860 隧道已经变成固定公网地址:

image-20260823151018411

复制生成的固定公网地址,在浏览器中访问:

image-20260823151036478

可以看到,通过固定公网地址同样可以正常访问 Voice Companion。这样后续就不需要担心随机地址发生变化,无论是在电脑还是手机上,都可以通过同一个固定地址远程进行语音对话。

9 配置HTTP Auth添加访问认证

通过前面的配置,Voice Companion 已经可以通过固定公网地址进行远程访问。

不过,与只在本地电脑上使用不同,配置公网访问后,任何知道公网地址的人都有可能尝试打开 Voice Companion 页面。如果只是自己使用,可以继续通过 cpolar 的 HTTP Auth 功能增加一层账号密码认证,避免其他人直接访问。

首先,进入 cpolar Web UI 的【隧道管理 > 隧道列表】,找到前面创建的 7860 隧道,然后点击右侧的【编辑】:

image-20260823150907778

在隧道编辑页面中展开【高级】设置,找到【HTTP Auth】配置项,按照下面的格式填写用户名和密码:

注意:HTTP Auth 属于公网隧道的访问保护,并不是 Voice Companion 本身的用户系统。建议设置一个不容易被猜到的独立密码,并优先使用 HTTPS 公网地址访问。

用户名:密码

如下图所示,设置好后点击更新:

98b5bdf0-cb05-464b-b2d1-f677ed8f28c2

接着重新打开 Voice Companion 的 HTTPS 公网地址,此时浏览器会弹出身份验证窗口:

image-20260823152719690

这样就成功给公网访问增加了一层身份认证。后续即使公网地址被其他人获取,也无法在不知道账号密码的情况下直接打开数字人页面。

总结

通过这次部署,可以看到 Voice Companion 并不只是一个简单的聊天页面,而是把语音识别、大模型对话、TTS 语音合成、音色克隆以及数字人口型同步整合到了一起,让原本只存在于聊天框中的 AI,变成一个可以直接通过语音交流的本地数字人。

通过实际体验可以看到:

  • Voice Companion 支持直接通过麦克风进行实时语音对话,系统会完成语音识别、模型回复、语音合成以及数字人口型同步;
  • 人物形象、参考音色和助手人设都可以根据自己的需求进行调整,能够进一步自定义数字人的外观、声音和性格;
  • 默认可以接入 DeepSeek 等在线大模型 API,减少本地显卡资源占用,也可以通过 LM Studio 接入本地大模型,让整套对话链路进一步本地化;
  • 结合 cpolar 后,即使本地没有公网 IP,也可以将 Voice Companion 映射到公网,通过手机、平板或者其他电脑远程进行语音对话;

对于想体验本地 AI 数字人、语音助手或者 AI 虚拟伴侣的用户来说,Voice Companion 提供了一套相对完整的整合方案。不需要分别搭建语音识别、TTS、数字人口型和大模型服务,就可以比较直观地体验完整的本地 AI 语音交互流程。

感谢您阅读本篇文章,有任何问题欢迎留言交流。cpolar官网-安全的内网穿透工具 | 无需公网ip | 远程访问 | 搭建网站

Share:

发表回复

目录

On Key

推荐文章