8G显存本地跑27B大模型Bonsai2-27B小白完整部署教程

前言

很多人都觉得,想在本地跑几十亿参数的大模型,必须要有高端显卡,至少12G、16G显存起步,普通8G显存的游戏卡根本想都别想。

但最近Bonsai2‑27B的出现打破了这个固有认知。依托特殊的三值量化技术,270亿参数的大模型,模型文件压缩到约5.9GB,官方宣称8G显存就可以本地运行。不用把数据丢到云端,不需要网络请求,对话的所有内容都保存在自己电脑上,隐私可控。

不过网上很多演示视频只展示了跑起来的效果,省略了大量部署细节。很多小白跟着视频操作,会遇到各种坑:nvcc命令识别失败、脚本无法执行、模型下载报错、加载权重直接崩溃。

这篇教程从零开始,一步一步带你完整部署Bonsai2‑27B,软件下载、环境配置、报错排查全部写清楚,就算你之前完全没接触过本地部署大模型,跟着操作也能尝试在你的8G独显电脑上,跑起这个27B大模型。

image-20260921164239641

1.硬件&系统前置要求

1.1 硬件最低配置

  • 显卡:NVIDIA独立显卡,显存≥8GB

注意:Windows 系统本身会占用一部分显存,8G显卡可能会出现爆显存。优先建议可用显存8.5G以上,显存不足可以调低上下文长度。

  • 磁盘:预留至少15GB空闲空间(模型接近6GB,加上运行环境文件)
  • 网络:能够访问HuggingFace,用于下载模型和代码仓库

1.2 系统环境

(Windows为主,文末附带Linux命令)

需要提前安装3个软件,小白按顺序安装即可:

  1. Git:拉取github代码仓库
  2. PowerShell(Windows自带,无需额外下载)
  3. NVIDIA CUDA Toolkit:显卡加速依赖,NVIDIA显卡必须安装

2.安装Git

  1. 打开官网:https://git-scm.com/download/win
  2. 下载64位安装包,一路点击Next默认安装即可,不需要修改任何选项。
  3. 验证是否安装成功: 按下键盘 Win+R,输入 powershell 回车打开终端,输入下面命令:
git --version

出现版本号,代表Git安装完成。

image-20260921110859316

3.Windows安装CUDA Toolkit 12.1

适配前面 Bonsai2-27B 部署教程,推荐版本:CUDA 12.1 ⚠️ 注意:显卡驱动 ≠ CUDA Toolkit。显卡驱动是显卡自带;CUDA Toolkit 是开发工具包,里面包含 nvcc 编译器。

3.1 前置检查

  1. 你的显卡必须是NVIDIA独显(AMD 显卡不能装 CUDA)
  2. Win+R输入 powershell,先执行这条,看显卡驱动:
nvidia-smi

image-20260921111126361

✅ 如果能输出表格,代表显卡驱动正常; ❌ 如果提示找不到nvidia-smi,需要先更新NVIDIA显卡驱动(NVIDIA官网下载GeForce驱动)。

nvidia-smi显示的CUDA Version是驱动支持的最高CUDA版本,不是你安装的CUDA Toolkit版本,不要搞混。

3.2 打开归档页面下载

地址:https://developer.nvidia.com/cuda-toolkit-archive

⚠️在页面找到 CUDA Toolkit 12.1.0 点击进入

image-20260921111257784

⚠️Operating System:Windows

image-20260921111333703

⚠️Architecture:x86_64

image-20260921111404956

⚠️Version:

  • ✅ 电脑是Windows 10 → 点 10
  • ✅ 电脑是Windows 11 → 点 11

Server 2019 / Server 2022是服务器系统,普通家用台式、笔记本不要选。

image-20260921111611990

⚠️Installer Type:推荐Local Installer(离线大包,推荐小白,不容易中途断流)

image-20260921111659258

⚠️点击下载,得到 cuda_12.1.0_531.14_windows.exe

image-20260921111732445

3.3 开始安装

  1. 双击exe安装包,会先解压临时文件,等待解压完成。
  2. 同意协议,选择Custom(自定义安装)(非常关键,不要选精简)
  3. 组件勾选(全部勾选):
    • CUDA
    • Visual Studio Integration(一定要勾!)
    • Nsight Systems、Nsight Compute 保持勾选
  4. 安装路径默认即可:

不建议修改路径,改路径更容易出现环境变量问题。

image-20260921112638742

3.4 验证+修复nvcc找不到

安装完旧的PowerShell窗口不会自动加载新环境变量!

输入:

nvcc -V
  • ✅ 输出版本号,成功。

image-20260921112752436

4.注册HuggingFace账号并生成访问令牌

⚠️打开 https://huggingface.co/ 注册账号,邮箱验证登录。

image-20260921112834542

⚠️右上角头像 → Settings 设置 → 左侧找到 Access Tokens

image-20260921113324288

⚠️点

New token

创建令牌:

  • Name:随便填写,例如 bonsai-read
  • Role 权限:选择 read(只读权限就够,不需要 write)
  • 点击 Generate 生成令牌。

image-20260921113343624

image-20260921113430213

⚠️复制保存这串token!关闭页面之后无法再次查看,丢了只能重新创建。

5.部署Bonsai2-27B

5.1 拉取Bonsai2-27B项目仓库,配置环境变量

在电脑找一个磁盘,比如F盘,新建文件夹Bonsai2,进入文件夹,在地址栏输入powershell回车,打开终端。

image-20260921143450621

克隆项目代码仓库,复制下面命令粘贴到终端回车:

git clone https://github.com/PrismML-Eng/Bonsai-demo.git

image-20260921143531181

进入项目目录:

cd Bonsai-demo

开启 PowerShell 脚本执行权限(Windows 默认禁止运行脚本,这一步必须执行)

Set-ExecutionPolicy -Scope Process -ExecutionPolicy Bypass

弹出提示输入Y回车确认。

image-20260921143555969

设置环境变量,把 HuggingFace token 替换成你自己刚才复制的那串,粘贴运行:

$env:BONSAI_FAMILY = "bonsai2"
$env:BONSAI_MODEL = "27B"
$env:BONSAI_TOKEN = "你的HuggingFace read令牌"

image-20260921143621493

5.2 Bonsai2-27B安装依赖

一键脚本安装依赖 + 自动下载模型

执行setup脚本,脚本会自动下载定制版llama.cpp运行库,并且自动拉取Bonsai2-27B模型权重到models文件夹:

.\setup.ps1

image-20260921143646812

等待执行:

  • 网络正常情况下,模型下载大概十几分钟;
  • 不要关闭PowerShell窗口;
  • 如果下载中断,重新运行一次脚本即可续传。

5.3 启动Bonsai2-27B-Web对话界面

模型下载完成后,执行启动服务脚本:

.\scripts\start_llama_server.ps1

image-20260921150427800

等待终端输出启动成功提示,打开浏览器访问地址:

http://localhost:8080

打开网页后,就可以直接和本地27B大模型对话,和视频演示效果一致。

image-20260921150331647

这样我们就可以使用啦!

image-20260921153456548

5.4 部署Bonsai2-27B的Linux系统命令

git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo
export BONSAI_FAMILY="bonsai2"
export BONSAI_MODEL="27B"
export BONSAI_TOKEN="你的hf read令牌"
./setup.sh1
./scripts/start_llama_server.sh

浏览器同样访问 http://localhost:8080

本地部署好Bonsai2-27B大模型之后,只能在本机浏览器127.0.0.1:8080访问,换手机、平板、其他电脑就打不开。借助cpolar内网穿透,不用公网IP、不用路由器端口映射,一键把本地Bonsai2的WebUI暴露到公网。 不管是在外手机远程调用你的27B模型,还是分享给朋友测试你8G显卡跑起来的Bonsai2,都可以直接访问,而且流量自带加密。

6.安装cpolar实现随时随地开发

6.1 什么是cpolar?

cpolar是一款安全高效的内网穿透工具,无需公网IP或复杂配置,只需一条命令,即可将本地服务器、Web服务或任意端口映射到公网,让你随时随地远程访问内网应用,特别适合开发调试、远程运维和应急部署等场景。

6.2 部署cpolar

接下来介绍一下如何安装cpolar内网穿透,过程同样非常简单:

首先进入cpolar官网:

cpolar官网地址: https://www.cpolar.com

点击免费使用注册一个账号,并下载最新版本的cpolar:

image-20250828153039526

登录成功后,点击下载cpolar到本地并安装(一路默认安装即可)本教程选择下载Windows版本。

image-20250828153119554

cpolar安装成功后,在浏览器上访问http://localhost:9200,使用cpolar账号登录,登录后即可看到配置界面,结下来在WebUI管理界面配置即可。

image-20250828153208376

7.配置公网地址

登录cpolar web UI管理界面后,点击左侧仪表盘的隧道管理——创建隧道:

  • 隧道名称:可自定义,本例使用了:Bonsai2,注意不要与已有的隧道名称重复
  • 协议:http
  • 本地地址:8080
  • 域名类型:随机域名
  • 地区:选择China Top

image-20260921155258884

创建成功后,打开左侧在线隧道列表,可以看到刚刚通过创建隧道生成了公网地址,接下来就可以在其他电脑或者移动端设备(异地)上,使用地址访问。

image-20260921155309634

访问成功。

image-20260921155617231

8.保留固定公网地址

使用cpolar为其配置二级子域名(cpolar官网-安全的内网穿透工具 | 无需公网ip | 远程访问 | 搭建网站),该地址为固定地址,不会随机变化。

image-20250918151358733

点击左侧的预留,选择保留二级子域名,地区选择china Top,然后设置一个二级子域名名称,我使用的是Bonsai2,大家可以自定义。填写备注信息,点击保留。

image-20260921163723841

登录cpolar web UI管理界面,点击左侧仪表盘的隧道管理——隧道列表,找到所要配置的隧道,点击右侧的编辑。

image-20260921163753546

修改隧道信息,将保留成功的二级子域名配置到隧道中

  • 域名类型:选择二级子域名
  • Sub Domain:填写保留成功的二级子域名
  • 地区: China Top

点击更新

image-20260921163823038

更新完成后,打开在线隧道列表,此时可以看到随机的公网地址已经发生变化,地址名称也变成了保留和固定的二级子域名名称。

image-20260921163835432

最后,我们使用固定的公网地址在任意设备的浏览器中访问,可以看到成功访问的页面,这样一个永久不会变化的二级子域名公网网址即设置好了。

image-20260921163852987

总结

本教程完整演示了在仅有8G显存的普通消费级显卡上,本地部署Bonsai2‑27B大模型的全流程。借助Bonsai2特殊的三值量化技术,270亿参数大模型不再局限于高端大容量显卡,普通游戏卡也能将模型部署在本地电脑,所有对话数据保存在本机,不上传云端,隐私安全可控。

从环境准备、CUDA驱动配置、克隆项目仓库、HuggingFace令牌配置,到一键脚本自动安装依赖、下载GGUF模型权重,再到启动WebUI对话界面,一步步解决小白常遇到的PowerShell权限、模型下载失败、CUDA识别异常等问题。同时针对8G显存硬件短板,给出了显存优化方案:缩短上下文窗口、及时新建对话释放 KV 缓存、关闭后台占用显存程序,缓解模型推理卡顿、加载卡死的现象。

教程额外拓展了cpolar 内网穿透方案。本地WebUI默认只能本机访问,搭配cpolar无需公网IP、不用修改路由器端口映射,一条命令即可生成加密公网链接,手机、其他电脑在外网也能远程访问你本地跑起来的Bonsai2‑27B私有大模型,方便远程体验、演示分享。

感谢您对本篇文章的喜爱,有任何问题欢迎留言交流。cpolar官网-安全的内网穿透工具 | 无需公网ip | 远程访问 | 搭建网站

Share:

发表回复

目录

On Key

推荐文章