# 基于unsloth的DeepSeek-R1动态量化版本部署

> 作者/来源: UCloud 运营管理员
> 发布时间: 2025-02-08T02:20:00.000Z
> 分类: GPU
> 标签: AI, GPU
> 原文链接: http://117.50.162.249:3000/yun/articles/22

---

# 基于unsloth的DeepSeek-R1动态量化版本部署

> 来源: https://www.ucloud.cn/yun/131186.html
> 作者: UCloud小助手
> 发布日期: 发布于2025-02-08 10:20

DeepSeek-R1-671b动态量化版，由unsloth.ai发布，推荐使用多卡进行部署，具体操作如下。本镜像还附带32b的无限制版蒸馏模型，使用open-webui和ollama以及llama.cpp进行部署，内置所有环境，即拉即用。

### 第一步：登录「优云智算」算力共享平台并进入「镜像社区」，新用户免费体验10小时4090

地址：https://www.compshare.cn/?ytag=seo

![](https://ucloud-blog.cn-bj.ufileos.com/articles/131186/images/131186_000.png)

### 第二步：选择「vLLM-DeepSeek-R1-Distill」镜像，点击「使用该镜像创建实例」

镜像地址：优云智算 | Unsloth-DeepSeek-R1一键部署

![](https://ucloud-blog.cn-bj.ufileos.com/articles/131186/images/131186_001.png)

根据镜像说明中的引导，选择所用模型需要的GPU算力规格，并点击「立即部署」即可拥有一个自带模型的算力资源。（动态量化版本推荐使用4卡或8卡4090）

![](https://ucloud-blog.cn-bj.ufileos.com/articles/131186/images/131186_002.png)

### 第三步：启动服务，镜像已配置好所需依赖环境，无需额外安装，即可通过以下命令启动：

打开jupyterlab

![](https://ucloud-blog.cn-bj.ufileos.com/articles/131186/images/131186_003.png)

按照指引启动llama.cpp

![](https://ucloud-blog.cn-bj.ufileos.com/articles/131186/images/131186_004.png)

根据所开的机器卡数填写对应的显存大小

![](https://ucloud-blog.cn-bj.ufileos.com/articles/131186/images/131186_005.png)

按照指引将代码块修改并复制到终端中运行

![](https://ucloud-blog.cn-bj.ufileos.com/articles/131186/images/131186_006.png)

运行完成后，访问外网IP:10000即可开始使用

![](https://ucloud-blog.cn-bj.ufileos.com/articles/131186/images/131186_007.png)

使用llama.cpp加载模型以后，再启动open-webui，访问ip:8080是这样

![](https://ucloud-blog.cn-bj.ufileos.com/articles/131186/images/131186_008.png)

注意：

1、unsloth文档给了四个模型，镜像默认选择1.58的作为默认配置

2、部署1.58bit的如果需要全部加载到显存上，需要2x80GB的显卡，换算成24g的4090需要挺多张，但是相较于需要一大堆H100的671b的原本模型，所用配置已经相当低了，全部加载到内存上推理可能会比较慢，因此可以通过将部分layer卸载到显存上从而加快推理速度

3、单卡4090的话不是很推荐，显存内存加在一起都有点放不下，只有0.17token/s；双卡4090，layer为17或者16，大概1.5token/s到2tokens/s之间，再多的话没测过，虽然这速度也不是不能用，三卡应该就能正常用了，当然，选择更大显存的A100或者8卡4090，即可全部吃下，飞快使用

4、该镜像还搭载了Ollama，你不想使用R1模型的话也可以试试蒸馏模型，单卡4090妥妥够了，70b的那个中文效果还不如32g，镜像内自带的两个蒸馏模型分别是32b官方版和32b越狱般。启动ollama服务后，再启动open-webui，进入到open-webui即可使用

5、量化模型也可以在llama.cpp的serve上面推，open-webui并不是必须的