llama.cpp运行qwen0.5B

编译llama.cp

参考

下载模型

05b模型下载

转化模型

创建虚拟环境

conda create --prefix=D:\miniconda3\envs\llamacpp python=3.10
conda activate D:\miniconda3\envs\llamacpp

安装所需要的包

在这里插入图片描述

cd G:\Cpp\llama.cpp-master
pip install -r requirements.txt
python convert.py -h

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
执行转换命令

python convert.py G:\Python\Qwen1.5-0.5B-Chat --outfile G:\Cpp\qwenchat0.5b.gguf --outtype q8_0
python convert-hf-to-gguf.py G:\Python\Qwen1.5-0.5B-Chat  --outfile G:\Cpp\qwenchat0.5b.gguf
# 解释
# python 
# convert.py # convert.py路径
# /content/finetuned-2_merged # 模型路径
# --outfile finetuned-2.gguf # 要分配的gguf模型名称
# --outtype q8_0 #以8 Bit量化

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

将模型量化为5Bit(使用q5_k-m方法)

quantize.exe G:\Cpp\qwenchat0.5b.gguf qwenchat0.5b-q5_k_m.gguf q5_k_m

在这里插入图片描述
在这里插入图片描述
运行

# 注意Qwen模型要使用chatml prompt 模版
main.exe -m qwenchat0.5b-q5_k_m.gguf -n 512 --chatml

在这里插入图片描述

尝鲜通义千问1.8B
参考
hf2gguf

相关推荐

  1. Ubuntu20.04配置qwen0.5B记录

    2024-04-03 14:12:02       34 阅读
  2. vLLM部署Qwen1.5-32B-Chat

    2024-04-03 14:12:02       45 阅读

最近更新

  1. docker php8.1+nginx base 镜像 dockerfile 配置

    2024-04-03 14:12:02       94 阅读
  2. Could not load dynamic library ‘cudart64_100.dll‘

    2024-04-03 14:12:02       100 阅读
  3. 在Django里面运行非项目文件

    2024-04-03 14:12:02       82 阅读
  4. Python语言-面向对象

    2024-04-03 14:12:02       91 阅读

热门阅读

  1. python - 实现一个通用的插件类

    2024-04-03 14:12:02       37 阅读
  2. Matlab未装工具箱

    2024-04-03 14:12:02       46 阅读
  3. excel wps中编码格式转换

    2024-04-03 14:12:02       43 阅读
  4. Unity自定义框架开发

    2024-04-03 14:12:02       36 阅读
  5. 信创工程师招聘需求分析

    2024-04-03 14:12:02       42 阅读
  6. qgroundcontrol 遥控器校准-问题解决

    2024-04-03 14:12:02       28 阅读
  7. 了解黑客目的,防范黑客攻击

    2024-04-03 14:12:02       34 阅读
  8. rabbitmq调优--来自gpt

    2024-04-03 14:12:02       38 阅读
  9. 京西商城——创建订单和获取订单接口

    2024-04-03 14:12:02       37 阅读