一、基于modelscope下载大模型
安装modelscope:
uv tool install modelscope
使用modelscope下载大模型:
modelscope download --model Qwen/Qwen2.5-Coder-7B-Instruct-GGUF --include "*q4_k_m*.gguf"
模型格式:GGUF(普通电脑万能格式)、MLX(苹果芯片专属)、AWQ/GPTQ(显卡专用压缩)、BF16(显卡满血原版)。
二、基于llama.cpp运行大模型
在Github Releases页面下载对应版本的llama.cpp,解压并配置环境变量。
使用llama.cpp运行大模型:
cd ~/.cache/modelscope/models/Qwen--Qwen2.5-Coder-7B-Instruct-GGUF/snapshots/master/
llama-server -m qwen2.5-coder-7b-instruct-q4_k_m.gguf -ngl 99
在浏览器或工具中使用本地大模型:http://127.0.0.1:8080/。
附录
基于ollama下载并运行本地大模型
ollama基于llama.cpp,但性能一般,建议直接使用llama.cpp。
ollama run qwen2.5-coder:7b
查看服务状态:
curl http://localhost:11434/api/tags