一、基于modelscope下载大模型

安装modelscope

uv tool install modelscope

使用modelscope下载大模型:

modelscope download --model Qwen/Qwen2.5-Coder-7B-Instruct-GGUF --include "*q4_k_m*.gguf" 

模型格式:GGUF(普通电脑万能格式)、MLX(苹果芯片专属)、AWQ/GPTQ(显卡专用压缩)、BF16(显卡满血原版)。

二、基于llama.cpp运行大模型

Github Releases页面下载对应版本的llama.cpp,解压并配置环境变量。

使用llama.cpp运行大模型:

cd ~/.cache/modelscope/models/Qwen--Qwen2.5-Coder-7B-Instruct-GGUF/snapshots/master/
llama-server -m qwen2.5-coder-7b-instruct-q4_k_m.gguf -ngl 99

在浏览器或工具中使用本地大模型:http://127.0.0.1:8080/

附录

基于ollama下载并运行本地大模型

ollama基于llama.cpp,但性能一般,建议直接使用llama.cpp

ollama run qwen2.5-coder:7b

查看服务状态:

curl http://localhost:11434/api/tags