邵奈一头像
关注
纯小白也能懂:Mac 本地跑 Qwen3.8-27B封面图

纯小白也能懂:Mac 本地跑 Qwen3.8-27B

大家好,我是邵奈一,一个不务正业的程序猿、正儿八经的斜杠青年。
1、世人称我为:被代码耽误的诗人、没天赋的书法家、五音不全的歌手、专业跑龙套演员、不合格的运动员…
2、这几年,我整理了很多IT技术相关的教程给大家,爱生活、爱分享。
3、如果您觉得文章有用,请收藏,转发,评论,并关注我,谢谢!
博客导航跳转(请收藏):邵奈一的技术博客导航
| 公众号 | 微信 | CSDN | 掘金 | 51CTO | 简书 | 微博 |


0x00 教程内容

这是一篇写给第一次本地跑大模型朋友的手把手教程。读完后你会搞清楚:

  • 什么是“本地部署”、什么是“4bit 量化”,用大白话讲明白。
  • 为什么 Unsloth 团队出的 4bit 版只要 17GB,你的 Mac 完全带得动。
  • 从装软件到下载模型、开口对话,每一步都拆开讲。

目录:

  1. 0x01 先搞懂几个名词(小白必看)
  2. 0x02 你的电脑能不能跑(代入我的 M1 Max 64GB)
  3. 0x03 安装 Ollama
  4. 0x04 下载 Unsloth 的 4bit 模型(核心步骤)
  5. 0x05 跑起来对话
  6. 0x06 进阶玩法(API / Open WebUI)
  7. 0xFF 总结

0x01 先搞懂几个名词

1. 什么是“本地部署”

(1)平时用 ChatGPT,是你把问题发到别人的服务器上算;本地部署是把模型文件下载到你自己的电脑上跑,断网也能用、数据不出本机。

(2)好处就三个字:免费、隐私、随意调。

2. 什么是 4bit 量化

(1)模型原始很“重”。满血版 Qwen3.8-27B 要 54.7GB,普通电脑根本装不下。量化就是把模型里数字的精度压低,体积变小、跑得更快,代价是极其轻微的质量损失。

(2)4bit 是消费级电脑的甜点档:Unsloth 团队这版 4bit 只要 17GB,质量还很能打——这就是本文的主角。

3. 什么是 GGUF / Ollama / Unsloth

(1)GGUF:一种模型文件的打包格式,Mac / Windows / Linux 都能直接加载。

(2)Ollama:一个本地跑模型的“启动器”。装好它,一行命令就能拉模型、开对话,不用自己配环境。

(3)Unsloth:做量化很出名的团队。他们把 Qwen3.8-27B 压成了各种 GGUF 档位,我们这篇直接白嫖它的 4bit 版。

0x02 你的电脑能不能跑

1. 我的机器实况

(1)本文示范机:MacBook Pro / Apple M1 Max / 64GB 统一内存 / macOS 15.5(这就是我正在用的电脑)。

(2)关键点:Apple Silicon 的“统一内存”是 CPU 和 GPU 共用一块内存,模型权重吃的就是这块。64GB 对 17GB 的模型来说非常宽裕。

图1 我的电脑配置

图1:本机硬件实况(system_profiler 真实输出)

2. 一个 Apple 芯片的坑

(1)M 系列芯片的 Metal 后端(叫 MPS)不支持 FP8 这种格式。所以别去下 FP8 版,认准 GGUF——而 Ollama 默认就是 GGUF,正好绕开这个坑。

0x03 安装 Ollama

1. 下载安装

(1)打开 ollama.com,下载 macOS 版,把应用拖进“应用程序”,启动后菜单栏出现一只小羊驼图标,就算装好了。

2. 验证一下

(1)打开“终端” app,输入 ollama --version,本机显示 0.32.9;再输入 ollama list,能看到本机已经装着的模型,说明 Ollama 运行正常。

图2 Ollama 安装验证

图2:Ollama 版本与已装模型(真实输出)

0x04 下载 Unsloth 的 4bit 模型(核心步骤)

1. 为什么走 Unsloth,而不是 Ollama 官方

(1)截至发稿(2026-08-15),Ollama 官方的 qwen3.8:27b 还没上线,直接 ollama pull 会报 file does not exist(见下图)。

(2)但 Unsloth 团队在权重发布当天就放出了 4bit GGUF——也就是说,现在就能跑,不必等。这就是本教程的主线。

图3 官方 tag 当前报错

图3:当前直接 pull 官方 tag 的真实报错

2. 选哪个量化档

(1)4bit 里 Q4_K_M 约 17.1GB 是推荐档,体积和质量的平衡最好。各档对比见下表与图:

图4 量化档对比

图4:Qwen3.8-27B 各量化档对比(数据来自 Unsloth 官方 GGUF 仓库)

(2)内存适配:64GB 跑 17GB 只占约 27%,剩 ~47GB 给系统,稳得很。

图5 内存适配

图5:64GB 统一内存下的模型体积适配

3. 把模型文件下载下来

(1)国内用户看这里(重点)huggingface.co 直连在大陆经常返回 502 / 打不开,别跟它死磕。用 HF 镜像 hf-mirror.com,一条命令搞定,文件跟官方源一模一样:

curl -L -O https://hf-mirror.com/unsloth/Qwen3.8-27B-GGUF/resolve/main/Qwen3.8-27B-Q4_K_M.gguf

(2)备选镜像:ModelScope(魔搭),国内可达。实测它的 CN CDN 比 hf-mirror 快很多(常快几十倍),而且自带断点续传,下得慢或断了就换它:

pip install -U modelscope
modelscope download --model unsloth/Qwen3.8-27B-GGUF Qwen3.8-27B-Q4_K_M.gguf

(不想装 modelscope 也行,用上面的命令行手动拼 ModelScope 的直链也能下,只是要自己处理续传。)

(3)海外 / 能直连 HuggingFace 的环境,用官方源也行(二选一):

  • 方式 A(需先 pip install -U huggingface-hub):

    huggingface-cli download unsloth/Qwen3.8-27B-GGUF Qwen3.8-27B-Q4_K_M.gguf --local-dir .
    
  • 方式 B:

    curl -L -O https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/resolve/main/Qwen3.8-27B-Q4_K_M.gguf
    

(4)文件约 17GB,网速正常几分钟到十几分钟下完。下的时候终端会显示进度,耐心等它到 100%。下完务必用 ls -lh Qwen3.8-27B-Q4_K_M.gguf 确认大小约 17.1GB——别下到一半就以为好了。

4. 注册进 Ollama

(1)先写个 Modelfile,告诉 Ollama“模型文件在哪”(Unsloth 的 GGUF 已内嵌对话模板,一行就够):

printf 'FROM ./Qwen3.8-27B-Q4_K_M.gguf\n' > Modelfile

(2)再注册:

ollama create qwen3.8:27b -f Modelfile

看到 success 就成功了。

图6 GGUF 下载注册运行

图6:GGUF 路线全命令(下载 → 写 Modelfile → 注册 → 运行)

0x05 跑起来对话

1. 第一次对话

(1)终端输入 ollama run qwen3.8:27b首次加载约 30–60 秒(M1 Max 上 27B 的 4bit 要搬进内存),之后直接打字问它就行。

(2)退出:按 Ctrl+D,或输入 /bye

2. 可以试试这些问题

(1)“用一句话介绍你自己”“帮我写一段 Python 快速排序”“用通俗的话解释量子纠缠”。27B 这个级别答得相当像样,写代码、写文案都够用。

0x06 进阶玩法

1. 当 API 用

(1)Ollama 自带 OpenAI 兼容接口(默认地址 http://127.0.0.1:11434),可以接到 Cherry Studio 之类的客户端,也能用 curl 直接调:

curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen3.8:27b","messages":[{"role":"user","content":"你好"}]}'
2. 想要好看的网页界面?上 Open WebUI

(1)嫌终端丑,用 docker 一条命令起 Open WebUI:

docker run -d -p 3000:8080 \
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
  -v open-webui:/app/backend/data \
  --name open-webui ghcr.io/open-webui/open-webui:main

(2)浏览器打开 http://localhost:3000 就能网页聊天,还能管多轮会话、建知识库。

图7 部署流程

图7:本地部署 Qwen3.8-27B 流程图

0xFF 总结

  1. 本地部署 = 把模型装自己电脑上跑,免费、隐私、断网可用。
  2. 4bit 量化把 27B 模型压到 17GB,Unsloth 这版质量很能打,你的 64GB Mac 轻松带得动。
  3. Apple M 系列芯片不支持 FP8,认准 GGUF 格式就对了。
  4. Ollama 官方 tag 还没上线时,用 Unsloth 的 GGUF:下载 → ollama create → ollama run 三步就能聊。
  5. 自带 OpenAI 接口,可接任意客户端;想要网页界面就上 Open WebUI。

邵奈一 原创不易,如转载请标明出处,教育是一生的事业。


转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/shaock2018/article/details/163780604

文章来源转载

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--