知行手记首页

780M 核显跑Qwen 30b 模型29tokes/s

分类技术笔记
核显笔记本跑30B-A3B,正常对话还是比较流畅的。 agent 就别想了。M5 跑anget 都费劲。
780M 核显跑Qwen 30b 模型29tokes/s

跑本地模型用来测试或者本地对话,ollma 可以开箱即用。但是如果想让模型性能更好,还是得用 llama cpp

项目地址:https://github.com/ggml-org/llama.cpp/releases

我用的是笔记本

cpu: AMD 8845hs

核显:780M

内存:24G ddr5

llama cpp 放到了 D:\AI\ 路径下, 模型放到 D:\AI\models

打开记事本,粘贴以下内容,重命名为 30B.bat。 双击运行。

我的测试对话输出稳定在25tokens/s ,对话,测试是够用的。

@echo off

chcp 65001 >nul

cd /d D:\AI\llama-b10976-bin-win-vulkan-x64

llama-server.exe ^

 -m "D:\AI\models\Qwen3-Coder-30B-A3B-Instruct-UD-IQ2_M.gguf" ^

 -ngl 99 ^

 -c 64000 ^

 -t 14 ^

 -b 2048 ^

 -ub 1024 ^

 --cache-type-k q8_0 ^

 --cache-type-v q5_1 ^

 --host 0.0.0.0 ^

 --port 8080 ^

 --parallel 1 ^

 --flash-attn on

pause

参数

含义

备注

-ngl 99

尽可能把所有层放到 GPU(Vulkan)

Qwen3-Coder-30B-A3B 是 MoE,激活只有 3B,权重不大,但 KV Cache 很大;显存不够就降低 ngl

-c 64000

上下文窗口 64k token

配合 FlashAttn + KV 量化,才能稳定跑长上下文

-t 14

CPU 线程数

一般设为你的 CPU 物理核心数,不要超过物理核

-b 2048

批大小 batch

prefill 批处理

-ub 1024

解码批大小

生成阶段 batch

--cache-type-k q8_0

K 缓存量化为 q8_0

节省大量显存

--cache-type-v q5_1

V 缓存量化 q5_1

你选的组合,平衡显存 / 质量;推荐长上下文两者都 q8_0 更稳

--host 0.0.0.0

监听所有网卡

局域网其他设备可以访问 http://本机IP:8080

--port 8080

Web/API 端口

网页 UI + OpenAI 兼容接口 /v1/chat/completions

--parallel 1

最大并发请求槽位

一次只处理 1 个对话;多人同时用就改成 2/3

--flash-attn on

开启 Flash Attention

Vulkan 后端支持,大幅降低 KV 显存占用,长 prompt 预填充更快,必须开启才能稳定跑 64k 上下文CSDN博...

全文完

评论0

还没有评论,来抢沙发~

发表评论

请友善发言,谢谢配合

以文字记录成长,以良知安顿内心

© 2026 知行手记