Qwen3.8 27B AWQ + SGLang + DFlash + 4090D 48G 长上下文多会话测试,Codex/DeepSeek Harness下体验良好!
抡锤者
0:00 / 0:00
Qwen3.8 27B AWQ + SGLang + DFlash + 4090D 48G 长上下文多会话测试,Codex/DeepSeek Harness下体验良好!
7 766 просмотров · 1 дн. назад
抡锤者
11,5 тыс. подписчиков
7 766 просмотров · 1 дн. назад
视频文稿和资料:https://lcz.me/topic/1444/
这期视频继续折腾本地 AI。前几天我测试了 SGLang + Qwen 3.8 27B FP8,并使用 HiCache 解决 KV Cache 不够的问题。这一次直接抄论坛网友的实测作业,在 RTX 4090 48G 上部署 Qwen 27B W4A16 AWQ 4bit 量化模型,并加入 DFlash 投机解码。
这个方案最大的优势是显著降低模型本身的显存占用,把更多显存留给 KV Cache,同时利用小型草稿模型提升解码速度。实际测试中,单卡 4090 48G 可以同时处理长上下文和多个 Agent 会话,响应速度也相当不错。
更有意思的是,我之前让 Codex 自己折腾 4bit 配置一直失败,但把论坛网友已经跑通的帖子直接交给 Codex 抄作业,很快就成功部署。这也是技术社区最大的价值:AI 可以帮我们执行,但真正经过硬件验证的模型、权重、参数和踩坑经验,依然需要有人亲自折腾并分享出来。
本期也会展示实际运行画面,并简单对比 Codex 与 DeepSeek Harness 的使用体验。