davinci21s

可能很快就能实现 token 自由了

  •  
  •   davinci21s · 5 days ago · 4368 views

    qwen3.8 开源,性能比肩 opus4.6 ,之后出现几百个版本。

    目前量化版本从 1bit 到 16bit ,最低 8G 内存 mac 即可运行

    想要获得不错的体验建议 3080 以上显卡

    传送门: https://huggingface.co/unsloth/Qwen3.8-27B-GGUF

    🎉 16G 丐版 M1 部署 Qwen 3.8-27B 实测报告:

    不出意外,打字机效果,不过智商还可以😄

    📊 实测配置与数据

    设备:MacBook Pro ( M1 / 16GB ) 模型:Qwen3.8-27B ( UD-Q2_K_XL ,9.15GB ) GPU:全层 Metal 卸载 内存:稳定在 11 GB 左右 首 Token 延迟:约 850ms 预填充速度:10 ~ 12.5 tok/s 生成速度:约 4 tok/s

    几点调优心得👇🏻

    1. M1 的瓶颈主要是内存带宽 M1 内存带宽仅 68 GB/s ,每生成一个 Token 必须将 9.15G 权重通读一遍。4 tok/s 已经榨干了 M1 物理带宽的 60% 极限!

    2. 按场景切换思考模式 Qwen3.8 原生自带深度思考链。日常对话通过调参关闭思考,跳过思考链直出答案,体验极其干脆;写复杂算法时开启思考,逻辑推导依然在线。

    3. 用投机采样继续提速

    叠加 --flash-attn on + -ctk q8_0 + --spec-type ngram-simple 投机采样,写代码与结构化文本时,速度能飙到 5.5+ tok/s

    结论:老 M1 还能再战三年!✌🏻

    20 replies    2026-08-22 00:13:49 +08:00
    wjxd
        1
    wjxd  
       5 days ago
    准备拿 win10 系统,amd 7900xt 20G ,跑 Qwen3.8-27B-UD-Q4_K_M.gguf
    siriusliangcn
        2
    siriusliangcn  
       5 days ago
    我看 command code 套餐里上架了 qwen3.8:27b 模型,输入价格 0.4 刀,跟 DeepSeek-v4-flash 的波峰 0.44 波谷 0.22 不相上下。这种 27b 的模型真的能硬撼云端大模型了吗?
    没开源的时候,我就在想这个事情,但是看论坛里大家吹得那么牛,还是不太敢相信。
    davinci21s
        3
    davinci21s  
    OP
       5 days ago
    @siriusliangcn 有人和 sol 、fable5 、opus5 ,做过对比,基本吻合
    siriusliangcn
        4
    siriusliangcn  
       5 days ago   ❤️ 1
    也就是说,真的有人愿意用 0.4 的价格使用 qwen3.8-27b ,也不用 0.44 的价格使用 ds4flash ?卧槽…ds 真的拉完了啊…
    levn
        5
    levn  
       5 days ago
    实现写 bug 自由还差不多
    minami
        6
    minami  
       5 days ago   ❤️ 1
    5.5+ tok/s 叫 token 自由,意义不亚于限速 10 kb/s 的百度网盘
    foryou2023
        7
    foryou2023  
       5 days ago
    ds4 flash 要达到日常能用的标准,需要投入多少硬件成本呢
    ntdll
        8
    ntdll  
       5 days ago
    在 transform 架构没有改变的情况下,基本还是遵守一寸长一寸强的基本逻辑。

    参数量小,意味着其只有更为泛化的知识,因此非常依赖上下文给足背景信息,但是你在自己设备上跑,通常配置都很一般,导致上下文也很小。结果就是,LLM 大概率是输出正确的废话。也就是车轱辘话。
    HK560
        9
    HK560  
       5 days ago
    5090dv2 已跑,但确实打字机速度还是挺难受的。
    davinci21s
        10
    davinci21s  
    OP
       5 days ago
    @HK560 应该不至于啊,是不是版本不对,目前已经出现很多优化版本。试一下上面最新的。
    HK560
        11
    HK560  
       5 days ago
    @davinci21s #10 跑的这个 https://huggingface.co/JonathanColetti/Qwen3.8-27B-Uncensored-GGUF
    没怎么研究过,就和我平时打字速度差不多快一点点
    fe619742721
        12
    fe619742721  
       5 days ago
    32g m5 air 能跑出多少速度呢,感觉 15-20tokens/s 是不是就可以接受了
    davinci21s
        13
    davinci21s  
    OP
       5 days ago
    @fe619742721 应该是大于这个速度的
    skull
        14
    skull  
       5 days ago via iPhone
    用 deepseek flash 200 tok/s 比这个 5.5 免费好太多了吧,非特殊场景基本不考虑
    Jacobson
        15
    Jacobson  
       5 days ago via iPhone
    @wjxd 双 5060ti 16g 跑这个只有 23 的速度😂
    cat9life
        16
    cat9life  
       4 days ago
    @Jacobson #15 使用哪个量化版本?我单块 16G 也想挑战一下呢
    Jacobson
        17
    Jacobson  
       4 days ago via iPhone
    @cat9life 1 楼说的那个同款模型
    asdhak
        18
    asdhak  
       4 days ago
    5070ti 16g 。8k 上下文,嗖嗖的。开 13k 上下文,就 5s/token 了
    asdhak
        19
    asdhak  
       4 days ago
    @asdhak #18 用的 Q4
    ktblack
        20
    ktblack  
       4 days ago via Android
    tesla at10 16G ,用的 Q2-K 量化的,mtp2 ,上下文 11000 ,速度有 20+tok/s ,而且回答质量意料之外的好。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   990 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 42ms · UTC 22:12 · PVG 06:12 · LAX 15:12 · JFK 18:12
    ♥ Do have faith in what you're doing.