I fit Muse Glimmer 30B, vision, DFlash and a real 256K context onto one 24 GB GPU.Regular code: 17.98 tok/sDFlash code: ...

I fit Muse Glimmer 30B, vision, DFlash and a real 256K context onto one 24 GB GPU.Regular code: 17.98 tok/sDFlash code: 84.64 tok/sMixed agent work: 38.34 tok/sFull 262K KV: 21.56 tok/sThe fastest quant lost. So did the lowest-perplexity one.With speculative decoding, tok/s is partly a predictability benchmark.#LocalLLM #llamacpp #AIhttps://piszczek.pl/blog/dflash-changes-what-tokens-per-second-means

Read Original

Related