Qwen3.8-27B DFlash2 GGUF: прискорювач без втрати якості
Qwen3.8-27B (DFlash2 GGUF)
Прискорювач для Qwen3.8-27B
Дифузійний драфтер для спекулятивного декодування. Він працює в парі з цільовою Qwen3.8-27B, пришвидшуючи генерацію без втрати якості
Про базову qwen3.8-27b можете почитати в пості, на бенчах вона впевнено перевершує Qwen3.6-27B, Qwen3.7-Plus і Muse Glimmer-30B, а в багатьох категоріях обходить Opus4.6 Max
Системні вимоги
Якщо у вас 24 ГБ VRAM, беріть драфтер Q4_K_M і цільову модель у Q4_K_M або IQ4_XS (це оптимально)
Якщо 16 ГБ, спробуйте драфтер Q4_K_M + цільову Q3_K_M (контекст до 16k)
Якщо 48 ГБ і більше, беріть драфтер Q8_0 і цільову Q8_0
BF16 — це вже для 128 ГБ+
️DFlash2 потребує близько 2–3 ГБ понад ваги драфтера (hidden-state taps і verification buffers). На 16 ГБ GPU може бути тісно. Версія драфтера Q2_K (~700 МБ) економить ~400 МБ і дає +20k контексту без втрати якості