[23:03:12] ===== Qwen 3.8-Flash-Next UD-IQ1_M (74.5 GB) THINKING medium (card samplers) ===== [23:03:12] flashnext-iq1m-think-medium: 3 file(s), 74.5 GB on disk [23:03:12] launching: ~/private/jose-yt/tools/llama.cpp-qwen4exp/build/bin/llama-server -m ~/.cache/huggingface/hub/models--unsloth--Qwen3.8-Flash-Next-GGUF/snapshots/8bdc666649440e9bdc97e16f3f75782c98478ff5/UD-IQ1_M/Qwen3.8-Flash-Next-UD-IQ1_M-00001-of-00003.gguf --host 127.0.0.1 --port 8899 -np 1 -c 131072 -ngl 999 --jinja --no-webui --chat-template-kwargs {"enable_thinking": true, "reasoning_effort": "medium"} --flash-attn on [23:03:32] model loaded in 20.0s: Qwen3.8-Flash-Next-UD-IQ1_M-00001-of-00003.gguf [23:03:33] warmup ping ok in 1.2s [23:03:33] flashnext-iq1m-think-medium → 01-blockfall [23:07:24] done in 231.1s (24.087252923440026 tok/s gen) [23:07:24] flashnext-iq1m-think-medium → 03-eruption [23:12:45] done in 320.7s (23.407263508410267 tok/s gen) [23:12:45] flashnext-iq1m-think-medium → 04-the-ledger [23:20:29] done in 464.0s (22.41309819450105 tok/s gen) [23:20:29] flashnext-iq1m-think-medium → 05-blind-artist [23:28:54] done in 505.1s (22.65942577253103 tok/s gen) [23:28:54] server stopped; waiting 20s for memory to settle [23:29:14] ===== Qwen 3.8-Flash-Next UD-Q2_K_XL (78.9 GB) THINKING medium (card samplers) ===== [23:29:14] flashnext-q2kxl-think-medium: 3 file(s), 78.9 GB on disk [23:29:14] launching: ~/private/jose-yt/tools/llama.cpp-qwen4exp/build/bin/llama-server -m ~/.cache/huggingface/hub/models--unsloth--Qwen3.8-Flash-Next-GGUF/snapshots/178b998806b7b406c311a3e6174aa99cf6304eaf/UD-Q2_K_XL/Qwen3.8-Flash-Next-UD-Q2_K_XL-00001-of-00003.gguf --host 127.0.0.1 --port 8899 -np 1 -c 131072 -ngl 999 --jinja --no-webui --chat-template-kwargs {"enable_thinking": true, "reasoning_effort": "medium"} --flash-attn on [23:29:34] model loaded in 20.0s: Qwen3.8-Flash-Next-UD-Q2_K_XL-00001-of-00003.gguf [23:29:35] warmup ping ok in 1.2s [23:29:35] flashnext-q2kxl-think-medium → 01-blockfall [23:33:24] done in 228.1s (23.968571261845092 tok/s gen) [23:33:24] flashnext-q2kxl-think-medium → 03-eruption [23:39:30] done in 365.9s (23.192326700192236 tok/s gen) [23:39:30] flashnext-q2kxl-think-medium → 04-the-ledger [23:45:37] done in 367.4s (22.778524281114024 tok/s gen) [23:45:37] flashnext-q2kxl-think-medium → 05-blind-artist [23:50:04] done in 267.3s (23.660467463235737 tok/s gen) [23:50:05] server stopped; waiting 20s for memory to settle [23:50:25] ===== Qwen 3.8-27B BF16 (54.7 GB) THINKING medium (card samplers), optional slow leg ===== [23:50:25] qwen38-27b-bf16-think-medium: 2 file(s), 54.7 GB on disk [23:50:25] launching: unsloth run --model unsloth/Qwen3.8-27B-GGUF --gguf-variant BF16 --api-only -q --disable-tools -p 8899 --parallel 1 --max-seq-length 131072 --api-key-name one-shot-five --start-api-key-marker --chat-template-kwargs {"enable_thinking": true, "reasoning_effort": "medium"} [23:51:14] model loaded in 49.0s: unsloth/Qwen3.8-27B-GGUF (BF16) [23:51:17] warmup ping ok in 3.3s [23:51:17] qwen38-27b-bf16-think-medium → 01-blockfall [00:00:08] done in 531.1s (9.31 tok/s gen) [00:00:08] qwen38-27b-bf16-think-medium → 03-eruption [00:18:07] done in 1079.2s (7.77 tok/s gen) [00:18:07] qwen38-27b-bf16-think-medium → 04-the-ledger [00:28:55] done in 647.7s (9.32 tok/s gen) [00:28:55] qwen38-27b-bf16-think-medium → 05-blind-artist [00:39:12] done in 617.5s (8.41 tok/s gen) [00:40:12] server stopped; waiting 20s for memory to settle [00:40:32] ALL DONE in 1.62h. Summary: ~/private/jose-yt/content/benchmarks/runs/flash-next-034/summary.md