[02:35:38] ===== Qwen 3.8-Flash-Next UD-Q3_K_XL (90.0 GB) THINKING medium (card samplers) ===== [02:35:38] flashnext-q3kxl-think-medium: 3 file(s), 90.0 GB on disk [02:35:38] launching: ~/private/jose-yt/tools/llama.cpp-qwen4exp/build/bin/llama-server -m ~/.cache/huggingface/hub/models--unsloth--Qwen3.8-Flash-Next-GGUF/snapshots/824f539b2710e5a9e47af4952cf6578cf5ee8932/UD-Q3_K_XL/Qwen3.8-Flash-Next-UD-Q3_K_XL-00001-of-00003.gguf --host 127.0.0.1 --port 8899 -np 1 -c 131072 -ngl 999 --jinja --no-webui --chat-template-kwargs {"enable_thinking": true, "reasoning_effort": "medium"} --flash-attn on [02:36:08] model loaded in 30.0s: Qwen3.8-Flash-Next-UD-Q3_K_XL-00001-of-00003.gguf [02:36:08] warmup ping ok in 0.7s [02:36:08] flashnext-q3kxl-think-medium → 01-blockfall [02:40:11] done in 242.2s (20.59598552721839 tok/s gen) [02:40:11] flashnext-q3kxl-think-medium → 03-eruption [02:49:32] done in 561.8s (19.52533298327345 tok/s gen) [02:49:32] flashnext-q3kxl-think-medium → 04-the-ledger [02:55:16] done in 343.7s (19.876852478508056 tok/s gen) [02:55:16] flashnext-q3kxl-think-medium → 05-blind-artist [03:03:29] done in 492.5s (19.757098832036995 tok/s gen) [03:03:29] server stopped; waiting 20s for memory to settle [03:03:49] ===== Qwen 3.8-Flash-Next UD-IQ4_XS (93.7 GB) THINKING medium (card samplers) ===== [03:03:49] flashnext-iq4xs-think-medium: 3 file(s), 93.7 GB on disk [03:03:49] launching: ~/private/jose-yt/tools/llama.cpp-qwen4exp/build/bin/llama-server -m ~/.cache/huggingface/hub/models--unsloth--Qwen3.8-Flash-Next-GGUF/snapshots/824f539b2710e5a9e47af4952cf6578cf5ee8932/UD-IQ4_XS/Qwen3.8-Flash-Next-UD-IQ4_XS-00001-of-00003.gguf --host 127.0.0.1 --port 8899 -np 1 -c 131072 -ngl 999 --jinja --no-webui --chat-template-kwargs {"enable_thinking": true, "reasoning_effort": "medium"} --flash-attn on [03:04:14] model loaded in 25.0s: Qwen3.8-Flash-Next-UD-IQ4_XS-00001-of-00003.gguf [03:04:15] warmup ping ok in 0.7s [03:04:15] flashnext-iq4xs-think-medium → 01-blockfall [03:08:01] done in 226.8s (20.871679245026197 tok/s gen) [03:08:01] flashnext-iq4xs-think-medium → 03-eruption [03:14:03] done in 362.2s (20.225623841737146 tok/s gen) [03:14:03] flashnext-iq4xs-think-medium → 04-the-ledger [03:19:19] done in 315.9s (20.125258245508764 tok/s gen) [03:19:19] flashnext-iq4xs-think-medium → 05-blind-artist [03:24:07] done in 287.8s (20.472427844444777 tok/s gen) [03:24:08] server stopped; waiting 20s for memory to settle [03:24:28] ALL DONE in 0.81h. Summary: ~/private/jose-yt/content/benchmarks/runs/flash-next-034/summary.md