[00:56:23] ===== GLM-5.3-Flash UD-IQ1_S (93.1 GB) reasoning LOW ===== [00:56:23] glm53flash-iq1s-low: 3 file(s), 93.1 GB on disk [00:56:23] launching: ~/private/jose-yt/tools/llama.cpp-glm5next/build/bin/llama-server -m ~/.cache/huggingface/hub/models--unsloth--GLM-5.3-Flash-GGUF/snapshots/ac47690c15c8703615ab7d9c1ef2293d45372757/UD-IQ1_S/GLM-5.3-Flash-UD-IQ1_S-00001-of-00003.gguf --host 127.0.0.1 --port 8899 -np 1 -c 65536 -ngl 999 --jinja --no-webui --chat-template-kwargs {"reasoning_effort": "low", "clear_thinking": true} -fa off [00:56:48] model loaded in 25.0s: GLM-5.3-Flash-UD-IQ1_S-00001-of-00003.gguf [00:56:49] warmup ping ok in 1.5s [00:56:49] glm53flash-iq1s-low → 01-blockfall [01:02:11] done in 321.8s (9.525393204843017 tok/s gen) [01:02:11] glm53flash-iq1s-low → 03-eruption [01:10:14] done in 483.2s (9.219867620828161 tok/s gen) [01:10:14] glm53flash-iq1s-low → 04-the-ledger [01:15:33] done in 318.9s (9.340915194586486 tok/s gen) [01:15:33] glm53flash-iq1s-low → 05-blind-artist [01:22:32] done in 419.3s (9.38865208181528 tok/s gen) [01:22:33] server stopped; waiting 20s for memory to settle [01:22:53] ALL DONE in 0.44h. Summary: ~/private/jose-yt/content/benchmarks/runs/glm-035/summary.md