GLM-5.2 UD-Q4_K_XL GGUF @ 12.2 tok/s output // 30.9 tok/s input on a real 10.7k-token document using llama.cpp RPC - At 10.7k context: 10.2 tok/s output with coherent long-form generation Two parallel requests: 14.5 tok/s aggregate Context: 2x 16,384-token slots Model size: 436 GiB Hardware: 16x AMD