SETUP INFO: Amd R9700 AI PRO. Using llama-cpp server, ROCM docker version. Using the --ngl option to offload. First of all, I'm greatly impressed by how llama-cpp server handles offloading. There's some fucking magic happening here, at least to me. I have 32gb of VRAM so loading in the small models