Best AI News — Updated Every 3 Hours
Story Page
← All Stories
Home Community Story
Community

anybody got llama-swap working answering concurrent requests for a single model?

Via r/LocalLlama
Saturday, May 30, 2026 · 1:36PM
Summary

been trying this out for a bit, I have qwen 3.6 35b a3b running via this config: qwen-36-35b-a3b: aliases: - qwen-a3b cmd: | env __GLX_VENDOR_LIBRARY_NAME=nvidia __NV_PRIME_RENDER_OFFLOAD=1 DRI_PRIME=1 \ llama-server \ -m "${baseModelDir}/Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf" \ --mmproj "${baseModelDir}/

Continue reading the full article
Read at r/LocalLlama
www.reddit.com
Back to all stories