OLLAMA_NUM_PARALLEL=4 ollama serve # then: ollama pull qwen2.5:7b llama-server -m qwen2.5-7b-instruct-q4_k_m.gguf --port 8080 -np 4 vllm serve Qwen/Qwen2.5-7B-Instruct --port 8000 --max-num-seqs 4