Modo router de Llama-Server: conmutación dinámica de modelos sin reinicios
Sirva e intercambie LLMs sin reinicios.
Durante mucho tiempo, llama.cpp tuvo una limitación flagrante:
solo se podía servir un modelo por proceso, y cambiar de modelo implicaba un reinicio.