Modo Roteador do Llama-Server - Comutação Dinâmica de Modelos Sem Reinicializações
Sirva e troque LLMs sem reinicializações.
Por muito tempo, o llama.cpp teve uma limitação flagrante:
você só podia servir um modelo por processo, e alternar significava reiniciar.