Benchmarks de LLM com 16 GB de VRAM usando llama.cpp (velocidade e contexto)
Velocidade de processamento de tokens do llama.cpp em 16 GB de VRAM (tabelas).
Aqui estou eu comparando a velocidade de vários LLMs executados em GPU com 16GB de VRAM, e escolhendo o melhor para auto-hospedagem.