CLI와 서버를 사용한 llama.cpp 빠른 시작
OpenCode 설치, 설정 및 사용 방법
지역 추론(local inference)을 위해 llama.cpp에 계속 돌아오고 있습니다. Ollama 등 다른 도구들이 추상화해 버리는 부분까지 직접 제어할 수 있고, 실제로도 잘 작동하기 때문입니다. llama-cli로 GGUF 모델을 인터랙티브하게 실행하거나, llama-server로 OpenAI 호환 HTTP API를 노출하는 것이 매우 쉽습니다.