vLLM
3 posts
- Updated:
Hugging Face 모델 저장소에서 가중치 크기, KV cache, 컨텍스트 길이와 서빙 설정을 확인하는 방법을 Qwen3.8-Flash-Next 사례로 정리합니다.
- Updated:
RunPod L40S에서 Qwen3-8B의 vLLM 캐시 최적화를 적용해보고 새 컨테이너 기동 시간을 166초에서 120초로 줄인 결과를 정리했습니다.
vLLM을 활용해 효율적인 LLM 서빙 환경을 구축하는 과정과 핵심 기술을 정리했습니다. 메모리 최적화 원리를 살피고 실제 배포 시 발생한 이슈 해결 사례를 통해 안정적인 운영 노하우를 공유합니다.