bj.choi - notes
RSS FeedAI 에이전트와 LLM 시스템을 만들고 운영하며 배운 것을 짧게 기록합니다.
Recent Posts
- Updated:
사이버 위협 행위자부터 악성코드의 정의·분류, 국가별 APT 사례, 분석 기법과 안전 원칙까지 학습 순서대로 정리합니다.
- Updated:
Hugging Face 모델 저장소에서 가중치 크기, KV cache, 컨텍스트 길이와 서빙 설정을 확인하는 방법을 Qwen3.8-Flash-Next 사례로 정리합니다.
- Updated:
RunPod L40S에서 Qwen3-8B의 vLLM 캐시 최적화를 적용해보고 새 컨테이너 기동 시간을 166초에서 120초로 줄인 결과를 정리했습니다.
- Updated:
Prefill과 Decode의 병목을 구분하고, KV Cache·GQA·MLA가 추론 비용을 줄이는 원리를 서빙 관점에서 정리합니다.
- Updated:
Cybench, CyberGym, ExploitBench, ExploitGym이 각각 무엇을 평가하는지 단계별로 정리합니다.
- Updated:
Kubernetes에서 NVIDIA GPU가 컨테이너에 연결되는 과정과 GPU Operator, MIG Manager, Device Plugin의 역할을 정리하고 A100 MIG 스케줄링 시 주의할 점을 살펴봅니다.