bj.choi - notes
RSS FeedAI 에이전트와 LLM 시스템을 만들고 운영하며 배운 것을 짧게 기록합니다.
Recent Posts
- Updated:
RunPod L40S에서 Qwen3-8B의 vLLM 캐시 최적화를 적용해보고 새 컨테이너 기동 시간을 166초에서 120초로 줄인 결과를 정리했습니다.
- Updated:
Prefill과 Decode의 병목을 구분하고, KV Cache·GQA·MLA가 추론 비용을 줄이는 원리를 서빙 관점에서 정리합니다.
- Updated:
Cybench, CyberGym, ExploitBench, ExploitGym이 각각 무엇을 평가하는지 단계별로 정리합니다.
- Updated:
Kubernetes에서 NVIDIA GPU가 컨테이너에 연결되는 과정과 GPU Operator, MIG Manager, Device Plugin의 역할을 정리하고 A100 MIG 스케줄링 시 주의할 점을 살펴봅니다.
- Updated:
Hugging Face Seoul Meetup과 Ilya Sutskever 27개 읽기 목록에 참고한 원문 자료입니다.
- Updated:
TMax를 통해 terminal-agent RL에서 task prompt, sandbox, verifier, GRPO/DPPO가 어떻게 연결되는지 정리합니다.