bj.choi - notes
RSS FeedAI 에이전트와 LLM 시스템을 만들고 운영하며 배운 것을 짧게 기록합니다.
Recent Posts
- Updated:
Prefill과 Decode의 병목을 구분하고, KV Cache·GQA·MLA가 추론 비용을 줄이는 원리를 서빙 관점에서 정리합니다.
- Updated:
Cybench, CyberGym, ExploitBench, ExploitGym이 각각 무엇을 평가하는지 단계별로 정리합니다.
- Updated:
Kubernetes에서 NVIDIA GPU가 컨테이너에 연결되는 과정과 GPU Operator, MIG Manager, Device Plugin의 역할을 정리하고 A100 MIG 스케줄링 시 주의할 점을 살펴봅니다.
- Updated:
Hugging Face Seoul Meetup과 Ilya Sutskever 27개 읽기 목록에 참고한 원문 자료입니다.
- Updated:
TMax를 통해 terminal-agent RL에서 task prompt, sandbox, verifier, GRPO/DPPO가 어떻게 연결되는지 정리합니다.
- Updated:
Mid-training은 Fine-tuning처럼 정답 응답을 맞추는 단계가 아니라, 터미널 모델에 필요한 능력 분포와 데이터 흐름을 다시 조정하는 continued training 단계다.