Agent
3 posts
- Updated:
TMax를 통해 terminal-agent RL에서 task prompt, sandbox, verifier, GRPO/DPPO가 어떻게 연결되는지 정리합니다.
- Updated:
Mid-training은 Fine-tuning처럼 정답 응답을 맞추는 단계가 아니라, 터미널 모델에 필요한 능력 분포와 데이터 흐름을 다시 조정하는 continued training 단계다.
- Updated:
MCP는 Anthropic에 의해 오픈소스로 공개된 Model Context Protocol입니다. 여러 플랫폼들과 통합 및 다양한 데이터 소스와 도구에 연결하는 표준화된 방법을 제공하고 있으며 이를 활용하여 사용하는 AI 서비스와 통합하는 방법을 알아봅니다.