MIT 라이선스의 Agent Lightning 1.0은 학습 엔진이 도구 실행 루프를 다시 구현하지 않고 실제 프로덕션 하네스의 질문과 답변 기록만 관찰해 강화학습하도록 분리합니다. Microsoft는 약 3500줄의 Python 코어와 재현 가능한 학습 스크립트로 Qwen 3.5 9B를 6000개 데이터에 학습해 SWE-bench Verified를 41.8%에서 56.4%로 높였다고 밝혔습니다. 학습과 배포 환경의 차이를 줄이는 장점이 있지만 보상 설계, GPU 인프라와 하네스 버전 관리가 필요합니다.

한줄 결론: 에이전트의 실제 도구와 복구 동작을 유지한 채 모델을 훈련하는 실무형 오픈소스 경로가 열렸습니다.