Ai2가 전문가 혼합 모델용 공개 훈련 프레임워크 Olmo-core 3를 내놨습니다. 전문가를 GPU에 상주시켜 가중치 재수집을 줄였으며, B300 8개에서 470억 파라미터 모델의 GPU당 처리량이 기존 방식보다 약 2.7배 높았다고 보고했습니다. 전문가를 8개에서 128개로 늘린 별도 실험에서는 활성 규모를 약 32억으로 유지하면서 처리량 감소를 5% 미만으로 제한했습니다. 1조2000억 파라미터 실험은 무작위 라우팅 기반 시스템 평가로 완성 모델의 정확도를 뜻하지 않습니다.
Tech로 돌아가기
Tech
Ai2, 대규모 MoE 훈련 기반 Olmo-core 3 공개
활성 파라미터를 유지하며 전문가 수를 늘리는 구조지만 시스템 처리량 실험과 학습 모델의 품질은 구분해야 합니다.