Ai2가 전문가 혼합 모델용 공개 훈련 프레임워크 Olmo-core 3를 내놨습니다. 전문가를 GPU에 상주시켜 가중치 재수집을 줄였으며, B300 8개에서 470억 파라미터 모델의 GPU당 처리량이 기존 방식보다 약 2.7배 높았다고 보고했습니다. 전문가를 8개에서 128개로 늘린 별도 실험에서는 활성 규모를 약 32억으로 유지하면서 처리량 감소를 5% 미만으로 제한했습니다. 1조2000억 파라미터 실험은 무작위 라우팅 기반 시스템 평가로 완성 모델의 정확도를 뜻하지 않습니다.