IEEE Spectrum은 AI 추론에서 모델 가중치와 대화 기록을 반복 읽는 비용이 커지면서 메모리 대역폭과 배치 구조가 주요 경쟁축이 됐다고 설명했습니다. 입력을 한꺼번에 처리하는 prefill과 토큰을 순차 생성하는 decode는 병목이 달라 하나의 성능 수치로 비교하기 어렵습니다. AWS와 Cerebras의 협력 발표도 Trainium의 입력 처리와 별도 장치의 생성을 결합하는 방향을 보여줍니다. 다만 이런 설계와 통합 계획을 모든 서비스에서 검증된 비용 절감으로 받아들여서는 안 됩니다.