Huawei가 AI 추론의 KV 캐시를 공유 저장소에 담는 OceanStor M900을 공개했습니다. 회사는 최대 64PB 캐시와 40TB/s 대역폭, 60마이크로초 수준의 지연을 제시하며 가속기의 메모리 한계를 보완한다고 설명합니다. 캐시를 여러 연산 자원에서 활용해 토큰 처리량을 늘리고 첫 응답 시간을 줄이려는 설계입니다. 두 배 처리량이나 절반의 첫 토큰 지연은 특정 구성에 관한 회사 주장으로, 모델 크기와 캐시 적중률 및 네트워크 조건에 따른 검증이 필요합니다.