2.8T 파라미터 Kimi K3를 AMD MI355X에서 서빙한 벤치 결과가 공개됐다. 1024/400 토큰 벤치에서 노드당 952 tok/s, 단일 스트림 118 tok/s로 2노드 TP16 B200 대비 집계 처리량 3.8배·단일 스트림 1.3배를 기록했다. B300 노드가 집계 처리량은 약 1.65배 앞서지만 GPU당 2.4배 비싸(MI355X $2.50/GPU-hr, B300 $6.00) 달러당 성능은 MI355X가 우위이며, AMD가 Kimi K3에 day-0 지원을 붙인 것이 결정적이었다.
Kimi K3는 2.8T 파라미터로 가중치만 1.5TB가 넘어 1M 토큰 KV 캐시 전에 이미 B200 8-GPU 노드에 들어가지 않는다. 선택지는 288GB VRAM의 B300 노드나 B200 2노드(TP16)뿐인데, 여기에 같은 288GB를 가진 AMD MI355X가 대안으로 들어왔다.
1024토큰 입력/400토큰 출력 벤치에서 MI355X는 노드당 952 tok/s, 단일 스트림 118 tok/s를 냈다. 2노드 TP16 B200 배치(총 498 tok/s, 노드당 약 249)와 비교하면 집계 처리량 3.8배, 단일 스트림 디코드 1.3배다. B300 노드가 집계 처리량은 약 1.65배 높지만 가격이 2.4배라 달러당 성능에서 뒤진다(MI355X $2.50, B300 $6.00, B200 $4.25/GPU-hr). B200은 유일하게 2노드에 걸쳐 디코드 임계 경로에서 노드 간 all-reduce 비용을 치르는 점이 수치를 깎았다.
관건이던 AMD 소프트웨어 지원은 Kimi K3의 day-0 지원으로 상당 부분 해소됐다. 초대형 오픈 모델을 자체 서빙하려는 인프라 팀에게 GPU 선택의 실측 기준을 제공한다.