prismBETA
← 개발자 브리핑
2026-07-27 · 05 / 07

Kimi K3 서빙, MI355X가 달러당 성능서 B300 앞선다

2.8T 파라미터 Kimi K3를 AMD MI355X에서 서빙한 벤치 결과가 공개됐다. 1024/400 토큰 벤치에서 노드당 952 tok/s, 단일 스트림 118 tok/s로 2노드 TP16 B200 대비 집계 처리량 3.8배·단일 스트림 1.3배를 기록했다. B300 노드가 집계 처리량은 약 1.65배 앞서지만 GPU당 2.4배 비싸(MI355X $2.50/GPU-hr, B300 $6.00) 달러당 성능은 MI355X가 우위이며, AMD가 Kimi K3에 day-0 지원을 붙인 것이 결정적이었다.

Kimi K3는 2.8T 파라미터로 가중치만 1.5TB가 넘어 1M 토큰 KV 캐시 전에 이미 B200 8-GPU 노드에 들어가지 않는다. 선택지는 288GB VRAM의 B300 노드나 B200 2노드(TP16)뿐인데, 여기에 같은 288GB를 가진 AMD MI355X가 대안으로 들어왔다.

1024토큰 입력/400토큰 출력 벤치에서 MI355X는 노드당 952 tok/s, 단일 스트림 118 tok/s를 냈다. 2노드 TP16 B200 배치(총 498 tok/s, 노드당 약 249)와 비교하면 집계 처리량 3.8배, 단일 스트림 디코드 1.3배다. B300 노드가 집계 처리량은 약 1.65배 높지만 가격이 2.4배라 달러당 성능에서 뒤진다(MI355X $2.50, B300 $6.00, B200 $4.25/GPU-hr). B200은 유일하게 2노드에 걸쳐 디코드 임계 경로에서 노드 간 all-reduce 비용을 치르는 점이 수치를 깎았다.

관건이던 AMD 소프트웨어 지원은 Kimi K3의 day-0 지원으로 상당 부분 해소됐다. 초대형 오픈 모델을 자체 서빙하려는 인프라 팀에게 GPU 선택의 실측 기준을 제공한다.

투표
오픈 모델, 어디서 돌리세요?
이 글이 도움이 되셨나요?
이야기의 흐름6
매주 월요일 아침 갱신 · 요약은 AI가 생성하며 출처 원문을 확인하세요.