OpenAI가 GPT-5.6 Sol을 최대 14배 빠르게 돌리는 새 API 서비스 티어 Ultrafast를 프리뷰로 공개했다. Cerebras 하드웨어로 구동되며 출력 속도는 초당 최대 750토큰에 이른다. 같은 모델을 그대로 쓰되 지연만 크게 줄이는 옵션이다.
Ultrafast는 GPT-5.6 Sol 전용으로, 모델 자체는 동일하게 유지하면서 추론 속도만 끌어올리는 새 API 서비스 티어다. 구동은 Cerebras의 웨이퍼 스케일 하드웨어가 맡으며, 출력 속도는 초당 최대 750토큰, 기존 대비 최대 14배로 제시됐다.
토큰 생성이 빠르면 다단계 에이전트 루프처럼 한 작업에서 모델을 여러 번 호출하는 구조의 총 소요 시간이 크게 줄어든다. 실시간 코드 보조나 스트리밍 응답에서도 체감 지연이 달라진다.
아직 프리뷰 단계이므로 가용 지역·가격·한도는 실제 적용 전에 확인해야 하지만, 속도가 병목인 워크로드라면 티어 전환만으로 개선 여지가 있는지 시험해 볼 가치가 있다.