SpaceXAI가 코딩·에이전틱 태스크에 초점을 둔 Grok 4.5를 출시했다. Cursor와 함께 훈련됐고, Datacurve의 DeepSWE(pass@1)에서 62.0%로 Opus 4.8 max(55.75%)를 앞섰으나 Fable max(66.1%)·GPT-5.5 xhigh(64.31%)에는 못 미쳤다. 수만 개 NVIDIA GB300 GPU로 훈련했고 멀티스텝 소프트웨어 엔지니어링 중심의 RL을 대규모로 돌렸다.
SpaceXAI는 Grok 4.5를 코딩·과학·공학·수학 지식을 아우르는 데이터로 훈련했고, 지능적이면서 효율적인 추론으로 실제 엔지니어링 태스크에서 동급 선도 모델을 앞선다고 주장한다. Cursor와 함께 훈련됐다는 대목이 눈에 띈다.
공개된 DeepSWE(pass@1, Datacurve 제작, AA가 각 프로바이더 하네스로 실행) 결과에서 Grok 4.5는 62.0%로, Opus 4.8 max(55.75%)와 Opus 4.7 max(40.12%)를 앞섰으나 Fable max(66.1%)와 GPT-5.5 xhigh(64.31%)에는 뒤졌다. 경쟁사 수치는 각 개발사의 시스템 카드·리더보드에서 가져왔다.
수만 개 NVIDIA GB300 GPU로 훈련하며 데이터 중복 제거·품질 스코어링·도메인 선별에 투자했고, 수십만 개 태스크에 걸친 RL을 비동기로 대규모 실행했다고 밝혔다. 프롬프트 하나로 three.js 태양계 시뮬레이션 같은 앱을 만드는 예시를 제시했다.