Fireworks Research가 Kimi K3를 기반으로 추가 학습한 코딩 모델 Ember-1을 공개했다. 품질은 유지하면서 오류 교정용 재검토는 남기고 불필요한 추론을 줄이도록 학습해, 7개 벤치마크와 고객 프로덕션 트래픽에서 토큰을 35~50% 절감했다. Terminal Bench 2.1에서 82.0%(K3-max 80.9%)에 비용 51.9% 절감, SWE-bench Verified에서 92.2%로 비용 15.5%를 줄였다.
Kimi K3 같은 추론 모델은 생성 토큰의 대부분, 때로 90% 이상을 내부 추론에 쓴다. 문제는 여러 턴으로 이어지는 에이전트 작업에서 이전 추론이 매 호출마다 다시 입력돼 누적 비용이 급증한다는 점이다. 추론 강도만 낮추는 설정으로는 품질 손실이 너무 커서, Fireworks는 오류를 바로잡는 자기 성찰은 보존하고 불필요한 추론·비생산적 반복만 줄이도록 모델을 학습시켰다.
검증은 벤치마크와 실제 트래픽 양쪽에서 이뤄졌다. Terminal Bench 2.1은 82.0%로 K3-max(80.9%)와 비슷하되 비용 51.9%, SWE-bench Verified는 92.2%(K3-max 93.2%)에 비용 15.5%를 절감했다. 고객 2곳의 A/B 테스트에서 작업당 약 35% 토큰을 줄였고 한 곳은 이미 프로덕션에 도입했으며, 내부 개발자들도 모델 교체를 알아차리지 못했다.
Ember-1은 Fireworks 서버리스 API에서 연구 프리뷰로 제공되며 초기 2주 이후 상시 제공 여부는 수요로 결정한다. 기업 데이터로 맞춤 학습하는 기능도 지원한다. 비용 비교는 K3 공개 API 가격(100만 토큰당 비캐시 입력 3달러, 출력 15달러)을 기준으로 했다.