prismBETA
← 개발자 브리핑
2026-07-27 · 06 / 07

DeepSeek V4 Flash에 DSpark 투기 디코딩 — 1.74배

TensorSharp가 DeepSeek-V4-Flash-0731에 드래프트 모델 기반 투기적 디코딩 DSpark를 지원한다. Nvidia A40 4장(CUDA 12.8) 벤치에서 짧은 생성(53토큰)이 25.6→44.5 tok/s로 1.74배 빨라졌고 수용률(acceptance)은 87%를 기록했다. Unsloth의 GGUF 본체와 DSpark 드래프트 모델이 Hugging Face에 공개돼 재현할 수 있다.

투기적 디코딩은 작은 드래프트 모델이 여러 토큰을 미리 제안하고 본 모델이 이를 한 번에 검증·수용하는 기법으로, 수용률이 높을수록 속도 이득이 커진다. DSpark는 이를 DeepSeek-V4-Flash-0731에 맞춰 구현한 것이다.

벤치는 A40 4장, CUDA 12.8 환경에서 진행됐다. 본체는 unsloth의 DeepSeek-V4-Flash-0731-UD-Q8_K_XL GGUF, 드래프트는 별도 공개된 DSpark-Drafter GGUF를 썼다. 짧은 생성(53토큰) 기준 처리량이 25.6에서 44.5 tok/s로 1.74배 올랐고 수용률은 87%였다. 본체·드래프트 모두 Hugging Face에 올라와 있어 동일 구성으로 재현이 가능하다.

셀프호스팅 환경에서 모델 교체나 양자화 없이 처리량을 높이려는 팀에게 실측 근거가 되는 사례다.

투표
로컬 추론 속도, 어떻게 올리세요?
이 글이 도움이 되셨나요?
이야기의 흐름6
매주 월요일 아침 갱신 · 요약은 AI가 생성하며 출처 원문을 확인하세요.