오픈소스 엔진 Strata가 Qwen3.8-Flash-Next(125B)를 일반 PC에서 돌린다. 토큰마다 전문가 24,576개 중 10개만 쓰는 MoE 구조를 활용해 자주 쓰는 전문가는 GPU에, 전체는 RAM에 두고 작업을 분산하며, 작은 보조 모델이 예측하고 큰 모델이 검증해 출력을 1.6~1.8배 빠르게 낸다. RTX 5070 12GB·RAM 64GB에서 Q2_0 기준 답변 생성 초당 94토큰, 입력 처리 초당 2,650토큰이 나온다. 최소 VRAM 12GB·RAM 32GB·디스크 약 80GB가 필요하고, OpenAI·Anthropic 호환 API로 Claude Code·Cursor·Codex를 로컬 모델에 붙일 수 있다. MIT 라이선스다.
거대 모델을 로컬에서 돌리려면 통째로 GPU에 올려야 한다는 통념과 달리, Strata는 MoE의 희소 활성화를 활용한다. Qwen3.8-Flash-Next는 토큰마다 24,576개 전문가 중 10개만 쓰므로, 자주 호출되는 전문가만 GPU에 상주시키고 나머지는 RAM에 두는 방식으로 12GB VRAM급 카드에서도 실행이 가능하다. 여기에 작은 보조 모델이 다음 토큰을 예측하고 큰 모델이 한꺼번에 검증하는 추측 디코딩으로 동일 출력을 1.6~1.8배 빠르게 만든다.
자체 측정에서 RTX 5070 12GB·Ryzen 5 7600·RAM 64GB 조합이 Q2_0 양자화에서 답변 94토큰/초, 입력 2,650토큰/초를 기록했고, 정밀도가 높은 IQ3_S는 53토큰/초였다. RAM 32GB용 Coder 모델은 전체 모델 SWE-bench Verified 점수의 91%를 유지한다고 하며, 한국어를 포함한 CJK나 코드 외 작업에는 전문가를 모두 유지한 모델을 권장한다.
핵심은 OpenAI Chat Completions·Responses와 Anthropic Messages 호환 API다. 기존 코딩 에이전트의 엔드포인트만 바꿔 로컬 모델에 연결할 수 있고 MCP 서버로 설치·시작·중지도 된다. 다만 설치 안내를 에이전트에 그대로 파이프해 실행하는 방식은 위험하다는 지적이 커뮤니티에서 나왔으니 스크립트는 확인하고 쓰는 편이 낫다.