prismBETA
← 개발자 브리핑
2026-08-17 · 03 / 07

로컬 LLM, 런타임·양자화가 도구 호출까지 바꾼다

같은 가중치라도 GPU·추론 엔진·어텐션 백엔드·KV 캐시 정밀도에 따라 계산이 달라져, 약 10만 토큰 에이전트 문맥에서 Qwen3.6-27B의 후반 토큰 선택이 어긋남. KV 캐시를 INT8/INT4로 낮추면 실제 도구 호출에서 INT8은 오류 후 복구했지만 INT4는 복구에 실패했고, 가중치 양자화에서는 INT8 W8A16이 공식 FP8·NVFP4보다 BF16 기준에 가까웠으며 NVFP4는 88k 문맥의 약 절반 위치에서 최상위 토큰이 바뀜.

모델 가중치가 같아도 GPU 명령어·CUDA 커널, 어텐션 백엔드, 양자화 방식, KV 캐시 정밀도 등 전체 추론 스택에 따라 계산 결과가 달라질 수 있다. 작은 수치 차이는 처음엔 눈에 띄지 않다가 긴 생성 과정에서 다른 토큰을 고르게 만들고 출력 경로 전체를 바꾼다. 같은 환경·같은 백엔드를 반복하면 결과가 비트 단위까지 동일했으므로, 관찰된 차이는 무작위성이 아니라 실행 경로의 차이다.

약 10만 토큰의 실제 에이전트 문맥에서 FlashAttention 2·Flash Inference·Triton Attention을 비교하니 초기엔 거의 같다가 후반부에서 최상위 토큰 선택이 갈렸고, 차이는 문맥 길이에 비례하기보다 특정 내용 구간에 몰려 나타났다. KV 캐시만 낮춰도 실제 도구 호출 구간에서 BF16은 정상, INT8은 오류 후 복구, INT4는 복구 실패로 재현됐다. 가중치 양자화에서는 INT8 W8A16이 공식 FP8·NVFP4보다 BF16 기준에 가까웠고, NVFP4·AWQ W4A16은 도구 호출과 Cisco 명령 생성에서 오류를 냈다.

따라서 KL Divergence 수치나 몇 개의 짧은 프롬프트, temperature 0 테스트는 장시간 에이전트 작업의 품질을 대표하지 못한다. 로컬 모델의 체감 성능은 가중치뿐 아니라 GPU·엔진·커널·KV 캐시·양자화·샘플러 설정을 합친 결과이므로, 실제 용도에 맞는 긴 문맥·도구 호출·도메인 작업을 자기 환경에서 직접 평가하는 것이 핵심이다.

투표
양자화 모델, 검증하고 쓰세요?
이 글이 도움이 되셨나요?
매주 월요일 아침 갱신 · 요약은 AI가 생성하며 출처 원문을 확인하세요.