추가 학습 없이 GLM-5.3-Flash를 분류·라우팅·판별용 결정 모델로 쓰는 기법이 공개됐다. JSON 전체나 긴 답변을 생성하는 대신 선택지 번호에 해당하는 다음 토큰 확률만 읽어 한 번의 순전파로 판단과 선택지별 확률을 얻는다. 공개 텍스트 데이터셋 28개에서 전용 학습된 Jev와 비슷한 정확도(10개 우세, 8개는 1%p 이내)를 냈고, 판단 100만 건 비용은 GLM 약 62유로 대 Jev 약 16유로였다.
고객 문의를 어느 팀에 보낼지, 계약 조항이 책임 항목에 속하는지 같은 질문은 사전 정의된 선택지와 정해진 출력 형식을 요구한다. 일반 LLM도 지시를 받으면 이런 응답을 내지만, 결정마다 JSON 전체를 쓰고 추론 모델은 그 전에 수백 토큰을 소모해 속도와 비용이 문제가 된다.
이 구현은 미세조정 없이 출하된 모델을 그대로 쓴다. 상태·질문·선택지를 JSON으로 넣고 각 선택지에 번호를 붙인 뒤, 미리 채운 assistant 응답을 'choice_index:'로 끝내 다음 토큰이 선택지 번호가 되게 한다. 그 위치에서 모든 선택지 번호의 확률을 읽어 정규화하면 판단과 확신도를 한 번의 순전파로 얻는다. 중복 결제 예시에서는 payments 62.1%, complaints 37.7%, technical 0.2%를 부여했다. vLLM의 continue_final_message, allowed_token_ids, logprob_token_ids를 활용하며 privatemode-decisions라는 Python 라이브러리로 공개됐다.
텍스트뿐 아니라 스캔 문서·사진·스크린샷도 같은 방식으로 판별하며 스캔 문서 분류에서 70.2% 정확도를 기록했다. 다만 네트워크 포함 응답 시간은 접속 지역에 따라 우열이 갈렸고, 판단 100만 건 비용은 GLM 약 62유로로 Jev(약 16유로)보다 비쌌다.