커서가 에이전트 하네스를 개선해 품질 저하 없이 사용자 토큰 비용을 7% 줄였다고 밝혔다. 모델이 좋아지면서 도구 사용·작업 관리에 대한 장황한 지시가 불필요해져 시스템 프롬프트의 약 66%를 걷어냈고, 늘어난 도구 정의도 정리했다. 이 최적화는 대규모 사용자 기반의 A/B 테스트로 검증했다.
에이전트가 더 야심 찬 작업을 오래 수행하게 되면서 토큰 지출의 무게중심이 이동했다. 컨텍스트를 어떻게 조립하고 재사용하느냐가 중요해졌고, 매 턴에 커서가 붙이는 시스템 프롬프트와 도구 정의는 전적으로 통제 가능한 가장 큰 비용원이 됐다.
모델이 약했던 시절에는 도구 사용법, 작업 관리, 코드 변경 워크플로를 일일이 써주고 긴 해시 덤프·이모지 같은 이상 행동도 막아야 했다. 모델이 좋아지자 '이건 하지 마'·'반드시'류 지시 대부분이 불필요해져, 도구가 어떻게 동작하는지만 정의해도 모델이 대체로 따랐다. 그 결과 시스템 프롬프트의 약 66%를 덜어냈다.
커서는 이런 최적화를 여러 계층에서 진행해 품질을 낮추지 않고 토큰 비용을 7% 줄였다고 밝혔다. 평가(eval)는 대개 '어려운' 문제에 치우쳐 실제 요청 분포를 반영하지 못하므로, 대규모 사용자 기반의 A/B 테스트가 하네스 최적화에 핵심이었다고 설명한다.