AA가 모델 종합 성능 비교 지수 v4.2를 공개하며 수천 개 자료를 쓰는 에이전트 지식 업무(AA-Briefcase)와 4,592쪽·100개 PDF를 종합하는 전문 문서 추론(GDP.pdf)을 추가하고, 포화된 GPQA Diamond를 제외했다. 편법 최적화를 줄이려 비공개 테스트 가중치를 20%에서 40%로 올렸다. 개편 종합 지수는 Claude Fable 5.1이 1위, GPT-6 Astra가 2위(Sol보다 4점 높음)이며, Astra는 전문 문서 분석과 출력 토큰 대비 효율에서 두드러졌다.
v4.2는 2026년 1월 v4 이후 준비해 온 v5의 일부를 앞당겨 반영한 중간 개편이다. 사람이 수 주에 걸쳐 할 프로젝트를 다루는 AA-Briefcase와, 텍스트·표·차트·각주·제외 조건이 4,592쪽에 흩어진 GDP.pdf를 한 번의 요청으로 종합하게 하는 등 현실적 과제를 더했다. 대신 상위권이 포화된 GPQA Diamond는 뺐다.
세부에서는 GPT-6 Astra가 GDP.pdf All-pass 33.2%로 Sol 28.2%·Fable 5.1 26.2%를 앞섰고 Briefcase에서 Sol보다 약 85 Elo 높았으며, 출력 토큰 대비 성능에서 지능 선두권 거의 모두를 능가했다. 복잡한 지식 업무는 Claude가 앞섰다. 개발사 순위는 Anthropic, OpenAI, Meta, SpaceXAI, Moonshot/Kimi, Z.AI, Google 순이며, AA는 정답에 보상하고 환각에 감점하되 답변 거부엔 불이익을 주지 않는 Omniscience Index가 실제 유용성과 상관이 가장 높다고 본다.