새 모델 물결 속, 에이전트 도구와 비용을 다시 재는 한 주
| 월 | 화 | 수 | 목 | 금 | 토 | 일 | |
|---|---|---|---|---|---|---|---|
| W22 | 1 | 2 | 3 | 4 | 5 | 6 | 7 |
| W23 | 8 | 9 | 10 | 11 | 12 | 13 | 14 |
| W24 | 15 | 16 | 17 | 18 | 19 | 20 | 21 |
| W25 | 22 | 23 | 24 | 25 | 26 | 27 | 28 |
| W26 | 29 | 30 | 1 | 2 | 3 | 4 | 5 |
| 월 | 화 | 수 | 목 | 금 | 토 | 일 | |
|---|---|---|---|---|---|---|---|
| W26 | 29 | 30 | 1 | 2 | 3 | 4 | 5 |
| W27 | 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| W28 | 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| W29 | 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| W30 | 27 | 28 | 29 | 30 | 31 | 1 | 2 |
| 월 | 화 | 수 | 목 | 금 | 토 | 일 | |
|---|---|---|---|---|---|---|---|
| W30 | 27 | 28 | 29 | 30 | 31 | 1 | 2 |
| W31 | 3 | 4 | 5 | 6 | 7 | 8 | 9 |
| W32 | 10 | 11 | 12 | 13 | 14 | 15 | 16 |
| W33 | 17 | 18 | 19 | 20 | 21 | 22 | 23 |
| W34 | 24 | 25 | 26 | 27 | 28 | 29 | 30 |
| W35 | 31 | 1 | 2 | 3 | 4 | 5 | 6 |
구글이 Gemini 3.8 Flash를 공개했다. 입력 $0.75·출력 $3.75로 3.7과 값 그대로, 코딩·에이전트가 개선됐다. 저비용 워크호스로 쓸 만하다.
OpenAI가 새 플래그십 GPT-6 Astra를 공개했다. 코딩·컴퓨터·사이버·과학에서 SOTA를 표방하고 Codex 앱은 Claude 기록을 가져온다. 전환 비용이 낮아 Claude 사용자도 테스트할 만하다.
코딩 에이전트에 LSP 의미 검색을 줘도 단순 위치 찾기엔 grep을 썼다. LSP를 강제하니 성공률이 100%→89%로 떨어졌다. LSP에 소스 코드를 함께 반환하자 이름변경 첫 성공률이 67%→83%로 올랐다.
AA가 지능지수 v4.2를 공개했다. 비공개 테스트 비중을 20%→40%로 올렸고 종합 1위는 Fable 5.1, 2위는 Astra다. 벤치마크 최적화가 어려워져 순위 신뢰도가 올라간다.
Cursor가 클라우드 에이전트를 사내 머신에서 실행하게 했다. 자체 AWS의 Lambda MicroVM에서 코드가 사내에 머물며 내부 저장소·서비스에 붙는다. 보안 탓에 미뤘던 팀도 에이전트를 도입할 길이 생겼다.
Robocurve가 GPT-6 Astra에 로봇 팔 제어를 시켰다. 블록 담기서 20회 중 19회 성공, Fable 5.1은 8회에 그쳤다. 토큰은 2,100개로 Fable의 12,900개보다 적어 효율이 앞섰다.