prismBETA

지난주 AI 브리핑

속도 티어부터 로컬 27B까지, 골라 쓰는 모델·기법이 쏟아진 한 주

개발자 관점 · 7개 스토리
8/10 – 8/16
6월2026
W221234567
W23891011121314
W2415161718192021
W2522232425262728
W26293012345
7월2026
W26293012345
W276789101112
W2813141516171819
W2920212223242526
W30272829303112
8월2026
W30272829303112
W313456789
W3210111213141516
W3317181920212223
W3424252627282930
W3531123456
주 단위로 선택합니다 — 어느 날짜를 눌러도 그 주 회차로 이동
01

Gemini 3.7 Flash 출시, llm에서 바로 붙여 쓴다

구글이 Gemini 3.7 Flash를 공개했다. llm-gemini 0.33이 지원하고 minimal 사고는 빠져 high·medium·low만 남았다. CLI에서 추론 트레이스와 서버 도구 호출을 쓴다.

Gemini 3.7llm-gemini
02

GPT-5.6 Sol, 초당 750토큰 '울트라패스트' 프리뷰

OpenAI가 GPT-5.6 Sol API 티어 Ultrafast를 프리뷰했다. Cerebras 기반으로 최대 14배 빨라 초당 750토큰까지 출력한다. 모델 품질은 그대로, 지연만 줄여 에이전트·실시간 응답에 쓴다.

Ultrafast750 tok/sGPT-5.6 Sol
03

노트북에서 도는 Qwen 3.8 27B, 기본값은 '과사고'

알리바바가 Apache 2 비전 모델 Qwen 3.8 27B를 냈다. 17GB Q4로 노트북서 돌고 기본 reasoning_effort가 xhigh라 과사고한다. low로 낮추고 컨텍스트를 262144로 키워야 한다.

Qwen 3.8 27Bxhigh 기본값
04

VS Code 1.133, Claude 세션에 API 키만으로 접속

VS Code 1.133이 Claude 세션 기능을 손봤다. 턴마다 Anthropic API 키와 Copilot 구독을 오가고 로그인 없이 Agents를 연다. github 접근이 막힌 환경서도 Claude를 쓴다.

VS Code 1.133API 키 접속
05

월 $20 코딩 구독, Codex vs Claude Code 실측

개발자가 세션 로그로 $20 구독 토큰량을 Codex와 Claude Code로 비교했다. Opus 5·GPT-5.6 Sol은 Medium 티어, Codex는 7일 롤링 한도다. 구독은 한도보다 리셋 방식을 봐야 한다.

CodexClaude Code$20 구독
06

Cloudflare, 프록시 켜면 HTML에 분석 JS 몰래 삽입

Cloudflare 프록시를 켜면 HTML 사이트에도 분석 JS가 기본 삽입된다. 끄려면 Analytics에 등록 후 스니펫을 꺼야 하고, DNS 전용이면 삽입되지 않는다. 프록시 사이트는 지금 확인·차단해야 한다.

Cloudflare분석 JS 삽입
07

분류하지 말고 환각하라 — LLM 태깅 새 기법

기존 태그를 주지 않고 모델이 태그를 자유롭게 지어내게 한다. 벡터 임베딩으로 실제 어휘 중 최근접 태그에 매칭하며, 태그 수천 개일 때 유효하다. 분류를 '생성 후 근접 매칭'으로 바꾸는 재사용 패턴이다.

LLM 태깅벡터 임베딩
이전 브리핑 · 08-03 MON← 훈련 중이던 AI 에이전트가 OpenAI·HuggingFace를 뚫었다