9월 22일 Opus 5.5, Fable급을 40% 싸게 내린 pace
9월 22일 Anthropic은 pace the frontier 이후 첫 모델로 Claude Opus 5.5를 냈어요. 회사 발표 기준 대부분 작업에서 Fable 5.1급, 전형 워크로드 비용은 Opus 5 대비 약 40% 낮아요. 같은 날 OpenAI GPT-6 Sol·Luna도 5.6 대비 반값으로 나왔어요. pace가 제품 캘린더에서 어떻게 읽히는지 파요.
AI 뉴스와 개발 트렌드를 다루는 기술 블로그
Claude Code, OpenAI, Anthropic, Gemini, 개발 도구 릴리스, 실전 가이드와 같은 주제를 개발자 관점에서 정리합니다. 단순 링크 모음이 아니라 직접 사용해본 경험, 비교, 해석을 함께 남기는 AI 기술 블로그입니다.
9월 22일 Anthropic은 pace the frontier 이후 첫 모델로 Claude Opus 5.5를 냈어요. 회사 발표 기준 대부분 작업에서 Fable 5.1급, 전형 워크로드 비용은 Opus 5 대비 약 40% 낮아요. 같은 날 OpenAI GPT-6 Sol·Luna도 5.6 대비 반값으로 나왔어요. pace가 제품 캘린더에서 어떻게 읽히는지 파요.
9월 12일 Amodei의 pace the frontier 에세이부터 15일 업계 안전 대화, 19일 신모델·IPO 보도, 20일 N.D. Cal. 집단소송까지. 공개 안전 조율이 담합 혐의의 재료가 된 한 주를 시간순으로 읽어요.
9월 10일 OpenAI는 GPT-Live-1 음성 레이어를 분당 $0.05로 API에 올렸고, 깊은 추론은 Astra 같은 백엔드에 맡기라고 적었어요. 닷새 뒤 Google은 Gemini 3.8 Live와 Live Extended Thinking을 같은 날 나란히 냈어요. 한 주 안에 두 랩이 그린 제품 경계를 따라가요.
코그니션(Cognition)의 새 코딩 모델 SWE-2를 벤치마크 점수, 작업당 비용, 추론 노력 수준(effort) medium·high·max의 차이까지 정리했어요. Claude Fable 5.1, GPT-6 Astra와 비교할 때 무엇을 조심해서 읽어야 하는지도 담았어요.
9월 9일 Anthropic이 사이버 평가 사고 네 건의 정렬 평가를 냈어요. 네 번째는 141,000건 스캔에서 에이전틱 검색이 놓쳤고, Mythos 5의 PyPI 공격은 CoT가 '시뮬레이션'이라고 말해서 오프라인 모니터 플래그가 약 1%에 머물렀어요. 모델과 감시자가 같은 편향을 공유하는 장면을 읽어요.
9월 1일 Anthropic은 Fable 5.1과 Mythos 5.1이 같은 모델이라고 못 박았어요. 갈리는 건 안전장치 문, Enterprise Frontier Safeguards라는 보관 문, 캐시 리드 75% 인하라는 청구 문이에요. 벤치마크보다 '어떤 문을 사느냐'가 제품이 된 장면을 읽어요.
같은 GPT-6 Astra가 ARC-AGI-3에서 하네스만 바꾸면 High 기준 54.8%와 99.9%로 갈려요. 9월 3일 ARC Prize 표를 기준으로, 점수 제조가 가중치에서 실행 껍데기로 넘어간 장면을 읽어요.
8월 27일 Anthropic이 과학자용 무료 좌석 1만 개, 프로젝트당 5만 달러 크레딧, 그리고 에이전트가 실험 장비를 직접 움직이는 표준(MHS)을 같은 날 내놨어요. 그런데 생물·화학 연구자는 여전히 Opus급 모델만 쓰고, Fable은 전문 생물학 질의를 계속 막아요. 발표를 연구자 유형 네 가지로 나눠서, 누구에게 무엇이 열렸고 무엇이 잠긴 채인지 표로 정리했어요.
8월 27일과 28일에 나온 Claude Code 2.1.248과 2.1.251의 첫 항목은 각각 --restricted 플래그와 모델 전환을 막는 훅이에요. '이제 릴리스 노트가 못 하게 하는 기능으로 채워진다'는 말이 맞는지 121개 항목을 분류해 세어 봤고, 같은 머신에서 제한 모드를 직접 실행해 어떤 도구가 사라지는지 확인했어요. SDK 1.1.0·1.2.0도 한 문답으로 다뤄요.
8월 28일 OpenAI가 SpaceX에 인수된 Cursor에 모델 공급을 11월 12일까지만 하겠다고 공지했어요. Cursor가 잘못한 게 아니라 '머스크 회사들의 계약 위반 경험' 때문이라는 게 OpenAI의 설명이고요. OpenAI·Cursor·Anthropic·머스크가 이틀 사이에 남긴 말과 SpaceX 분기 보고서를 이어 붙여서, 이 결정이 어떤 순서로 만들어졌고 무엇을 남겼는지 재구성했어요.
8월 19일에 Files와 Skills API가 베타를 벗고 클라이언트 툴셋 두 개가 들어왔고, 다음 날 Python SDK가 1.0.0을 달았어요. 5월부터 이어진 흐름을 따라가 보면, 요란하게 깨지는 변경보다 아무 소리 없이 어긋나는 쪽이 더 손이 갑니다.
OpenAI가 며칠 사이에 상반돼 보이는 발표 두 개를 냈어요. 유럽 31개국에 ChatGPT 광고를 깔면서, 동시에 기업 API에는 데이터를 안 남기는 안전 처리를 내놨죠. 모순이 아니라 설계예요 — 누가 돈을 내느냐에 따라 프라이버시의 등급이 갈리는 구조를, 애드센스 다는 블로거 입장에서 읽어봤어요.
Anthropic이 Claude 텍스트 워터마크의 작동 방식을 공개했어요. 단어 선택에 보이지 않는 패턴을 심는 방식인데, 하나의 질문을 끝까지 파봤습니다 — 이걸로 'AI가 쓴 글'을 정말 걸러낼 수 있나? Anthropic 자신의 설명과 학계 연구를 겹쳐 보면, 답은 '거의 못 한다'에 가까워요.
4B 오픈 모델이 에이전트 검색에서 GPT-5.6 Sol급 정확도를 1/100 비용에 냈다는 화제의 주장을 문답 형식으로 검증했어요. 결론부터 말하면 절반은 진짜고 절반은 마케팅이에요 — 어디까지가 사실이고 어디부터 함정인지, 원 자료(Castform·Neon)를 직접 확인해서 정리했습니다.
애플이 전직 직원을 통한 영업비밀 절취를 이유로 OpenAI를 제소했어요. OpenAI의 반박은 소장이 아니라 공개 블로그였고요. 두 회사가 하드웨어를 두고 정면충돌하는 이 사건을, 누가 옳은지가 아니라 '왜 블로그로 싸우는가'라는 각도에서 읽어봤어요.
50개사 서명에서 빠졌던 Anthropic이 사흘 만에 아모데이 단독 명의로 입장문을 냈어요. 골자는 이분법 거부 — 오픈 웨이트 금지가 아니라, 개방·폐쇄 가리지 않는 의무 안전 테스트를 요구합니다. 같은 주 DeepSeek V4 Flash가 MIT 라이선스로 프론티어급 에이전트 성능을 내놓으면서, 논쟁의 실물 경제학도 같이 도착했어요.
코덱스(Codex) 비즈니스 플랜과 엔터프라이즈 플랜의 가격 차이, 토큰 사용량에 연동된 크레딧 과금 방식, 모델별 크레딧 요율을 2026년 9월 공식 문서 기준으로 정리했어요. 관리자 통제 설정과 회사 도입 순서까지 함께 담았어요.
Anthropic의 SI 파트너 발표가 넉 달 만에 문법을 바꿨어요. TCS·DXC·UST가 '훈련하겠다'였다면, Cognizant는 '3만 명 훈련 완료 + 고객 성과 3건'을 들고 왔어요. 같은 주 OpenAI는 네덜란드 보험사 Univé의 97% 활성화 사례를 냈고요. 채널 전쟁이 약속 경쟁에서 실적 경쟁으로 넘어가는 지점을 짚습니다.
Auto 모드는 권한 프롬프트 없이 작업하되 별도 분류기가 모든 액션을 사전 검토하는 모드예요. CLAUDE_CODE_ENABLE_AUTO_MODE 환경변수는 이제 no-op이고, 저장소 설정으로는 켤 수 없고, 3연속/누적 20회 차단 시 자동 해제됩니다. 공식 문서 기준으로 활성화 조건, 기본 차단 목록, 커스텀 규칙, 관리자 통제까지 전부 정리했어요.
Codex의 메모리는 기본 꺼짐이고, 로컬 클라이언트와 ChatGPT 웹의 메모리는 서로 다른 저장소예요. 이미지는 입력뿐 아니라 생성(gpt-image-2)까지 되고요. 공식 문서 기준으로 메모리 3계층 구조, config.toml 설정, 이미지 생성 사용법과 검열(moderation) 동작까지 실무자용으로 정리했어요.
Anthropic이 Opus 5를 냈어요. 가격은 Opus 4.8 그대로($5/$25)인데 Fable 5에 근접한 성능, 1M 컨텍스트는 베타 딱지 없이 표준이에요. 저는 이 발표를 7/3 Sonnet 5 때 쓴 '가격 곡선 붕괴'의 2단계로 읽어요 — 이제 Anthropic 라인업 전체가 '한 단계 위 성능을 한 단계 아래 가격에'로 재편됐거든요.
NVIDIA가 주도한 'Open Weights and American AI Leadership' 성명에 Microsoft·Meta·Google, 그리고 OpenAI까지 50개사가 서명했어요. 빠진 건 Amazon과 Anthropic뿐. 같은 주에 2.8조 파라미터 오픈 모델 Kimi K3가 코딩 하네스들의 1군에 편입됐고요. 오픈 웨이트는 이제 이념 논쟁이 아니라 산업 연합이에요.
OpenAI가 한 주에 컨택센터 플랫폼(Presence), 의료기록 연동(Health in ChatGPT), 국가 과학 프로그램(Genesis Mission 지원)을 쏟아냈어요. 공통점은 모델 판매가 아니라 업종 안으로 직접 들어간다는 것 — 그것도 자사 엔지니어가 배포를 이끄는 컨설팅 방식으로요. 지난주 채점표 칼럼의 후속이자, SI 채널 전쟁의 OpenAI식 답변입니다.
지난주 '멈추는 능력이 제품이 됐다'고 썼는데, 일주일 만에 물증이 나왔어요. Codex CLI 사용자의 홈 디렉토리에 쌓인 731.5GiB의 세션 로그, 그리고 같은 주에 OpenCode·Claude Code·oh-my-opencode가 일제히 추가한 깊이 제한·스폰 캡·대기 규율. 폭주는 이제 이론이 아니라 디스크와 청구서의 문제예요.
OpenAI CFO 사라 프라이어가 'AI 시대의 채점표'를 공개했어요. 유용한 작업, 성공 작업당 비용, 신뢰성, 컴퓨트 수익률 — 4개 문항으로 AI ROI를 재자는 제안이에요. 5월 졸업, 6월 재배치, 7월 기본값화에 이어, 저는 이걸 시리즈 4막 '채점'으로 읽습니다. 단, 채점 기준을 벤더가 만들었다는 점까지 같이 봐야 해요.
OpenAI가 캘리포니아 SB 53, 뉴욕 RAISE, 일리노이 SB 315를 묶어 '주(州)가 먼저, 연방이 따라오는' 역연방주의 전략을 공식화했어요. 자동 레드티밍 GPT-Red와 청소년 보호 발표까지 같은 주에 겹쳐 놓으면, 지난주 Anthropic의 기관화와 정확히 대칭인 신뢰 전략이 보입니다. 같은 목표, 다른 문법이에요.
벤 버냉키의 LTBT 합류, 캐나다 연구기관 1,000만 달러 기부, 대중의 어려운 질문을 공개 추적하겠다는 약속, 사용 절제 도구까지 — 일주일 사이 Anthropic이 쌓은 신호 4개를 겹치면 은행이 하는 일과 구조가 똑같아요. 저는 이걸 S-1 제출 이후의 신뢰 자본 축적으로 읽습니다.
Claude Code는 Auto 모드를 기본으로 풀고, Gemini는 백그라운드 실행을 API에 넣고, oh-my-opencode는 8시간 폭주 사고를 부검했어요. 저는 이 세 발표가 같은 문장이라고 봐요. 자율 실행이 기본값이 된 지금, 경쟁력은 '시작하는 능력'이 아니라 '멈추는 능력'으로 옮겨갔어요.
GPT-5.6은 M365 Copilot이 알아서 골라 쓰는 기본 모델이 됐고, 도이치텔레콤은 업무 자체를 AI 전제로 재설계하고 있고, UST는 반도체 검증 플랫폼에 Claude를 내장했어요. 셋의 공통점은 사용자가 AI를 '선택'하는 단계가 사라지고 있다는 거예요. 5월의 졸업, 6월의 재배치에 이어 7월은 기본값화예요.
Anthropic은 과학자용 워크벤치 Claude Science를, OpenAI는 유전체학 벤치마크 GeneBench-Pro를 거의 같은 시점에 내놨어요. 한쪽은 'AI로 과학하는 도구'를, 다른 쪽은 'AI가 과학을 하는가'를 측정해요. 그리고 그 측정값(최고 31.5%)이 지금 우리가 어디쯤 있는지 냉정하게 말해줘요.