Claude Opus 5 — 프론티어 성능을 반값에, 그리고 1M 컨텍스트가 '기본'이 됐다
Anthropic이 Opus 5를 냈어요. 가격은 Opus 4.8 그대로($5/$25)인데 Fable 5에 근접한 성능, 1M 컨텍스트는 베타 딱지 없이 표준이에요. 저는 이 발표를 7/3 Sonnet 5 때 쓴 '가격 곡선 붕괴'의 2단계로 읽어요 — 이제 Anthropic 라인업 전체가 '한 단계 위 성능을 한 단계 아래 가격에'로 재편됐거든요.
AI 뉴스와 개발 트렌드를 다루는 기술 블로그
Claude Code, OpenAI, Anthropic, Gemini, 개발 도구 릴리스, 실전 가이드와 같은 주제를 개발자 관점에서 정리합니다. 단순 링크 모음이 아니라 직접 사용해본 경험, 비교, 해석을 함께 남기는 AI 기술 블로그입니다.
Anthropic이 Opus 5를 냈어요. 가격은 Opus 4.8 그대로($5/$25)인데 Fable 5에 근접한 성능, 1M 컨텍스트는 베타 딱지 없이 표준이에요. 저는 이 발표를 7/3 Sonnet 5 때 쓴 '가격 곡선 붕괴'의 2단계로 읽어요 — 이제 Anthropic 라인업 전체가 '한 단계 위 성능을 한 단계 아래 가격에'로 재편됐거든요.
NVIDIA가 주도한 'Open Weights and American AI Leadership' 성명에 Microsoft·Meta·Google, 그리고 OpenAI까지 50개사가 서명했어요. 빠진 건 Amazon과 Anthropic뿐. 같은 주에 2.8조 파라미터 오픈 모델 Kimi K3가 코딩 하네스들의 1군에 편입됐고요. 오픈 웨이트는 이제 이념 논쟁이 아니라 산업 연합이에요.
OpenAI가 한 주에 컨택센터 플랫폼(Presence), 의료기록 연동(Health in ChatGPT), 국가 과학 프로그램(Genesis Mission 지원)을 쏟아냈어요. 공통점은 모델 판매가 아니라 업종 안으로 직접 들어간다는 것 — 그것도 자사 엔지니어가 배포를 이끄는 컨설팅 방식으로요. 지난주 채점표 칼럼의 후속이자, SI 채널 전쟁의 OpenAI식 답변입니다.
지난주 '멈추는 능력이 제품이 됐다'고 썼는데, 일주일 만에 물증이 나왔어요. Codex CLI 사용자의 홈 디렉토리에 쌓인 731.5GiB의 세션 로그, 그리고 같은 주에 OpenCode·Claude Code·oh-my-opencode가 일제히 추가한 깊이 제한·스폰 캡·대기 규율. 폭주는 이제 이론이 아니라 디스크와 청구서의 문제예요.
OpenAI CFO 사라 프라이어가 'AI 시대의 채점표'를 공개했어요. 유용한 작업, 성공 작업당 비용, 신뢰성, 컴퓨트 수익률 — 4개 문항으로 AI ROI를 재자는 제안이에요. 5월 졸업, 6월 재배치, 7월 기본값화에 이어, 저는 이걸 시리즈 4막 '채점'으로 읽습니다. 단, 채점 기준을 벤더가 만들었다는 점까지 같이 봐야 해요.
OpenAI가 캘리포니아 SB 53, 뉴욕 RAISE, 일리노이 SB 315를 묶어 '주(州)가 먼저, 연방이 따라오는' 역연방주의 전략을 공식화했어요. 자동 레드티밍 GPT-Red와 청소년 보호 발표까지 같은 주에 겹쳐 놓으면, 지난주 Anthropic의 기관화와 정확히 대칭인 신뢰 전략이 보입니다. 같은 목표, 다른 문법이에요.
벤 버냉키의 LTBT 합류, 캐나다 연구기관 1,000만 달러 기부, 대중의 어려운 질문을 공개 추적하겠다는 약속, 사용 절제 도구까지 — 일주일 사이 Anthropic이 쌓은 신호 4개를 겹치면 은행이 하는 일과 구조가 똑같아요. 저는 이걸 S-1 제출 이후의 신뢰 자본 축적으로 읽습니다.
Claude Code는 Auto 모드를 기본으로 풀고, Gemini는 백그라운드 실행을 API에 넣고, oh-my-opencode는 8시간 폭주 사고를 부검했어요. 저는 이 세 발표가 같은 문장이라고 봐요. 자율 실행이 기본값이 된 지금, 경쟁력은 '시작하는 능력'이 아니라 '멈추는 능력'으로 옮겨갔어요.
GPT-5.6은 M365 Copilot이 알아서 골라 쓰는 기본 모델이 됐고, 도이치텔레콤은 업무 자체를 AI 전제로 재설계하고 있고, UST는 반도체 검증 플랫폼에 Claude를 내장했어요. 셋의 공통점은 사용자가 AI를 '선택'하는 단계가 사라지고 있다는 거예요. 5월의 졸업, 6월의 재배치에 이어 7월은 기본값화예요.
Anthropic은 과학자용 워크벤치 Claude Science를, OpenAI는 유전체학 벤치마크 GeneBench-Pro를 거의 같은 시점에 내놨어요. 한쪽은 'AI로 과학하는 도구'를, 다른 쪽은 'AI가 과학을 하는가'를 측정해요. 그리고 그 측정값(최고 31.5%)이 지금 우리가 어디쯤 있는지 냉정하게 말해줘요.
Claude Code v2.1.198에서 서브에이전트가 기본으로 백그라운드에서 돌아요. 옵션이 아니라 기본값이 됐다는 게 핵심이에요. 여기에 worktree 작업이 끝나면 알아서 커밋·푸시·드래프트 PR까지 여는 변화가 붙으면서, 에이전트를 쓰는 멘탈 모델 자체가 '기다리는 채팅'에서 '보내 놓고 알림 받는 동료'로 넘어가요.
Sonnet 5가 Opus 4.8에 근접한 성능을 프로모션 기준 입력 100만 토큰당 $2에 내놨어요. 저는 이번 발표의 진짜 뉴스가 성능 곡선이 아니라 가격 곡선이라고 봐요. 'Opus급 지능'의 값이 무너지는 중이고, 그건 우리가 기본으로 어떤 모델을 켜 둘지를 바꿔요.
OpenAI가 18년 묵은 libunwind 레이스 버그를 잡은 방법이 흥미로워요. 개별 크래시를 파고든 게 아니라, 1년치 코어덤프 전체를 인구집단처럼 분석해 하나로 보이던 미스터리를 하드웨어 결함과 소프트웨어 버그 둘로 갈라냈어요. 그리고 이 이야기에서 AI는 주인공이 아니라 도구였어요. 저는 그게 오히려 지금 AI가 개발에 기여하는 방식의 정직한 그림이라고 봐요.
이번 주 OpenAI와 Google에서 나온 의료·과학 발표 세 건을 겹쳐 보면 공통점이 보여요. 셋 다 벤치마크 점수 자랑이 아니라, 사람이 실제 랩과 임상에서 검증한 결과예요. 그리고 검증 방식이 똑같아요. AI가 가설을 내고, 사람이 현실에서 확인합니다.
이번 달 Anthropic은 서울에 사무실을 열고 정부와 MOU를 맺었고, 삼성전자는 OpenAI의 ChatGPT Enterprise와 Codex를 전사에 깔았어요. 따로 보면 흔한 뉴스지만, 겹쳐 보면 한국이 'AI 데모 시장'에서 '본사가 직접 영업소를 차리는 시장'으로 승격된 신호예요. 그 상징이 삼성을 둘러싼 양쪽의 동시 공략이고요.
이번 주 Anthropic은 TCS와 DXC를 같은 패턴으로 끌어들였어요. 개발자에게 직접 파는 게 아니라, 규제산업을 이미 점유한 시스템 통합업체(SI)를 채널로 삼는 거예요. OpenAI도 같은 주에 컨설팅 파트너망을 모집했고요. 엔터프라이즈 AI의 경쟁축이 모델 성능에서 '누가 규제산업의 배관을 깔아주느냐'로 옮겨가는 흐름을 짚었어요.
이번 주 oh-my-opencode·Claude Code·OpenCode가 쏟아낸 릴리스를 겹쳐 보면, 경쟁이 '얼마나 잘 생성하나'에서 '사람이 안 볼 때 알아서 도느냐, 도구와 OS 경계를 넘어 살아남느냐, 한도를 거버넌스로 묶느냐'로 옮겨갔어요. 세 프로젝트가 같은 주에 같은 방향을 가리킨 게 우연이 아니라고 봐요.
닷새 전 저는 Fable 5의 진짜 뉴스가 '위험 능력을 거부가 아니라 라우팅으로 가둔 자체 설계'라고 썼어요. 그런데 미국 정부가 그 설계를 인정하지 않고 모델 접근 자체를 끊었습니다. 같은 날 나온 여론조사는 미국인의 15%만 AI 기업의 자율 판단을 믿는다고 말하고요. 잘 만든 자율 안전이 충분조건이 아니라는 신호를 따라가 봤어요.
AI는 공격을 더 정교하게 만드는 게 아니라, 덜 숙련된 사람도 정교한 공격을 하게 만들어요. 그래서 공격자의 스킬로 위험을 가늠하던 MITRE ATT&CK 프레임이 흔들리고 있어요. 진짜 빈틈은 모델이 공격 단계를 스스로 잇는 agentic orchestration인데, ATT&CK에는 그 칸이 아예 없다는 게 Anthropic 분석의 핵심이에요.
Fable 5의 헤드라인은 '역대 최강 SOTA'지만, 정작 읽어야 할 건 벤치마크가 아니라 Mythos→Fable로 이어지는 안전 라우팅 설계예요. 위험한 능력을 거부로 막는 대신 약한 모델로 흘려보내고, 진짜 위험 능력은 Mythos 5로 분리해 인가받은 파트너에게만 여는 구조가 이번 발표의 본론이라고 봐요.
지난주에 저는 엔터프라이즈가 AI 코딩 '파일럿을 졸업했다'고 썼어요. 6월 사례들을 보니 이건 도입 선언이 아니라 그다음 단계, 즉 개발 생산성을 어디에 쓸지를 다시 배치하는 이야기예요. Notion·Nextdoor·LSEG가 서로 다른 자리에서 같은 변화를 가리킨다고 봅니다.
한 주 사이에 Anthropic에 이어 OpenAI도 비공개 S-1을 냈어요. 저는 이걸 'OpenAI도 IPO 준비' 한 줄로 읽으면 핵심을 놓친다고 봐요. AGI 경쟁의 무대가 연구실에서 자본시장으로 옮겨갔다는 신호이고, 두 회사의 지배구조가 상장 과정에서 시험대에 오른다는 게 진짜 쟁점이에요.
AI 코딩의 경쟁축이 '얼마나 빨리 만드나'에서 '얼마나 안 낭비하나'로 옮겨가고 있어요. 토큰의 2%만 실제 코드에 쓰인다는 측정, 유지보수 부담만 남은 바이브코딩, 그리고 손이 아닌 안목을 말하는 장인정신 논의가 같은 방향을 가리킵니다. 결과물 양이 아니라 효율과 지속가능성이 진짜 지표예요.
Anthropic이 Series H 직후 SEC에 비공개 S-1을 제출했어요. 단순 'IPO 추진' 뉴스로 읽으면 절반만 보는 거예요. 자금·모델·인프라·시장 확장을 한 흐름으로 놓고, 이게 Claude에 기대는 개발자에게 뭘 뜻하는지 따져봤어요.
한 달 동안 쏟아진 대기업 AI 도입 발표를 한 줄로 요약하면, 더 이상 '실험'이 아니라는 거예요. 빌드 파이프라인, 27만 명의 워크플로우, 세무 신고처럼 틀리면 책임이 따르는 핵심 업무로 AI가 들어가기 시작했어요. 저는 이걸 파일럿의 졸업, 즉 도입 단계가 한 칸 넘어간 변곡점으로 봅니다.
OpenAI와 Anthropic이 비슷한 시기에 거버넌스·평가·안전을 전면에 내세웠어요. 저는 이걸 선의의 우연이 아니라 EU AI Act와 캘리포니아 TFAIA가 발효되기 전, 규칙이 자기들 손으로 정해지길 바라는 선제적 포지셔닝으로 봐요. 누가 평가의 표준을 쓰느냐가 진짜 승부처라는 이야기예요.
Anthropic이 서울 오피스 개설을 앞두고 최기영 한국 대표를 선임했어요. 한국은 인구 대비 Claude 사용률이 3.5배 높은 시장이에요. 글로벌 영문 매체가 잘 안 다루는 이 소식을 한국 개발자 관점에서 정리했어요.
Anthropic이 650억 달러 규모의 Series H를 마감했어요. 기업가치는 9650억 달러, 런레이트 매출은 470억 달러를 넘었어요. 이 돈이 어디로 가는지, 그리고 Opus 4.8 출시와 같은 날 나온 의미를 짚어봤어요.
Anthropic이 Opus 4.8을 내놨어요. 가격은 그대로지만 코드 신뢰성이 4배 좋아졌고, Fast 모드 비용이 3배 내려갔어요. 매일 Claude Code를 쓰는 입장에서 체감 포인트를 정리했어요.
Google I/O 2026에서 Gemini Omni와 Gemini 3.5 Flash가 공개됐어요. 하나는 어떤 입력이든 영상으로 만들어내는 모델, 하나는 에이전트와 코딩에 초점을 맞춘 모델이에요. 9개 데모로 본 두 모델의 방향을 정리했어요.