Ai Models

Claude Opus 4.6 — 1M 컨텍스트가 아니라 컨텍스트 부패를 다뤘다

Anthropic이 Claude Opus 4.6을 출시했다. 100만 토큰이라는 숫자보다 중요한 것은 대용량 정보 처리 시 성능이 떨어지는 'Context Rot'을 기술적으로 다뤘다는 점이다.

어긋나게 겹쳐진 두 격자를 그린 추상 도판
AI 생성

Anthropic이 최상위 모델인 Claude Opus 4.6을 공식 출시했다. 이번 릴리스는 단순한 성능 향상을 넘어, AI가 챗봇에서 ’자율적인 동료(Agent)’로 진화하는 전환점을 제시한다. 그 중심에 있는 것은 100만 토큰이라는 숫자 자체가 아니라, 그 숫자를 실제로 쓸 수 있게 만든 방식이다.

1. 1M 토큰 컨텍스트 윈도우와 ‘Context Rot’

Opus 4.6은 Opus 클래스 최초로 100만 토큰 컨텍스트 윈도우를 지원한다. 이는 단순한 용량 증가가 아니라, 대용량 정보를 처리할 때 성능이 떨어지는 ‘Context Rot’ 문제를 기술적으로 해결했다는 점에서 의미가 크다.

문서: https://platform.claude.com/docs/ko/build-with-claude/context-windows

성능 격차 — ‘Needle In A Haystack’ 테스트의 심화 버전인 MRCR v2 벤치마크에서 Opus 4.6은 76%의 정확도를 기록했다. 이전 모델인 Sonnet 4.5가 18.5%였던 것과 비교하면 질적으로 다른 수준의 기억력이다.

MRCR v2 정확도 — 같은 시험, 두 모델긴 컨텍스트에서 필요한 정보를 찾아내는 시험이다. 같은 벤치마크의 점수라 나란히 놓을 수 있다.
Opus 4.676%Sonnet 4.518.5%

Anthropic 발표 수치, 본문 기준.

실질적 활용 — 개발자는 전체 코드베이스나 방대한 법률 문서를 메모리에 상주시키고 작업할 수 있게 됐다. 모델은 처음 입력된 정보와 마지막에 입력된 정보를 동등한 비중으로 처리한다.

2. Agent Teams — 자율 협업의 시작

Claude Code 환경에 도입된 ’Agent Teams’는 단일 모델이 아니라 다수의 AI 에이전트가 팀을 이뤄 작업하는 구조다.

작동 방식 — 하나의 ’리더 에이전트’가 전체 작업을 계획하고, 하위 에이전트들에게 코딩·디버깅·테스트를 분배한다. 이들은 자동으로 조율하며 작업을 완수한다.

사례 — Anthropic은 내부 테스트에서 이 기능으로 C 컴파일러를 밑바닥부터 구축하는 데 성공했다. 사용자가 “C 컴파일러를 만들어줘”라고 요청하자 에이전트 팀이 수천 개의 세션을 생성하며 자율적으로 코드를 작성하고 수정했다. “One-shot”으로 복잡한 시스템을 구축하는 멀티 에이전트의 미래를 보여주는 사례다.

3. 사이버 보안 — 500개의 제로데이 취약점 발견

Anthropic은 Opus 4.6의 추론 능력을 사이버 보안에 적용해 효용성을 입증했다.

관련 문서: https://red.anthropic.com/2026/zero-days/

널리 쓰이는 오픈소스 코드베이스를 대상으로 Opus 4.6을 실행한 결과, 이전에 알려지지 않았던 제로데이 보안 취약점을 500개 이상 발견했다. 공격자가 취약점을 악용하기 전에 방어자가 먼저 패치하는 ‘선제적 사이버 방어’ 수단으로 AI가 활용될 수 있음을 시사한다.

4. 벤치마크

Opus 4.6은 주요 벤치마크에서 경쟁 모델인 GPT-5.2 등을 상회했다.

  • Terminal-Bench 2.0 (에이전트 코딩): 65.4%로 1위. GPT-5.2와 Gemini 3 Pro를 상회
  • Humanity’s Last Exam: 다분야 복합 추론에서 1위
  • GDPval-AA (지식 노동): 금융·법률 등 경제적 가치가 높은 작업 평가에서 GPT-5.2보다 약 144 Elo 앞섰다. 해당 작업에서 약 70% 더 우수한 성과를 낸다는 의미다
  • BrowseComp (웹 검색): 84.0%
  • BigLaw Bench (법률): 90% 이상의 정확도
벤치마크별 점수척도가 저마다 달라 한 축의 막대로 그리지 않는다 — Terminal-Bench 의 65.4% 와 BrowseComp 의 84.0% 는 서로 견줄 수 있는 숫자가 아니다.
Terminal-Bench 2.065.4%에이전트 코딩 · 1위
BrowseComp84.0%웹 검색
BigLaw Bench90%+법률
GDPval-AA (GPT-5.2 대비)약 +144Elo지식 노동

Anthropic 발표 수치, 본문 기준. 'Humanity's Last Exam 1위'는 순위만 공개돼 점수가 없어 넣지 않았다.

5. 새로운 API 기능

개발자가 모델의 ’사고 과정’을 더 정밀하게 제어할 수 있는 기능들이 추가됐다.

Context Compaction — 긴 대화나 작업 시 오래된 컨텍스트를 자동으로 요약해 토큰 효율을 높인다. (https://platform.claude.com/docs/ko/build-with-claude/compaction)

Adaptive Thinking — 프롬프트 난이도에 따라 모델이 스스로 깊게 생각할지 빠르게 답할지 결정한다. (https://platform.claude.com/docs/ko/build-with-claude/adaptive-thinking)

Effort Controls — Low, Medium, High, Max 4단계로 모델의 리소스 투입량을 조절해 비용과 지능 사이의 균형을 맞춘다. (https://platform.claude.com/docs/ko/build-with-claude/effort)

6. 업무 도구 통합 — Excel과 PowerPoint

AI를 채팅창이 아닌 실제 업무 환경으로 통합하려는 시도가 강화됐다.

7. 가격과 시장 상황

성능이 올랐는데도 가격은 입력 100만 토큰당 $5, 출력 100만 토큰당 $25로 동결됐다. 단, 20만 토큰 이상의 프롬프트에는 프리미엄 가격이 적용된다. (https://claude.com/pricing#api)

OpenAI가 Frontier 모델(GPT-5.3/Codex 등)을 발표한 당일 Opus 4.6이 출시되면서, 모델 간 성능·점유율 경쟁은 더 치열해질 전망이다.

Opus 4.6 벤치마크 비교 도표

Opus 4.6은 1M 토큰의 유효 컨텍스트와 에이전트 팀 기능으로 ’복잡한 장기 작업’을 수행할 수 있는 능력을 증명했다. 특히 벤치마크 수치와 보안 취약점 발견 사례는 이 모델이 실험실을 넘어 실제 산업 현장의 난제를 다룰 준비가 되었음을 보여준다.