Ai Models

GPT-5.2 — 6주간의 릴리스 러시 한복판에서

11월 중순 Gemini 3 Pro, 11월 24일 Claude Opus 4.5. 6주간 쏟아진 모델들 한복판에서 OpenAI가 GPT-5.1 공개 한 달도 안 돼 GPT-5.2를 냈다.

겹쳐 찍힌 판본들로 세대 교체를 나타낸 추상 도판
AI 생성

지난 6주간 AI 업계는 전례 없는 속도로 새 모델을 쏟아 냈다. 11월 중순 구글이 Gemini 3 Pro를, 11월 24일 앤트로픽이 Claude Opus 4.5를 연이어 내며 벤치마크 상위권을 석권했고, OpenAI의 시장 점유율을 빠르게 잠식했다.

그 한복판에서 OpenAI가 GPT-5.2를 냈다. GPT-5.1 공개 후 채 한 달이 지나지 않은 시점이다. 블룸버그 보도에 따르면 샘 알트먼은 이 상황을 내부적으로 “비상사태”로 규정했고, 코드명 ’갈릭(Garlic)’으로 불리던 GPT-5.2의 개발과 출시를 서둘렀다고 알려졌다.

출시 예정 소문에 구글도 지난주 Gemini 3 DeepThink를 급히 발표했다. 그럼에도 OpenAI는 GPT-5.2를 통해 추상적 추론과 전문 지식 처리에서 경쟁사들을 다시 앞서는 “새로운 시장 선두주자”라고 자부하고 있다.

GPT-5.2 벤치마크 비교표

GPT-5.2가 앞선 곳 — ‘유동 지능’

가장 주목할 성과는 ARC-AGI-2다. 암기식 데이터 처리가 아니라 새로운 문제 해결에 필요한 ’유동 지능(Fluid Intelligence)’과 진정한 추상적 추론 능력을 평가하는 벤치마크다.

GPT-5.2 Pro는 여기서 **54.2%**를 기록해 Gemini 3 Deep Think(45.1%)와 Claude Opus 4.5(37.6%)를 큰 격차로 따돌렸다. 그동안 경쟁사에 밀리던 추론 영역에서 기술적 도약을 이뤘음을 시사한다.

AIME 2025(수학)에서는 별도의 코드 실행 도구 없이 100% 만점을 달성했다. Gemini 3 Pro가 도구를 켜야 낼 수 있었던 점수와 같은 수준으로, 모델 자체의 순수 연산과 논리력이 강화됐음을 보여 준다.

여전히 치열한 곳 — 코딩과 심층 연구

코딩(SWE-bench Verified) — Claude Opus 4.5가 80.9%로 여전히 소폭 앞서 있고, 명령줄 코딩을 재는 Terminal-bench 2.0에서도 선두를 지킨다. 다만 GPT-5.2도 80.0%를 기록하며 격차를 거의 좁혔다.

심층 연구와 난제 — Gemini 3 Deep Think가 대학원 수준 과학 문제인 GPQA Diamond(93.8%)와 Humanity’s Last Exam(41.0%)에서 최고 점수를 냈다. Deep Think는 답변 전 최대 30분간 분석을 수행하는 모델로, GPT-5.2 Pro 모드와 직접 경쟁 관계다.

참고 — 위 수치는 각 공급업체가 보고한 것이며 독립적인 검증이 필요할 수 있다.

라인업

GDPval — OpenAI는 자체 벤치마크로 GPT-5.2 Thinking이 44개 전문 직종 업무에서 인간 전문가보다 70.9% 더 우수한 성과를 냈다고 발표했다. 처리 속도는 전문가 대비 약 11배 빠르고 비용은 1% 수준이라고 한다. 이는 OpenAI 내부 평가 기준이며 아직 제3자 검증을 거치지 않았다.

  • GPT-5.2 Thinking — 복잡한 추론과 코딩, 데이터 분석에 최적화된 주력 모델. 추론 강도(none, low, medium, high, xhigh)를 조절할 수 있다
  • GPT-5.2 Pro — 가장 높은 지능을 가진 모델. 수학 난제나 정밀한 과학 연구처럼 무결성이 요구되는 작업에 쓴다 (구독 등급인 ‘Pro’ 플랜과는 다른 별도의 모델 명칭이다)
  • GPT-5.2 Instant — 빠르고 효율적인 일상 업무용 경량 모델

기능 개선

  • 긴 컨텍스트 — 최대 256k 토큰 범위에서 정보 일치율이 100%에 가깝다
  • 환각 감소 — GPT-5.1 대비 약 38% 줄었다
  • 비전과 도구 사용 — 차트 해석 능력이 좋아졌고 여러 단계의 도구 호출 안정성이 확보됐다

가격

오늘부터 ChatGPT 유료 플랜(Plus, Pro, Enterprise 등) 사용자에게 순차 배포되며 API로도 즉시 쓸 수 있다.

모델 입력 (1M) 출력 (1M)
gpt-5.2 (Thinking) $1.75 $14.00
gpt-5.2-pro $21.00 $168.00

캐시된 입력을 쓰면 입력 비용이 90% 할인된다.


GPT-5.2는 단순한 성능 업데이트를 넘어, 구글과 앤트로픽의 거센 추격에 맞서 OpenAI가 기술적 주도권을 재확인하려고 내놓은 전략적 모델이다. 특히 ARC-AGI-2에서의 성과는 AI가 단순한 지식 검색을 넘어 복잡한 문제 해결 단계로 들어섰음을 보여 준다. 다만 각 벤치마크 수치는 독립적인 검증이 필요하며, 실제 업무 환경에서의 효용은 사용자의 검증으로 판가름 날 것이다.