Ai Models

Gemini 2.5 Pro 5월 업데이트 — 두 달간의 순위 다툼

3월 공개, 4월 o3 등장, 5월 재역전. 두 달 사이의 순위 다툼과 이번 업데이트가 코딩에 집중한 이유를 정리했다.

겹쳐 찍힌 판본들로 세대 교체를 나타낸 추상 도판
AI 생성

Gemini 2.5 Pro 가 5월 6일 새 Preview 버전으로 업데이트되며 다시 한번 AI 성능 경쟁에 불을 지폈다.

시간축으로 보면 이렇다. 3월 25일 처음 공개된 이후 여러 주요 벤치마크에서 뛰어난 성능을 보이며 주목받았다. 4월 17일 OpenAI 의 o3 및 o4-mini 가 나오며 일부 지표에서 잠시 선두를 내주는 듯했다. 그리고 5월 6일 이번 업데이트로 기술적 우위를 다시 굳히려는 움직임을 보인다.

코딩 능력에 집중했다

이번 업데이트(Preview 05-06)의 가장 큰 특징은 코딩 능력의 향상 이다. 코드 생성(LiveCodeBench v5: 70.4% → 75.6%)과 코드 편집(Aider Polyglot: 74.0% → 76.5%)에서 주목할 만한 개선이 확인됐다. 프런트엔드 웹 개발 작업과 복잡한 코드 편집·변환 기능이 크게 향상됐음을 시사한다.

여러 영역에서는 유사하거나 수치가 소폭 하락한 반면, 코딩 관련 능력을 끌어올린 모습이다.

영역 이전 최신
Science GPQA diamond 84.0% (multiple attempts) 83.0% (single attempt pass@1)
Mathematics AIME 2025 86.7% (multiple attempts) 83.0% (single attempt pass@1)
Code generation LiveCodeBench v5 70.4% (multiple attempts) 75.6% (single attempt pass@1)
Code editing Aider Polyglot 74.0% (pass@1) 76.5% (pass@1)
Agentic coding SWE-bench Verified 63.8% 63.2%
Factuality SimpleQA 52.9% 50.8%
Visual reasoning MMMU 81.7% (multiple attempts) 79.6% (single attempt pass@1)
Image understanding Vibe-Eval (Reka) 69.4% 65.6%
Long Context MRCR (128k average) 94.5% 93.0%
Long Context MRCR (1M pointwise) 83.1% 82.9%
Multilingual Global MMLU (Lite) 89.8% 88.6%

수치가 내려간 항목들은 그대로 읽으면 안 된다. single attempt pass@1 은 첫 번째 시도에서 정답을 맞히는 것이고, multiple attempts 는 여러 시도 중 하나라도 맞히거나 정해진 횟수 안에 성공하는 것이다. pass@1 은 일반적으로 multiple attempts 보다 달성하기 어려운 엄격한 지표이므로, 단순 수치 비교만으로 성능 저하를 단정하기는 어렵다.

또한 이번 버전에서는 비디오 이해를 평가하는 새 Video-MME 벤치마크에서 84.8% 를 기록하며 멀티모달 기능의 확장을 알렸다.

안정성과 가격

이전 버전에서 간혹 지적됐던 함수 호출(function calling) 관련 문제들도 이번 업데이트로 해결되어 더 안정적인 사용성을 제공한다고 알려졌다. 복잡한 워크플로 자동화와 애플리케이션 연동에서 더 신뢰도 높은 결과를 기대할 수 있다.

Preview 공개와 함께 토큰당 가격 정책(입력 $2.50/1M, 출력 $15.00/1M)이 제시된 점도 주목할 부분이다. 업계에서는 Gemini 가 경쟁 모델 대비 비용당 성능 측면에서도 상당한 우위 를 점하고 있다는 평가가 나온다.

이번 업데이트는 성능 수치를 넘어 실제 사용 환경에서의 효율성과 안정성을 크게 개선했다는 점에서 의미가 깊다.