Gemini 2.5 Pro 5월 업데이트 — 두 달간의 순위 다툼
3월 공개, 4월 o3 등장, 5월 재역전. 두 달 사이의 순위 다툼과 이번 업데이트가 코딩에 집중한 이유를 정리했다.

Gemini 2.5 Pro 가 5월 6일 새 Preview 버전으로 업데이트되며 다시 한번 AI 성능 경쟁에 불을 지폈다.
시간축으로 보면 이렇다. 3월 25일 처음 공개된 이후 여러 주요 벤치마크에서 뛰어난 성능을 보이며 주목받았다. 4월 17일 OpenAI 의 o3 및 o4-mini 가 나오며 일부 지표에서 잠시 선두를 내주는 듯했다. 그리고 5월 6일 이번 업데이트로 기술적 우위를 다시 굳히려는 움직임을 보인다.
코딩 능력에 집중했다
이번 업데이트(Preview 05-06)의 가장 큰 특징은 코딩 능력의 향상 이다. 코드 생성(LiveCodeBench v5: 70.4% → 75.6%)과 코드 편집(Aider Polyglot: 74.0% → 76.5%)에서 주목할 만한 개선이 확인됐다. 프런트엔드 웹 개발 작업과 복잡한 코드 편집·변환 기능이 크게 향상됐음을 시사한다.
여러 영역에서는 유사하거나 수치가 소폭 하락한 반면, 코딩 관련 능력을 끌어올린 모습이다.
| 영역 | 이전 | 최신 |
|---|---|---|
| Science GPQA diamond | 84.0% (multiple attempts) | 83.0% (single attempt pass@1) |
| Mathematics AIME 2025 | 86.7% (multiple attempts) | 83.0% (single attempt pass@1) |
| Code generation LiveCodeBench v5 | 70.4% (multiple attempts) | 75.6% (single attempt pass@1) |
| Code editing Aider Polyglot | 74.0% (pass@1) | 76.5% (pass@1) |
| Agentic coding SWE-bench Verified | 63.8% | 63.2% |
| Factuality SimpleQA | 52.9% | 50.8% |
| Visual reasoning MMMU | 81.7% (multiple attempts) | 79.6% (single attempt pass@1) |
| Image understanding Vibe-Eval (Reka) | 69.4% | 65.6% |
| Long Context MRCR (128k average) | 94.5% | 93.0% |
| Long Context MRCR (1M pointwise) | 83.1% | 82.9% |
| Multilingual Global MMLU (Lite) | 89.8% | 88.6% |
수치가 내려간 항목들은 그대로 읽으면 안 된다. single attempt pass@1 은 첫 번째 시도에서 정답을 맞히는 것이고, multiple attempts 는 여러 시도 중 하나라도 맞히거나 정해진 횟수 안에 성공하는 것이다. pass@1 은 일반적으로 multiple attempts 보다 달성하기 어려운 엄격한 지표이므로, 단순 수치 비교만으로 성능 저하를 단정하기는 어렵다.
또한 이번 버전에서는 비디오 이해를 평가하는 새 Video-MME 벤치마크에서 84.8% 를 기록하며 멀티모달 기능의 확장을 알렸다.
안정성과 가격
이전 버전에서 간혹 지적됐던 함수 호출(function calling) 관련 문제들도 이번 업데이트로 해결되어 더 안정적인 사용성을 제공한다고 알려졌다. 복잡한 워크플로 자동화와 애플리케이션 연동에서 더 신뢰도 높은 결과를 기대할 수 있다.
Preview 공개와 함께 토큰당 가격 정책(입력 $2.50/1M, 출력 $15.00/1M)이 제시된 점도 주목할 부분이다. 업계에서는 Gemini 가 경쟁 모델 대비 비용당 성능 측면에서도 상당한 우위 를 점하고 있다는 평가가 나온다.
이번 업데이트는 성능 수치를 넘어 실제 사용 환경에서의 효율성과 안정성을 크게 개선했다는 점에서 의미가 깊다.