Grok-3 — 6개월 간격으로 따라잡은 모델
xAI가 Grok-3를 공개했다. 2023년 11월 Grok-1 이후 15개월, 직전 모델로부터는 6개월 만에 챗봇 아레나 1400점을 처음 넘겼다.

xAI 가 Grok 의 차기 모델 Grok-3 와 Grok-3 mini 를 발표했다. 벤치마크로는 구글의 Gemini-thinking 과 OpenAI 의 o1 추론 모델을 넘어섰다.
눈에 띄는 것은 점수보다 간격 이다. xAI 는 2023년 11월 Grok-1 을 공개한 뒤 2024년 3월 Grok-1.5, 2024년 8월 Grok-2 beta 를 냈다. 그리고 6개월 만에 Grok-3 다. 상당히 빠른 시간에 놀라운 진전이 있었다.
Grok-3 는 발표 전 chocolate 라는 코드명으로 챗봇 아레나에 올라가, OpenAI o1 과 구글 Gemini 를 큰 격차로 제치고 1위를 차지했다. 1400점을 돌파한 최초의 모델 이며 모든 카테고리에서 1위였다.
벤치마크
수학, 과학, 코딩에서 매우 뛰어난 성능을 보이며 전반적으로 가장 우수한 모델로 평가됐다.
- Math (AIME’24) — 수학 문제 해결 능력
- Science (GPQA) — 과학 분야 문제 해결 능력
- Coding (LCB Oct-Feb) — LeetCode Biweekly Contest 기준 코딩 능력
추론 능력만이 아니라 테스트 시 계산 효율성까지 함께 본 “추론 + 테스트 시간 계산” 벤치마크에서도 Grok-3 Reasoning Beta 가 전반적으로 가장 우수했다. 이 점수는 정확도만이 아니라 속도와 효율성도 반영한다.
주요 특징
- 향상된 추론 능력 — 수학·과학·코딩 등 여러 분야에서 추론이 좋아졌다
- 창의성 — 기존 게임을 결합해 새 게임을 만드는 등 창의적인 해법을 낸다
- 일반화 능력 — 특정 벤치마크에 과적합되지 않고 새로운 문제에도 일반화한다
활용 사례
- 물리학 문제 해결 — 지구에서 화성으로, 다시 지구로 돌아오는 궤적을 계산하고 3D 애니메이션으로 시각화한다
- 게임 개발 — Tetris 와 Bejeweled 를 결합한 새 게임을 만든다
- Deep Search — 사용자의 의도를 파악하고 여러 웹사이트를 검색해 정확한 답을 주는 차세대 검색 엔진이다
사용과 향후 계획
Grok-3 는 Premium Plus 구독자에게 먼저 나가고, 곧 Super Grok 이라는 별도 구독도 나온다. 웹사이트와 iOS 앱에서 쓸 수 있으며 웹 버전이 가장 최신 기능을 제공한다.
xAI 는 음성 인터랙션과 대화 기억 기능을 추가할 예정이고, Grok-3 API 로 기업에서도 쓸 수 있게 지원할 계획이다. 또한 현재보다 5배 강력한 차세대 클러스터를 지어 기능을 계속 개선한다고 밝혔다.
영상