o1은 정말 달라졌는가 — 출시 며칠 뒤의 논쟁
o1 공개 직후 SNS에는 "그래서 GPT-4o와 뭐가 달라졌나"라는 물음이 쏟아졌다. 오간 근거들을 정리하고, 그중 하나가 왜 나를 멈춰 세웠는지 적었다.

o1 이 공개되고 며칠 지나지 않았는데, SNS 에는 벌써 같은 물음이 쏟아졌다. 그래서 o1 이 기존 GPT-4o 와 뭐가 달라졌는가. 출시 기사보다 그 뒤에 오간 근거들이 더 볼 만해서 정리해 둔다.
벤치마크 — 수학·코딩·과학
샘 알트만은 미국 수학올림피아드에 준하는 AIME(American Invitational Mathematics Examination) 점수를 트윗으로 알렸다. 기존 GPT-4o 가 13.4점, o1-preview 가 56.7점, o1 이 83.3점이다. 수학에서의 성능이 월등하게 올랐다는 뜻이다. 프로그래밍 쪽은 CodeForce 점수로, 과학·생물·물리·화학 쪽은 GPQA(Google-Proof Q&A)로 추론 능력이 크게 올랐음을 함께 알렸다.
샘 알트만이 공개한 AIME 점수, 본문 기준. 발표자가 직접 고른 시험이라는 점은 감안해서 읽어야 한다.
IQ 테스트 — 의심과 재검증
노르웨이 멘사 IQ 테스트에서도 o1 이 다른 LLM 보다 월등한 점수를 냈다는 결과가 나왔다. 기존 LLM 들은 100점을 넘지 못했는데, o1 은 인간 평균을 넘는 120점대를 기록했다.
이 결과에는 곧바로 의심이 붙었다. 이미 IQ 테스트 문제와 답안을 학습했을 것 이라는 우려다. 그래서 새 문제를 만들어 다시 테스트한 결과가 공개됐고, 거기서도 기존 LLM 들보다 훨씬 나은 성능이 나왔다. 100에 가까운 수치니 거의 인간 평균에 근접한 셈이다.
솔직히 IQ 테스트 결과만 봤을 때는 “뭐 그럴 수 있지” 하고 넘겼다. 공유해야겠다고 생각을 바꾼 것은 다음 트윗을 보고서다.
의사라는 직업에 대한 경고
이것은 의사로서의 경력을 고려하는 사람들에게 마지막 경고입니다: AI는 매우 발전하여 특히 표준 진단 및 일상적인 치료와 관련된 역할에서 인간 의사에 대한 수요가 크게 감소할 것이며, 점점 더 AI로 대체될 것입니다.
이는 어제 미리보기로 공개된 OpenAI의 o1 모델(일명 ‘스트로베리’ 모델)의 대대적인 성능 도약에 의해 강조됩니다. 이 모델은 특수 의료 데이터 세트(AgentClinic-MedQA)에서 매우 우수한 성능을 보이며 GPT-4o를 크게 능가합니다. 복잡한 의료 정보를 처리하고, 정확한 진단을 제공하고, 의학적 조언을 제공하고, 치료를 추천하는 AI의 빠른 발전은 가속화될 것입니다.
질병 진단, 의료 영상 해석, 치료 계획 수립과 같은 의료 업무는 곧 인간 의사보다 더 빠르고 일관성 있는 AI 시스템으로 처리될 것입니다. 향후 몇 년 동안 의료 환경이 진화함에 따라 필요한 의사의 수가 급격히 줄어들고 AI 지원 의료 시스템에 더 많이 의존하게 될 것입니다.
인간의 공감, 비판적 사고, 의사 결정은 의학의 특정 영역에서 여전히 중요한 역할을 할 것이지만, 이마저도 향후 o1과 같은 모델의 반복으로 대체될 수 있습니다.
결과적으로 의학은 수술, 응급 의학 및 기타 중재 전문 분야와 같이 중재에 중점을 둔 분야를 전문으로 하지 않는 한 차세대 의사들에게 덜 매력적인 진로가 되고 있지만, 이들 역시 결국 로봇 시스템에 추월당할 수 있습니다. 아마도 10년 정도 안에 그럴 것입니다.
그래서 무엇이 바뀌는가
o1 같은 AI 의 발전이 우리 삶을 어떻게 바꾸게 될까.
나는 ChatGPT 가 나왔을 때, GPT-4 가 출시되었을 때, GPT-4 가 멀티모달을 들고 나왔을 때, Gemini 가 200만 토큰 처리를 공개했을 때, GPT-4o 로 실시간 대화가 가능해졌을 때, Claude 가 프롬프트 생성기를 냈을 때 매번 놀랐다. 그럼에도 잘 되지 않던 문제들이 있었는데, 이번 o1 이 그것을 풀어내는 것을 보면서 또 놀라고 있다.
샘 알트만의 말처럼 이제 시작인 거라면 어쩌지 하는 생각도 든다.
참고
- Massive Breakthrough in AI Intelligence — 노르웨이 멘사 IQ 테스트 결과