Ai Models

OpenAI o1 프리뷰 — 대답하기 전에 생각하는 모델

프롬프트 잘 쓰는 법에 늘 등장하던 "Think step by step"이 모델 안으로 들어갔다. OpenAI가 강화학습으로 추론을 훈련시킨 o1 프리뷰를 공개했다.

같은 기준선 위에 밀도가 다른 두 계열을 나란히 둔 추상 도판
AI 생성

“Think Step by Step.”

기억나시는지. 프롬프트 잘 쓰는 법에 항상 등장하던 그 말이다. 사용자가 문장으로 붙여 주던 그 지시가 이번에는 모델 훈련 쪽으로 들어갔다. 수학 능력이 크게 올랐다던 스트로베리가 드디어 모습을 드러냈다.

OpenAI 가 새 모델 o1 을 냈다. 복잡한 추론을 하도록 강화학습으로 훈련한 LLM 이다. o1 은 대답하기 전에 생각한다. 사용자에게 응답하기 전에 긴 내부 추론 과정(CoT, Chain-of-Thought)을 거쳐 답을 만든다. 사람이 그러듯 반응하기 전에 문제를 생각하는 데 시간을 더 쓰도록 훈련시킨 것이다. 모델은 훈련을 거치며 사고 과정을 개선하고, 여러 전략을 시도하고, 실수를 알아차리는 법을 배운다.

OpenAI o1 프리뷰 소개 화면

두 가지가 함께 나왔다.

  • o1-preview — 세계에 대한 폭넓은 일반 지식을 써서 어려운 문제를 추론하도록 설계된 o1 의 초기 미리보기다.
  • o1-mini — 더 빠르고 저렴한 버전. 폭넓은 일반 지식이 필요 없는 코딩·수학·과학 작업에 특히 맞는다.

다만 o1 은 추론에서 크게 앞서 나갔을 뿐, 모든 사용 사례에서 GPT-4o 를 대체하도록 설계된 모델은 아니다.

암호 풀기 — GPT-4o 는 못 풀고 o1 은 풀었다

OpenAI 가 든 예시 중 하나가 치환 암호다. 아래 대응 관계를 예제로 주고, 같은 방식으로 새 문장을 풀라고 시킨다.

oyfjdnisdr rtqwainr acxz mynzbhhx  ->  Think Step by Step

풀어 보세요:
oyekaijzdf aaptcg suaokybhai ouow aqht mynznvaatzacdfoulxxz

GPT-4o 는 실패했다. 단어를 어떻게 나눌 수 있을지까지는 갔지만, 거기서 멈추고 되물었다. “의미 있는 해독을 하려면 변환 규칙에 대한 맥락이 더 필요합니다. 추가 해독 규칙을 알려 줄 수 있습니까?”

o1-preview 는 규칙 자체를 찾아냈다. 글자를 두 개씩 짝짓고, 각 글자를 알파벳 순서의 숫자로 바꾸고(A=1 … Z=26), 짝의 합을 2로 나눈 평균을 다시 글자로 되돌리는 방식이다.

oy → (15+25)/2 = 20 → T
ek → (5+11)/2  = 8  → H
ai → (1+9)/2   = 5  → E
jz → (10+26)/2 = 18 → R
df → (4+6)/2   = 5  → E
                     THERE

이 계산을 여섯 단어에 그대로 반복해 나온 답이 이것이다.

THERE ARE THREE R’S IN STRAWBERRY

o1 의 암호 해독 응답 화면

성능

이 모델들은 과학적 추론에 뛰어나다. 경쟁 프로그래밍 문제(Codeforces)에서 상위 89번째 그룹에 들었고, 미국 수학 올림피아드 예선(AIME)에서 미국 상위 500명 학생과 비슷한 성과를 냈다. 물리·생물·화학 문제(GPQA)에서는 박사급 인간 정확도를 넘어섰다. 까다로운 추론 벤치마크에서 GPT-4o 보다 크게 올라간 결과다.

o1 과 GPT-4o 의 추론 벤치마크 비교 그래프

ChatGPT 에서 쓰기

ChatGPT Plus 와 Team 사용자는 오늘부터 순차적으로 o1 모델에 접근할 수 있다. 모델은 수동으로 고른다. 다만 주 단위 사용량 제한이 있다 — o1-preview 는 30번, o1-mini 는 50번. 당분간은 아껴 써야 할 것 같다.

API 로 쓰기

API 는 5단계에 해당하는 계정에만 열린다. 20 RPM 의 속도 제한으로 프로토타입을 시작할 수 있다.

단, o1 시리즈 API 에는 Function Calling, 스트리밍, 시스템 메시지 지원이 들어 있지 않다. 그리고 추론 토큰이라는 개념이 새로 추가된다. 자세한 것은 추론 모델 사용 가이드에 있다.

o1 이 강한 자리

o1 시리즈는 복잡하고 미묘한 문제 공간에서 특히 낫다.

  • 복잡한 코드 생성 — 개발자를 돕는 알고리즘 생성과 고급 코딩 작업
  • 고급 문제 해결 — 포괄적인 브레인스토밍, 여러 면이 얽힌 문제 풀이
  • 복잡한 문서 비교 — 계약서·사건 파일·법률 문서를 분석해 미묘한 차이를 짚어내는 일
  • 지시사항 준수와 워크플로 관리 — 특히 짧은 맥락이 필요한 워크플로

더 보기