Ai Models

o3-mini — DeepSeek R1 직후에 나온 무료 추론 모델

DeepSeek가 R1을 공개하며 판을 흔든 직후, OpenAI가 o3-mini를 냈다. 비용을 낮추고 무료 사용자에게까지 추론 모델을 열었다.

겹쳐 찍힌 판본들로 세대 교체를 나타낸 추상 도판
AI 생성

2025년 1월 31일, OpenAI 가 새 추론 모델 o3-mini 를 냈다. o3 는 지난 크리스마스 전 12Days 행사 마지막 날에 발표했던 그 모델이다.

이 출시는 혼자 놓고 보기 어렵다. 최근 중국 AI 스타트업 DeepSeek 가 R1 추론 모델을 공개하면서 경쟁이 훨씬 치열해졌다. DeepSeek 의 오픈소스 접근은 대중의 관심을 끌었고 시장 가치에도 큰 영향을 미쳤다. 그 직후에 나온 o3-mini 는 비용 효율성, 향상된 안전 기능, 높은 추론 성능 으로 경쟁 우위를 지키려 한다. 더 넓은 컨텍스트 윈도우와 복잡한 STEM 작업에서의 정확도가 R1 과의 차별점이다.

당초 비용에 대한 우려가 있었는데, 효율화를 통해 추가 요금 없이 무료 사용자에게 o3-mini 를, Plus·Team 구독자에게 o3-mini-high 를 제공한다.

o3-mini 소개 화면

무엇이 달라졌나

고급 추론 능력. o3 는 답하기 전에 문제를 단계별로 분석하며 ’생각’하는 과정을 거친다. 이 내부 추론 덕분에 ARC-AGI, GPQA Diamond 같은 복잡한 추론 테스트에서 o1 보다 월등히 높은 점수를 냈고, 일부 평가에서는 87.7% 에 달했다. 주요 오류 발생률은 약 39% 줄었다.

효율성과 속도. o1-mini 대비 응답이 24% 빠르다. 컨텍스트 윈도우는 200,000 토큰, 출력은 100,000 토큰까지다. 다만 구글의 Gemini 2.0 Flash Thinking 처럼 더 큰 컨텍스트를 주는 경쟁 모델과는 차이가 있다.

비용. o1-mini 대비 약 63% 저렴하고, 전체 o1 대비로는 93% 까지 절감된다. 추론 능력이 올라가고 지연이 줄었는데도 이 절감이 유지된다는 점이 수요가 몰릴 때 특히 중요하다.

기존 o1-mini 는 100만 토큰당 입력 $3, 출력 $12 였는데 거의 1/3 수준으로 조정됐다. o3-mini 는 성능이 더 좋아졌는데도 o1-mini 와 같은 가격에 API 를 제공한다. 추론 모델은 추론 과정에서 추론 토큰이 추가로 발생하고, 이것이 출력 토큰 가격으로 청구된다.

통합과 검색. ChatGPT 에 통합되어 무료 사용자와 Plus·Team·Pro 사용자 모두 쓸 수 있다. 기존 o1 과 달리 최신 정보와 관련 웹 소스를 검색해 답할 수 있다.

개발자 기능. 함수 호출, 구조화된 출력, 배치 API 를 지원한다. 추론 강도는 low·medium·high 세 가지로, 작업에 따라 속도와 정확도의 균형을 조정할 수 있다. high 는 추론 과정에서 토큰을 더 많이 만들어 느려지는 대신 더 완전한 추론 결과를 준다.

안전성 강화. ‘신중한 정렬(deliberative alignment)’ 기법을 도입했다. 모델이 응답을 만들기 전에 인간이 작성한 안전 가이드라인을 스스로 검토하게 해서, 조작이나 탈옥 시도를 막는다.

성능

o3-mini 벤치마크 비교 그래프
  • 수학 — AIME 같은 어려운 평가에서 o1 과 비슷하고, 높은 추론 강도에서는 o1 과 o1-mini 를 앞선다
  • 과학 — 박사 수준 과학 질문 평가에서 낮은 추론 노력으로도 o1-mini 보다 높고, 높은 강도에서는 o1 수준에 이른다
  • 코딩 — 코드포스 경쟁 프로그래밍 평가에서 추론 노력이 커질수록 Elo 가 오르고, 중간 노력으로 o1 과 비슷하다. SWE-bench 검증 평가에서는 가장 높은 성능을 기록했다
  • 일반 지식 — o1-mini 보다 낫다
  • 속도 — o1-mini 보다 24% 빠르고 평균 응답 시간은 7.7초. 첫 토큰까지 걸리는 시간은 2500ms 더 빠르다
  • 오류 감소 — 전문가 테스트에서 o1-mini 보다 56% 더 선호됐고, 어려운 실제 문제에서 주요 오류가 39% 줄었다

어떻게 쓰나

  • ChatGPT — Plus·Team·Pro 사용자는 즉시, Enterprise 사용자는 1주일 후부터 쓸 수 있다. 무료 사용자도 메시지 작성기에서 ‘Reason’ 을 선택하거나 응답을 재생성해 써 볼 수 있다
  • API — Chat Completions API, Assistants API, Batch API 로 쓴다
  • 추론 수준 선택 — 낮음·중간·높음 중에서 골라 성능과 속도를 맞춘다
  • 사용 제한 — Pro 는 무제한, Plus 와 Team 은 o1-mini 대비 3배 제한이 적용된다. 주당 150건에 해당한다

안전성 평가

시스템 카드에 실린 안전 메커니즘은 네 가지다. 유해한 훈련 데이터를 걸러 내고 개인 식별 정보 입력 필터를 쓰는 사전 학습 완화, 답변 전에 안전 사양을 명시적으로 추론하게 하는 신중한 정렬, 시스템·개발자·사용자 메시지의 우선순위를 명확히 해 가드레일 우회를 막는 지시 계층, 그리고 사이버 보안 위협·영향력 작전·극단주의·정치적 활동에 대한 지속적인 모니터링 이다.

평가 결과는 이렇다.

  • 금지된 콘텐츠 — 유해 콘텐츠 요청 거부에서 GPT-4o 와 비슷하고, 더 어려운 거부 평가에서는 o1-mini 와 마찬가지로 훨씬 높다
  • 탈옥 — 알려진 공격에 대한 저항력이 o1-mini 와 비슷하고 GPT-4o 보다 낫다
  • 환각 — PersonQA 평가에서 환각률이 낮고 정확도가 높아 GPT-4o·o1-mini 와 비슷하거나 더 낫다
  • 편향 — 명시적 차별 과제에서 가장 적은 편향을 보였고, 암묵적 차별 과제에서는 중간 정도였다
  • 외부 레드팀 — o1 과 비슷한 수준이었고, 두 모델 모두 GPT-4o 보다 안전성이 높았다

더 보기