GPT-4.1 시리즈 — 100만 토큰과 코딩
OpenAI가 API 전용으로 GPT-4.1 세 모델을 냈다. 컨텍스트가 100만 토큰으로 늘었고, SWE-bench 점수는 GPT-4o 대비 21.4%p 올랐다.

2025년 4월 14일, OpenAI 가 API 로 새 모델 세 가지(GPT-4.1, GPT-4.1 mini, GPT-4.1 nano)를 냈다. 코딩과 지시 사항 수행에서 큰 발전을 보이며, 기존 GPT-4o 및 GPT-4o mini 보다 전반적으로 향상된 성능을 낸다.
이번 릴리스에서 눈여겨볼 것은 둘이다. 컨텍스트가 100만 토큰으로 늘었다는 것, 그리고 코딩 성능이 확실히 올랐다는 것.
주요 특징
- 향상된 성능 — 코딩, 지시 사항 준수, 장문 맥락 이해가 강화됐다
- 확장된 컨텍스트 창 — 최대 100만 토큰(기존 12만 8천 토큰 대비 증가)
- 최신 정보 — 지식 마감일이 2024년 6월로 갱신됐다
- 비용 효율성 — 이전 모델 대비 개선된 가격과 지연 시간
모델별 특징
- GPT-4.1 — 코딩 및 복잡한 작업에서 최고 성능
- GPT-4.1 mini — 소형 모델 중 성능 도약. GPT-4o 와 비슷하거나 더 나은 성능을 더 낮은 비용과 지연 시간으로 낸다
- GPT-4.1 nano — 가장 빠르고 저렴하다. 100만 토큰 컨텍스트를 지원하며 분류·자동 완성처럼 속도가 중요한 작업에 이상적이다
추론 시스템 효율 개선으로 가격이 전반적으로 내려갔다. GPT-4.1 은 일반적인 쿼리에서 GPT-4o 보다 26% 저렴하고, 프롬프트 캐싱 할인율은 기존 50%에서 75%로 올랐다. 장문 맥락 요청에 대한 추가 비용은 없다. Batch API 를 쓰면 추가 50% 할인이 적용된다.
코딩 능력
SWE-bench Verified 에서 GPT-4.1 은 54.6% 를 기록했다. GPT-4o 대비 21.4%p, GPT-4.5 대비 26.6%p 높다. 코드 저장소 탐색, 작업 완료, 테스트 통과 코드 생성 능력이 올랐다는 뜻이다.
Aider 다국어 비교 벤치마크 에서는 GPT-4o 보다 2배 이상 높은 점수를 냈다. 코드 변경 시 diff 형식을 안정적으로 따르는 능력이 개선되어, 전체 파일을 다시 쓰는 대신 바뀐 부분만 처리해 비용과 지연을 아낄 수 있다.
전체 파일 재작성을 선호하는 개발자를 위해 출력 토큰 한도가 32,768개로 늘었다(GPT-4o 는 16,384개).
프론트엔드 코딩에서는 더 기능적이고 미적으로 만족스러운 웹 앱 제작 능력이 올랐다(인간 평가자 선호도 80% 이상).
실제 적용 사례로 Windsurf 는 내부 코딩 벤치마크에서 GPT-4o 대비 60% 높은 점수와 도구 호출 효율 30% 향상을 얻었고, Qodo 는 GitHub 풀 리퀘스트 코드 리뷰 생성 테스트에서 55% 의 경우 더 나은 제안을 만들었다.
지시 사항 준수
특정 형식 따르기, 부정 지침 준수, 순서 지침 이행, 콘텐츠 요구사항 충족 등 여러 차원에서 성능이 올랐다. 특히 어려운 프롬프트에서 GPT-4o 대비 큰 개선을 보였다.
- Scale MultiChallenge — 대화의 이전 맥락을 파악하는 능력을 재는 벤치마크에서 38.3% 로 GPT-4o 보다 10.5%p 높다
- IFEval — 검증 가능한 지침(콘텐츠 길이, 특정 용어 제외 등) 준수에서 87.4% 로 GPT-4o(81.0%)보다 낫다
Blue J 는 복잡한 세무 시나리오 내부 벤치마크에서 GPT-4o 대비 53% 더 정확했고, Hex 는 SQL 평가 세트에서 지시 이행 및 의미 이해가 약 2배 향상됐다.
100만 토큰 장문 맥락
GPT-4.1, mini, nano 모두 최대 100만 토큰을 처리한다. 대규모 코드베이스나 여러 개의 긴 문서를 다루는 데 유용하다.
- Needle in a Haystack — 100만 토큰 안 어느 위치에 있든 숨겨진 정보를 일관되고 정확하게 찾는다
- OpenAI-MRCR(신규 공개 평가) — 맥락 속에 숨겨진 여러 정보를 찾고 구분하는 능력을 본다. 최대 128k 토큰에서 GPT-4o 보다 우수하며 1M 토큰까지 성능을 유지한다
- Graphwalks(신규 공개 평가) — 여러 논리적 단계를 거치는 추론을 본다. 61.7% 정확도로 GPT-4o 를 크게 앞선다
지연 시간도 개선됐다. GPT-4.1 nano 는 128k 입력 토큰에서 5초 이내에 첫 토큰을 반환한다.
Thomson Reuters 는 법률 AI 비서 CoCounsel 테스트에서 다중 문서 검토 정확도가 17% 올랐고, Carlyle 은 여러 긴 문서(PDF, Excel 등)에서 재무 데이터 추출 성능이 50% 향상돼 기존 장문 맥락 처리의 한계를 넘었다.
비전
GPT-4.1 제품군은 뛰어난 이미지 이해 능력을 갖췄고, 특히 GPT-4.1 mini 는 이미지 벤치마크(MMMU, MathVista 등)에서 GPT-4o 를 능가한다.
자막 없는 긴 영상을 다루는 Video-MME 에서는 30~60분 길이 영상 기반 질문 답변에 72.0% 정확도를 달성해 GPT-4o(65.3%)보다 나은 최첨단 성능을 보였다.
GPT-4.5 Preview 지원 종료
GPT-4.1 출시와 함께, 연구용 프리뷰로 도입됐던 GPT-4.5 Preview 는 2025년 7월 14일에 지원이 끝난다. 개발자들이 전환할 수 있도록 3개월이 주어진다.
남는 생각
- 이제는 100만 컨텍스트의 시대
- 캐싱 비용 인하(50% → 75%) — 마진의 영역인데 굳이 왜 줄였을까
- GPT-4.5 나름 잘 쓰고 있었는데 실패인가
- GPT-4.1 mini 가격이 더 낮았더라면…
더 보기