GPT-4o 이미지 생성 — 예쁜 그림에서 쓸모 있는 그림으로
GPT-4o의 이미지 생성이 달라진 지점은 화질이 아니라 텍스트다. 이미지 안의 글자가 정확해지면서 로고, 다이어그램, UI 시안이 만들어지기 시작했다.

OpenAI 의 이미지 생성이 또 한 번 앞으로 나갔다. GPT-4o 에 탑재된 새 이미지 생성 기능은 단순히 예쁘고 멋진 이미지를 넘어, 정확하고 실용적인 비주얼 커뮤니케이션 도구 로 진화했다.
텍스트가 정확해지면 쓸모가 달라진다
사람들은 오래전 동굴 벽화부터 현대의 인포그래픽까지 이미지로 정보를 전달하고 설득하고 분석해 왔다. 하지만 지금까지의 생성 모델은 주로 판타지나 예술적인 이미지에 강했다. GPT-4o 는 여기서 한 발 더 나간다. 로고, 다이어그램, UI 시안 같은 현실적인 이미지를 정확하게 만들 수 있게 되었다.
- 텍스트 정확도 — 이미지 안에 들어가는 글자도 정밀하게 구현된다
- 문맥 이해 — 대화형 AI 답게 대화 중 올린 이미지나 이전 내용도 고려해 이미지를 만든다
- 정확한 프롬프트 이해 — 최대 20개 객체까지 속성과 관계를 유지하며 생성한다
향상된 모델 능력
GPT-4o 의 이미지 생성은 단순한 생성이 아니다. 이미지와 텍스트의 관계뿐 아니라 이미지들 사이의 관계도 학습했다. 덕분에 더 자연스럽고 일관성 있는 비주얼을 만든다.
- 멀티턴 이미지 생성 — 게임 캐릭터처럼 점차 수정해 나가야 할 이미지도 대화로 자연스럽게 업데이트한다
- 포토리얼리즘과 스타일 — 다양한 스타일로 만들 수 있고 현실감 넘치는 비주얼도 된다
- 비주얼 커뮤니케이션 강화 — 간단한 텍스트 삽입만으로도 의미 전달이 훨씬 쉬워진다
남은 과제들
아직 완벽하지는 않다.
- 긴 포스터 이미지가 너무 타이트하게 잘리는 현상
- 저해상도에서의 디테일 표현 어려움
- 비라틴 문자(한글, 아랍어 등) 텍스트가 정확하지 않을 수 있음
- 이미지 일부만 수정하려 할 때 전체가 바뀌거나 오류가 생기는 문제
다만 이미 대부분의 이슈에 대해 개선 작업이 진행 중이라고 한다.
안전 장치
OpenAI 는 이미지 생성의 자유와 안전 사이에서 균형을 잡기 위해 여러 조치를 넣었다.
- C2PA 메타데이터 — 생성 이미지에 GPT-4o 출처를 명시한다
- 내부 이미지 확인 도구 — 이미지가 모델에서 생성되었는지 확인할 수 있다
- 콘텐츠 필터링 — 불법적이거나 유해한 콘텐츠는 차단한다
- 딥러닝 기반 정책 판단 모델 — 사람의 정책 기준을 모델에 학습시켰다
사용 방법과 출시 정보
지금 바로 ChatGPT 에서 GPT-4o 로 이미지 생성을 써 볼 수 있다.
- Plus, Pro, Team, Free 사용자 — 지금 바로 사용 가능
- Enterprise, Edu — 곧 도입 예정
- 개발자 API — 몇 주 안에 이미지 생성 API 오픈 예정
사용법은 간단하다. 대화하듯 이미지를 요청하면 된다. 예를 들어 “배경은 투명하고 #FF5733 색상의 로고 만들어줘” 같은 식이다. 단, 퀄리티가 높은 만큼 생성에 최대 1분 정도 걸릴 수 있다.
링크
- Introducing 4o Image Generation — 샘플 이미지와 프롬프트를 볼 수 있다
- 라이브 영상 (한글자막)
- OpenAI 엔지니어들의 인터뷰 영상 모음 (한글자막)