GPT-Realtime — 음성 품질이 열어 주는 응용들
전사·언어·음성 모델을 따로 쓰지 않고 오디오를 통째로 다루는 음성-대-음성 모델이 나왔다. 고객 지원, 교육, 의료 같은 자리에 자연스러운 음성 경험을 붙일 수 있게 됐다.

인간 수준의 음성 품질로 대화하고 들을 수 있는 AI 에이전트를 만드는 데 중요한 진전이 있었다. OpenAI가 새 음성 모델 GPT-Realtime과 개선된 Realtime API를 개발자들에게 열었다. 고객 지원, 교육, 의료 같은 자리에 자연스러운 음성 경험을 붙일 수 있게 된 것이다.
하나의 모델로 오디오를 다룬다
새 모델은 오디오를 기본적으로 이해하고 생성하는 ‘음성-대-음성’ 모델이다. 전사·언어·음성 모델을 따로 쓰는 기존 아키텍처와는 다른 접근이다. 이 통합이 만드는 차이는 셋이다.
- 속도 — 하나의 모델로 작동하기 때문에 빠르다
- 뉘앙스 — 웃음이나 한숨 같은 비언어적 신호를 이해한다
- 표현력 — 넓은 감정을 표현하며, 문장 중간에 언어를 전환할 수 있다
고객 지원과 학업 지도 같은 실제 시나리오에 중점을 두고, 프로덕션 음성 앱을 만드는 고객들과 긴밀히 협력해 개발했다. 훈련에는 높은 품질의 음성 데이터와 특화된 보상 모델이 결합돼 자연스러움을 보장한다. 또한 개발자가 속도·어조·스타일을 조정하거나 역할극을 맡기는 등 모델을 훨씬 쉽게 제어할 수 있도록 지시 따르기에 중점을 뒀다.
새로 되는 것
- 감정 범위 — 실망감이나 흥분 같은 감정을 전달한다
- 다국어 — 영어·스페인어·일본어 같은 언어를 한 문장 안에서 매끄럽게 전환한다
- 지시 따르기 — 특정 지시를 잘 지킨다. 사용자가 시도해도 설정된 한도 이상의 환불을 거부하는 고객 서비스 시나리오에서 일관된 모습을 보였다
- 이미지 입력 — Realtime API가 이미지 입력을 지원해, 사진 속 작은 세부를 “보고” 설명하며 조언까지 준다
함수 호출도 개선돼 올바른 함수를 부르고 정확한 인수를 넘길 시점을 더 똑똑하게 판단한다.
벤치마크
Big Bench Audio 평가에서 **82.8%**의 정확도를 기록해, 2024년 12월 이전 모델의 65.6%를 넘어섰다.
Realtime API 업데이트
저지연 음성 애플리케이션 플랫폼인 Realtime API는 대기 시간과 안정성이 상당히 개선됐다. 정식 출시와 함께 추가된 기능은 다음과 같다.
- 이미지 입력
- EU 데이터 상주
- 비동기식 함수 호출
- 향상된 컨텍스트 관리
- SIP 전화 통신 지원 — 고객 지원 같은 전화 기반 음성 애플리케이션 구축이 간소화된다
- MCP 지원 — 플러그형 기능을 더해 모델이 사용자를 대신해 행동할 수 있게 한다
적용 사례 — T-Mobile
T-Mobile은 전화기 업그레이드 사용 사례를 이 모델로 구현한 경험을 공유했다. 고객들에게 흔하지만 혼란스러운 경험이기에 이 사례를 골랐다고 한다.
팀은 새 모델이 고객과 함께하며 여러 질문에 대한 “무작위적 경로”를 따라갈 수 있어 “훨씬 더 인간적으로” 느껴진다고 했다. 또 이 기술은 점진적인 개선보다 기존 프로세스를 완전히 재구상하는 데 써야 진정한 힘을 낸다고 강조했다. T-Mobile에게 이 AI는 훌륭한 서비스와 로봇 같은 음성 비서 사이의 절충점을 깨고, 고객 주머니 속의 ‘인간 수준’ 전문가를 제공하는 데 도움이 된다.
비용
오디오 입력 100만 토큰당 $32(캐시된 입력은 $0.40), 오디오 출력 100만 토큰당 $64다. gpt-4o-realtime-preview 대비 20% 저렴하다. 또 개발자가 지능형 토큰 제한을 걸고 여러 턴을 한꺼번에 줄일 수 있도록 대화 맥락에 대한 세부 제어가 추가돼, 장시간 세션의 비용을 크게 아낄 수 있게 됐다.