Claude 품질 저하 논란 — 앤트로픽이 밝힌 세 가지 원인
어떤 사용자는 심각한 성능 저하를 겪고 어떤 사용자는 아무렇지 않았다. 그 혼란스러운 체감의 원인이 세 가지 인프라 버그였다는 앤트로픽의 사후 분석을 정리했다.

최근 유튜버와 개발자 커뮤니티를 중심으로 Claude의 코드 생성과 응답 품질이 떨어졌다는 목소리가 높아졌다. “GPT-5를 쓰는 Codex CLI가 더 낫다”는 평가까지 나오며 모델 자체의 성능 저하가 아니냐는 우려가 제기됐다.
이에 대해 앤트로픽이 2025년 9월 17일 공식 블로그로 상세한 기술 보고서를 냈다. “수요, 시간대, 서버 부하로 인해 모델 품질을 저하시키지 않는다”고 명확히 밝히면서, 최근의 품질 저하는 전적으로 세 가지 복합적인 인프라 버그 때문이었다고 설명했다.
혼란스러운 체감이 먼저였다
8월 초부터 사용자들은 Claude의 응답 품질이 간헐적으로 나빠진다고 보고하기 시작했다. 처음에는 일반적인 피드백과 구분하기 어려웠으나, 8월 말부터 보고 빈도가 급증하면서 본격적인 조사가 시작됐다.
문제는 일부 사용자에게는 심각한 성능 저하가 나타나는데 다른 사용자들은 아무 문제를 겪지 않았다는 점이다. 혼란스럽고 모순된 보고가 이어졌고, 원인 파악은 더 어려워졌다.
원인 1. 컨텍스트 창 라우팅 오류
발생 시점: 8월 5일
일부 단문 요청이 곧 출시될 1M 토큰 컨텍스트 창을 처리하도록 구성된 서버로 잘못 보내졌다. 처음에는 Sonnet 4 요청의 0.8%에만 영향을 줬지만, 8월 29일 일상적인 로드 밸런싱 변경으로 잘못 라우팅되는 트래픽이 최대 16%까지 급증했다.
특히 ‘고정적(sticky)’ 라우팅 방식 때문에 특정 사용자에게 더 큰 영향이 갔다. 한 번 잘못된 서버로 처리되면 이후 요청도 계속 같은 서버로 갈 가능성이 높았기 때문이다. 그래서 일부 사용자는 지속적인 응답 품질 저하를 겪었다.
원인 2. 출력 손상
발생 시점: 8월 25일
TPU 서버에 배포된 잘못된 구성 때문에 토큰 생성 과정에서 오류가 생겼다. 모델이 문맥상 거의 나오지 않아야 할 토큰에 높은 확률을 할당하는 현상이 나타났다.
그래서 영어로 물었는데 응답 중간에 태국어(“สวัสดี”)나 중국어 문자가 튀어나오거나, 코드 생성에서 명백한 구문 오류가 섞이는 일이 벌어졌다.
원인 3. 컴파일러 오류 (Approximate Top-k XLA:TPU Miscompilation)
발생 시점: 8월 25일
모델이 다음 단어를 고르는 방식을 개선하는 코드를 배포하는 과정에서, TPU의 XLA 컴파일러에 잠재해 있던 버그가 촉발됐다. 이 버그는 모델이 가장 확률 높은 토큰을 근사치로 찾는 과정(Approximate Top-k)에서 때때로 완전히 잘못된 결과를 내게 만들었다.
주로 Claude Haiku 3.5에 영향을 줬고, Sonnet 4와 Opus 3의 일부 요청에도 영향을 줬을 것으로 추정된다. 특정 배치 크기와 모델 구성에서만 비일관적으로 발생해 재현과 진단이 매우 까다로웠다.
왜 늦게 발견됐나
- 중첩된 버그 — 세 버그가 서로 다른 시점에 생기고 겹치면서 단일 원인을 특정하기 어려운 복합 증상을 만들었다
- 기존 평가의 한계 — 내부 벤치마크와 평가 시스템이 사용자들이 겪은 간헐적이고 미묘한 저하를 제대로 잡아내지 못했다
- 엄격한 개인정보 보호 정책 — 엔지니어가 사용자 상호작용 데이터에 접근하는 것이 엄격히 제한돼 있다. 그래서 버그를 유발한 특정 프롬프트나 상호작용을 조사하고 재현하기 어려웠다
해결과 개선 계획
세 버그는 모두 해결됐고, 재발 방지를 위해 다음을 시행 중이라고 밝혔다.
- 더 민감한 평가 시스템 — 미묘한 품질 저하도 감지할 수 있는 정교한 지표를 개발하고 계속 개선한다
- 실시간 운영 시스템 평가 — 테스트 환경뿐 아니라 실제 운영 중인 시스템에서도 품질 평가를 상시 진행한다
- 빠른 디버깅 도구 — 개인정보를 침해하지 않으면서 커뮤니티 피드백을 효과적으로 분석하고 디버깅할 내부 도구와 인프라를 만든다
남는 것
이번 보고서는 최근의 품질 논란이 모델 자체의 근본적 성능 문제가 아니라 복잡하게 얽힌 인프라 버그로 인한 일시적 현상이었음을 분명히 보여 준다.
특히 인상적인 점은 기술적으로 복잡하고 민감할 수 있는 내부 문제의 원인과 해결 과정을 코드 조각까지 공개하며 투명하게 설명했다는 것이다. 사용자와의 신뢰를 회복하고 기술적 리더십을 보이려는 노력으로 보인다.
앤트로픽은 정확한 문제 파악에 구체적인 사례를 담은 사용자 피드백이 결정적이었다고 강조했다. 이번 일은 대규모 언어 모델의 안정적인 운영이 얼마나 어려운 과제인지 보여 주는 동시에, 문제가 생겼을 때 투명한 소통과 커뮤니티와의 협력이 얼마나 중요한지를 다시 일깨워 주는 계기가 될 것 같다.