GPQA-Diamond는 무엇을 재는 벤치마크인가
모델 발표마다 등장하는 GPQA-Diamond가 무엇을 재는지 정리했다. 핵심은 검색으로는 풀리지 않는 문제만 골라 놓았다는 점이다.

GPQA-Diamond 는 LLM 의 고급 추론과 문제 해결 능력을 평가하려고 설계된 GPQA(Graduate-Level Google-Proof Q&A Benchmark)의 하위 집합이다. 생물학·물리학·화학의 고난도 문제로 구성되며, 전문가 수준의 이해와 다단계 추론을 요구한다.
GPQA 전체는 448개의 객관식 문제이고, 그중 가장 어려운 198개가 GPQA-Diamond 에 들어 있다.
이름에 붙은 “Google-proof” 가 핵심이다. 단순한 정보 검색으로는 풀기 어렵고, 복잡한 과학적 개념을 이해하고 적용해야 답할 수 있는 문제들만 골라 놓았다는 뜻이다.
이런 특성 때문에 GPQA-Diamond 는 LLM 의 고급 추론 능력을 재는 중요한 도구로 쓰인다. GPT-4 모델이 39% 정확도를 기록한 이후, 이후 모델들의 성능이 꾸준히 오르고 있다.