Ai Models

PaperBench — AI가 논문을 재현할 수 있는가

AI 에이전트가 논문을 읽고, 코드를 처음부터 짜고, 결과를 재현할 수 있는가. OpenAI가 그 질문에 답하려고 만든 벤치마크를 공개했다.

겹쳐 찍힌 판본들로 세대 교체를 나타낸 추상 도판
AI 생성

AI 분야는 눈부신 속도로 발전하고 있다. 하지만 AI 에이전트 스스로가 이 발전에 얼마나 기여할 수 있을까. 복잡한 연구 논문을 이해하고, 필요한 코드를 처음부터 쓰고, 결과를 재현할 수 있을까.

바로 이 질문에 답하기 위해 설계된 새 벤치마크가 PaperBench 다.

PaperBench 소개 이미지

PaperBench 란

최첨단 AI 연구 논문을 재현하는 에이전트의 능력을 평가하는 도구 모음이다. ICML 2024 에서 발표된 스포트라이트 및 구두 발표 논문 20편을 대상으로 하며, 심층 강화 학습·견고성·대규모 언어 모델 등 여러 주제를 다룬다.

특별한 점은 세 가지다.

  • 에이전트는 질문에 답하는 것이 아니라 논문을 이해하고, 작동하는 코드베이스를 개발하고, 결과를 재현하는 실험을 수행해야 한다
  • 각 논문에는 원저자와 함께 만든 상세하고 계층적인 평가 기준(rubric)이 붙는다. 이 기준은 복잡한 재현 작업을 총 8,316개의 구체적이고 채점 가능한 하위 작업 으로 쪼갠다
  • 에이전트는 원저자의 코드에 접근하는 것이 명시적으로 금지된다. 독립적으로 재현 코드베이스를 지어야 한다

다만 에이전트가 코드에 접근할 수 없었더라도, 이론적으로 그 코드가 훈련 세트에 있을 수 있다는 점은 인정하고 있다.

어떻게 작동하나

nanoevalalcatraz 라는 도구로 조정되는 3단계 프로세스다.

1. 에이전트 실행(Agent Rollout) — 에이전트가 논문을 받아 컨테이너 환경(Docker 등)에서 작동하며, 논문 재현을 목표로 하는 코드베이스를 만든다.

2. 재현(Reproduction) — 제출된 코드베이스를 새 컨테이너(종종 GPU 접근 가능)로 옮겨 reproduce.sh 스크립트로 실행한다. 코드가 실제로 돌고 주장된 결과를 내는지 확인하는 단계다.

3. 채점(Grading) — 자동화된 LLM 기반 “심사위원(judge)” 이 실행 결과를 논문의 평가 기준에 따라 매긴다. 코드 개발 품질, 실행 성공 여부, 실험 결과가 원 논문과 일치하는지를 본다. 최종 결과는 “재현 점수(Replication Score)” 로 나온다.

PaperBench Code-Dev

전체 평가는 GPU 와 상당한 실행 시간을 요구해 리소스가 많이 든다. 그래서 코드 개발에만 집중하는 경량 버전도 함께 나왔다.

  • 계산 비용이 큰 재현 단계를 건너뛴다
  • 심사위원은 평가 기준의 “코드 개발” 요구사항만 본다
  • 비용이 크게 줄고 GPU 가 필요 없어져 접근성이 높아진다

전체 벤치마크보다 덜 포괄적이지만, 에이전트가 연구 개념을 이해하고 코드로 구현하는 능력을 재는 가치 있고 저렴한 방법이다.

측정 결과

여러 최첨단 모델을 대상으로 ICML 2024 논문 20편의 재현 능력을 평가했다.

최고 성능 모델 은 오픈소스 기반 보조 코드(scaffolding)와 함께 쓰인 Claude 3.5 Sonnet (New) 이었다. 이 에이전트가 달성한 평균 재현 점수는 21.0% 다.

모델별 재현 점수 비교

인간 기준선과 비교하기 위해 최고 수준의 머신러닝 박사과정 학생들을 모집해 일부 과제를 수행하게 했다. 그 결과, 현재까지 테스트된 AI 모델들은 아직 숙련된 인간 연구원의 재현 능력을 넘지 못했다.

기본 에이전트인 BasicAgent 에서 “조기 종료” 기능을 없애고 작업을 나눠 순차적으로 풀게 유도하는 방식으로 다시 수행한 결과도 함께 공개됐다.

아쉽게도 Claude 3.7 Sonnet 과 Gemini 2.5 Pro 는 벤치마크를 수행할 수 없었다고 한다.

“우리는 또한 Claude 3.7 Sonnet 을 평가하고 싶었지만 Anthropic API 의 속도 제한으로 인해 실험을 완료할 수 없었습니다.”

Gemini 2.5 Pro API 도 매우 적은 호출 제한을 제공 중이다.

의미

PaperBench 는 AI 가 단순 작업을 넘어 실제 과학 연구라는 복잡하고 창의적인 영역에서 얼마나 능력을 발휘하는지를 측정한다. 지금까지는 사람이 논문을 읽고 구현했지만, 앞으로는 AI 가 논문을 읽고 직접 구현해서 재현성 검증까지 맡을 수 있을 것으로 보이는 벤치마크라는 점에서 의미가 있어 보인다.

더 보기