AI가 해킹하는 시대, 통제되지 않은 격차
영국 AISI가 클로드 미소스의 사이버 역량 평가 결과를 발표했다. 32단계 기업 네트워크 공격 시뮬레이션을 처음부터 끝까지 완수한 최초의 모델. 다만 방어가 약한 환경이라는 단서가 붙는다.

영국 인공지능보안연구소(AISI)가 클로드 미소스의 사이버역량에 대한 평가결과를 발표했네요. 이들의 평가에 따르면, Claude Mythos Preview는 사이버 역량이 이미 새로운 임계점에 도달한 모델이라고 합니다.
영국 AISI는 이 모델이 기존 프런티어 모델들을 넘어, 32단계로 구성된 기업 네트워크 공격 시뮬레이션 “The Last Ones”를 처음부터 끝까지 완수한 최초의 모델이라고 평가했습니다. 특히 Mythos는 취약점 탐지나 개별 CTF 풀이를 넘어, 초기 정찰부터 내부 이동, 권한 상승, 최종 네트워크 장악까지 이어지는 다단계 공격 체인을 자율적으로 수행할 수 있음을 보여줬다고 밝혔습니다.
다만 AISI는 이런 결과가 방어가 약하고 취약한 환경에서 네트워크 접근권이 주어진 조건에서 나온 것임을 분명히 하면서, 아직 잘 방어된 실제 환경까지 동일하게 공략할 수 있다고 단정할 수는 없다고 평가했습니다. 그럼에도 “AI가 약한 기업 시스템은 자율적으로 침해할 수 있는 단계에 진입했다”는 점은 분명한 경고라고 보았습니다.
두 개의 그래프가 보여주는 것
아래 그래프 중 첫번째 고난도 CTF 성능 추세 그래프는 2023년까지만 해도 모델들이 초급 과제도 겨우 수행하던 수준에서, 2026년 Mythos Preview에 이르러서는 전문가 수준 문제에서 약 73% 성공률까지 올라서며 급격한 성능 도약을 보여주고 있습니다.
그리고 두번째 “The Last Ones” 단계별 수행 그래프에서는 Mythos가 32단계 중 평균 22단계를 완료해, 차점인 Claude Opus 4.6의 평균 16단계를 뚜렷하게 앞섰고, 10번 시도 중 3번은 전체 공격 체인을 끝까지 완수했습니다. 즉 Mythos가 단순히 취약점을 더 잘 찾는 수준이 아니라 토큰을 더 투입할수록 실제 공격 작전을 점점 더 길고 깊게 수행하는 방향으로 확장되고 있다는 것을 보여준다는 것입니다.
출처: https://www.aisi.gov.uk/blog/our-evaluation-of-claude-mythos-previews-cyber-capabilities
Gallery



원문 보기
<<AI가 해킹하는 시대, 통제되지 않은 격차: 클로드 미소스가 던진 보안 패러다임 전환>>
영국 인공지능보안연구소(AISI)가 클로드 미소스의 사이버역량에 대한 평가결과를 발표했네요. 이들의 평가에 따르면, Claude Mythos Preview는 사이버 역량이 이미 새로운 임계점에 도달한 모델이라고 합니다. 영국 AISI는 이 모델이 기존 프런티어 모델들을 넘어, 32단계로 구성된 기업 네트워크 공격 시뮬레이션 “The Last Ones”를 처음부터 끝까지 완수한 최초의 모델이라고 평가했습니다. 특히 Mythos는 취약점 탐지나 개별 CTF 풀이를 넘어, 초기 정찰부터 내부 이동, 권한 상승, 최종 네트워크 장악까지 이어지는 다단계 공격 체인을 자율적으로 수행할 수 있음을 보여줬다고 밝혔습니다. 다만 AISI는 이런 결과가 방어가 약하고 취약한 환경에서 네트워크 접근권이 주어진 조건에서 나온 것임을 분명히 하면서, 아직 잘 방어된 실제 환경까지 동일하게 공략할 수 있다고 단정할 수는 없다고 평가했습니다. 그럼에도 “AI가 약한 기업 시스템은 자율적으로 침해할 수 있는 단계에 진입했다”는 점은 분명한 경고라고 보았습니다.
아래 그래프 중 첫번째 고난도 CTF 성능 추세 그래프는 2023년까지만 해도 모델들이 초급 과제도 겨우 수행하던 수준에서, 2026년 Mythos Preview에 이르서는 전문가 수준 문제에서 약 73% 성공률까지 올라서며 급격한 성능 도약을 보여주고 있습니다. 그리고 두번째 “The Last Ones” 단계별 수행 그래프에서는 Mythos가 32단계 중 평균 22단계를 완료해, 차점인 Claude Opus 4.6의 평균 16단계를 뚜렷하게 앞섰고, 10번 시도 중 3번은 전체 공격 체인을 끝까지 완수했습니다. 즉 Mythos가 단순히 취약점을 더 잘 찾는 수준이 아니라 토큰을 더 투입할수록 실제 공격 작전을 점점 더 길고 깊게 수행하는 방향으로 확장되고 있다는 것을 보여준다는 것입니다.
*출처: https://www.aisi.gov.uk/blog/our-evaluation-of-claude-mythos-previews-cyber-capabilities
Source
이 글은 페이스북 게시물을 옮겨 재편집한 것이다. 위 「원문 보기」에 수집 당시의 전문이 그대로 있다.
페이스북 원문 게시물post id 26554553757489727