Ai Models

Llama 4 — Scout, Maverick, Behemoth의 역할 분담

메타가 Llama 4를 공개했다. 세 모델이 각각 긴 컨텍스트, 균형, 교사 역할을 맡고, 처음으로 네이티브 멀티모달과 MoE를 채택했다.

겹쳐 찍힌 판본들로 세대 교체를 나타낸 추상 도판
AI 생성

메타가 Llama 생태계의 새로운 세대인 Llama 4 를 공개했다.

Llama 4 시리즈는 오픈 가중치 모델인 ScoutMaverick, 그리고 아직 훈련 중인 가장 강력한 모델 Behemoth 의 미리보기로 구성된다. 메타 최초로 네이티브 멀티모달 기능과 Mixture-of-Experts(MoE) 아키텍처를 채택한 것이 특징이다.

세 모델은 같은 계열이지만 맡은 자리가 다르다. Scout 은 긴 컨텍스트를, Maverick 은 성능과 비용의 균형을, Behemoth 는 앞의 둘을 가르치는 교사 역할을 한다.

Llama 4 모델 라인업 소개

Llama 4 Scout — 1천만 토큰

170억 개의 활성 파라미터와 16개의 전문가로 총 1,090억(109B) 파라미터를 갖는다. 동급 최고의 텍스트·시각 지능을 제공하며 단일 NVIDIA H100 GPU 에서도 실행 가능하다.

업계 최고 수준인 1천만 토큰의 컨텍스트 창 을 지원해, 방대한 문서 분석과 요약, 긴 사용자 활동 기반 개인화, 광범위한 코드베이스 추론에 매우 강하다.

Gemma 3, Gemini 2.0 Flash-Lite, Mistral 3.1 등 이전 세대 및 경쟁 모델을 넘어서는 성능을 보인다. 이미지 내 특정 영역과 사용자 프롬프트를 연결하는 이미지 그라운딩 능력도 뛰어나다.

Llama 4 Maverick — 균형

170억 개의 활성 파라미터와 128개의 전문가로 총 4,000억(400B) 파라미터를 갖는다. 현재 공개된 Llama 모델 중 가장 강력한 오픈소스 멀티모달 모델이다.

지능·비용·속도 사이의 최적 균형을 이루며 뛰어난 이미지·텍스트 이해를 제공한다. 정교한 AI 애플리케이션 구축, 정확한 이미지 이해, 창의적인 글쓰기에 적합하다.

GPT-4o 및 Gemini 2.0 Flash 를 코딩·추론·다국어·긴 컨텍스트·이미지 벤치마크에서 능가한다. 특히 추론과 코딩에서는 훨씬 적은 활성 파라미터로 DeepSeek v3 와 비슷한 결과를 냈다. 실험적인 챗 버전은 LMArena 에서 1417 ELO 를 기록했다.

Llama 4 Behemoth — 교사 (미리보기)

2,880억 개의 활성 파라미터와 16개의 전문가로 총 약 2조(2T) 파라미터를 갖는 메타의 가장 강력한 모델이다. 지금도 훈련이 진행 중이다.

Behemoth 의 역할은 출시가 아니다. Scout 과 Maverick 의 성능을 끌어올리기 위한 ‘교사 모델’ 로 증류(distillation) 학습에 쓰였다.

GPT-4.5, Claude Sonnet 3.7, Gemini 2.0 Pro 같은 세계 최고 수준 모델들을 여러 STEM 벤치마크에서 능가한다.

벤치마크

Llama 4 벤치마크 비교표

Scout 은 이미지·코딩·추론·긴 컨텍스트 전반에서 Gemini 2.0 Flash-Lite, Gemma 3, Mistral 3.1 보다 우수하다.

Maverick 은 특히 이미지 처리와 다국어에서 강하고 추론 비용도 경쟁력이 있다. 코딩과 일부 추론에서는 DeepSeek 과 비슷하거나 약간 낮지만, 전반적으로 Gemini 2.0 Flash 및 GPT-4o 보다 낫다.

Behemoth 는 최상위급 모델들과 비교해도 코딩·추론·다국어·이미지 추론에서 매우 강력하며, 특히 MATH-500 점수가 95.0 으로 매우 높다.

주요 기술 혁신

네이티브 멀티모달. 텍스트와 시각(이미지, 비디오 프레임) 토큰을 초기 단계에서 융합(Early Fusion)해 통합된 모델 백본에서 처리한다. 덕분에 대규모 텍스트·이미지·비디오 데이터로 공동 사전 훈련이 가능해졌다.

Mixture-of-Experts(MoE). 단일 토큰이 전체 파라미터의 일부만 활성화한다. 훈련과 추론에서 컴퓨팅 효율이 높고 같은 연산 예산으로 더 높은 품질을 낸다. Maverick 은 128개의 라우팅 전문가와 공유 전문가를 쓴다.

향상된 훈련 기법. 새 하이퍼파라미터 설정 기법(MetaP), FP8 정밀도 활용(Behemoth 훈련 시 32K GPU 에서 390 TFLOPs/GPU 달성), 30조 개 이상의 토큰(Llama 3 의 두 배 이상)과 200개 언어 데이터를 쓴 사전 훈련이 적용됐다. 유연성을 강화한 완전 비동기 온라인 RL 학습 프레임워크를 개발해 학습 효율이 이전 세대 대비 약 10배 올랐다.

개선된 후처리 파이프라인. 경량 지도 미세조정(SFT) → 온라인 강화학습(RL) → 경량 직접 선호도 최적화(DPO) 순으로 진행된다. 특히 어려운 프롬프트에 집중하고 지속적인 온라인 RL 전략을 써서 추론·코딩·수학 능력을 크게 높였다.

초장문 컨텍스트(Scout). 특수 데이터셋을 활용한 중간 훈련과 위치 임베딩 없는 인터리브 어텐션 레이어(iRoPE 아키텍처) 등으로 1천만 토큰 컨텍스트를 달성했다.

안전성과 편향성

메타는 개발 전 과정에 안전 장치를 넣고 편향을 줄이려 했다.

안전 도구 — Llama Guard(입출력 안전 필터), Prompt Guard(악성 프롬프트 탐지), CyberSecEval(사이버 보안 위험 평가)을 오픈소스로 제공한다.

테스트 강화 — 자동화된 적대적 테스트 도구 GOAT(Generative Offensive Agent Testing)를 개발해 취약점 탐지 효율을 높였다.

편향성 감소 — 논쟁적인 정치·사회적 주제에 대한 거부율이 크게 낮아졌다(Llama 3.3 의 7% → Llama 4 의 2% 미만). 특정 관점에 치우치지 않고 균형 잡힌 응답을 하도록 개선됐다. 정치적 편향성은 Grok 과 비슷한 수준이며 Llama 3.3 의 절반이다.

시작하기

Scout 과 Maverick 은 llama.com 과 Hugging Face 에서 내려받을 수 있다. WhatsApp, Messenger, Instagram Direct, Meta.AI 웹사이트에서 Llama 4 기반 Meta AI 를 바로 써 볼 수도 있다. 곧 AWS, Google Cloud, Microsoft Azure 등 주요 클라우드 파트너를 통해서도 제공될 예정이다.

더 보기

참고 — Llama 출시 이력

  • 2024.09.26 Llama 3.2 (1B, 3B, 11B, 90B)
  • 2024.07.23 Llama 3.1 (8B, 70B, 405B)
  • 2024.04.19 Llama 3 (8B, 70B)
  • 2023.07.18 Llama 2 (7B, 13B, 70B)