이 문서는 harness-engineering-survey-2026.md 의 가독성 개선판이며 내용 축약 없음

Harness Engineering 서베이: 2026년 5~7월 최신 연구 동향

작성: Harness Survey 에이전트 팀 (paper-scout ×3 → paper-analyst → citation-verifier → survey-synthesizer)
조사 기간: 2026년 5월 1일 ~ 7월 1일 (작성 시점 2026-07-01)
검증 원칙: 본문에 인용된 모든 arXiv 논문은 arXiv 공식 API(raw Atom XML)로 실존·제목·제출일을 독립 대조했고, 모든 블로그·기술 리포트는 HTTP 상태로 실존을 확인했다. 검증(CONFIRMED)을 통과한 자료만 본문에 인용한다. 세부 검증 결과는 _workspace/03_verification/verdicts.md 참조.

읽기 안내: 이 문서에서 하네스는 모델을 에이전트로 작동하게 하는 실행 계층이다. 컨텍스트는 모델이 현재 판단에 참고하는 입력·기록·상태의 묶음이다. 트레이스는 에이전트가 관찰하고, 생각하고, 툴을 호출하고, 검증한 실행 기록이다. 벤치마크는 성능·안전·프로세스 품질을 재는 평가 장치로 읽으면 된다.

요약 (Executive Summary)

2026년 5~7월은 "harness engineering(하네스 엔지니어링)" 이라는 용어가 산업 현장의 구호(2026년 2월 OpenAI가 대중화)에서 하나의 독립된 연구 주제군으로 학술적으로 결정화(crystallize)된 분기점이다. 이 서베이는 라이브 검색으로 발굴하고 arXiv API로 실존을 교차 검증한 95편의 arXiv 논문(범위 내 86편 + 배경 9편)과 18건의 산업 1차 자료를 대상으로 한다.

관통하는 단 하나의 명제는 다음과 같다:

"에이전트 성능의 병목은 대체로 모델 크기가 아니라 하네스 설계에 있다" — 그리고 이 명제가 2026년 여름 문헌 전반에서 정의(무엇이 하네스인가), 측정(하네스가 점수를 얼마나 좌우하는가), 자동화(하네스를 스스로 진화시킬 수 있는가), 거버넌스(하네스가 안전을 강제하는가)의 네 갈래로 분화하고 있다.

핵심 관찰 6가지:

  1. 정의의 결정화. "agent harness"의 다의성을 필요·충분조건으로 규정하려는 시도(2606.10106)와, 하네스를 6책임(2606.20683)·11책임(2605.13357)·범주론(2605.12239)으로 분해하려는 경쟁적 분류 프레임이 동시 등장했다. 아직 표준 분류 어휘는 없다.
  2. "harness > model size" 명제의 정량 확증. 동일 모델이 하네스(adapter) 설계만으로 Pass@1 19.1%→73.4%(2606.12344), 강한 모델도 최선/최악 하네스 간 최대 6배 격차(2606.19613)가 실측됐다.
  3. 자기진화 하네스의 부상. 하네스를 정적 산출물이 아니라 트레이스로부터 스스로 개선하는 대상으로 보는 계열(Self-Harness, HarnessX, HarnessFix, RHO, APEX 등)이 이 시기의 가장 큰 클러스터다.
  4. 컨텍스트 관리가 "안전-critical 계층"으로 재규정. 컨텍스트 압축이 안전 제약을 조용히 삭제하는 "Governance Decay"(2606.22528)와 계획이 지속되지 않는 문제(2606.22953)가 하네스 실패의 새 표면으로 드러났다.
  5. 평가의 재정의. 벤치마크가 모델·하네스·환경을 하나의 점수로 뭉뚱그린다는 비판(2606.17799)과, 이를 분리 측정하려는 벤치마크(Claw-SWE-Bench, StaminaBench, ADK Arena, RigorBench 등)가 쏟아졌다.
  6. 거버넌스·OS 레벨 강제의 대두. 툴콜 가드레일을 넘어 OS 커널(eBPF)에서 정책을 강제하거나(2606.25189), 권한/인가를 실행 훅으로 결정론적으로 처리해야 한다는(2606.21856, 2606.28679) 흐름이 형성됐다.

커버리지의 정직한 한계 (§2 참조): 이 조사는 이 환경에서 WebSearch가 비활성이라 arXiv API + 특정 기업 블로그 직접 조회에 의존했다. arXiv 사전출판에 편중되어 있고(동료심사 게재 여부 미확인), Semantic Scholar/OpenReview/ACL은 접근 제약으로 충분히 커버하지 못했다. Meta/FAIR의 1차 자료는 이 기간 발견되지 않았다. 따라서 이 서베이는 "이 기간 하네스 엔지니어링 문헌의 완전한 census"가 아니라 "arXiv를 중심으로 실존 검증된 대표 표본"이다.


1. 서론 — 하네스 엔지니어링이란

Harness(하네스) 는 언어 모델을 감싸 그것을 "환경 위에서 행동하는 에이전트"로 바꾸는 계층이다 — 프롬프트, 툴, 메모리, 컨텍스트 관리, 제어 흐름(agent loop), 관측성, 검증, 권한을 아우른다. 2606.10106(What makes a harness a harness)은 이 용어의 계보를 말의 마구(horse's tack) → 소프트웨어 테스트 하네스 → ML 평가 하네스 → 에이전트 하네스로 추적하며, 현재 이 단어가 (a) 제품 전체(Claude Code, Codex CLI), (b) 평가 스캐폴드(SWE-bench harness), (c) framework·SDK·IDE 플러그인·orchestrator와 혼용되는 다의적(polysemous) 상태임을 지적한다.

왜 지금인가. 세 가지 힘이 수렴했다.

2606.20683(From Question Answering to Task Completion)은 이 전환을 에이전트 엔지니어링의 4패러다임 계보로 정식화한다:

prompt engineering → workflows & context engineering → harness engineering → agent-native training with co-evolution

이 서베이는 "harness engineering"을 세 번째 패러다임으로 놓되, 2026년 여름 문헌이 이미 네 번째(모델-하네스 공진화)로 넘어가고 있음을 보인다.


2. 조사 방법과 커버리지

검색 전략(팬아웃). 3개 축의 paper-scout를 병렬 실행했다: (축1) 학술 arXiv/Semantic Scholar/OpenReview/ACL, (축2) 산업 랩 블로그·기술 리포트·벤치마크, (축3) 인접 주제(컨텍스트 엔지니어링·메모리·멀티에이전트·자기개선·RL). 각 축은 "agent harness", "harness engineering", "agent scaffolding", "context engineering", "tool orchestration", "agentic framework", "coding agent", "agent memory", "multi-agent orchestration", "evaluation harness" 등 동의어 클러스터를 기간 한정어(2605/2606/2607)와 조합해 순회했다.

환경 제약(정직 고지). 이 실행 환경에서 WebSearch 툴이 비활성이었다. scout들은 대신 (a) arXiv 공식 API(export.arxiv.org/api/query)를 라이브 검색 채널로, (b) DuckDuckGo HTML 엔드포인트를, (c) 개별 페이지 WebFetch를 사용했다. 이 때문에 커버리지가 arXiv 사전출판에 편중된다. Semantic Scholar/OpenReview/ACL Anthology는 별도 접근이 제한적이었고, 동료심사 게재 여부는 미확인이다.

검증(적대적 게이트). 대상 논문이 모두 지식 컷오프 이후에 나왔으므로 환각 인용이 최대 위험이다. 이를 막기 위해:

커버리지 규모. 본문 인용 대상 = arXiv 86편(범위 내) + 산업 1차 자료 11건(범위 내). 이 서베이는 완전한 census가 아니라 실존 검증된 대표 표본이며, 특히 arXiv 편중과 Meta 자료 부재를 한계로 명시한다.

분석 근거. 모든 논문 분석은 arXiv API로 취득한 실제 초록 전문(_workspace/02_analysis/abstracts.md)을 1차 근거로 한다. 초록에서 확인되지 않는 세부 수치는 단정하지 않았다.


3. 택소노미 — 연구 지형

미리 정한 틀이 아니라, 검증된 논문들이 실제로 무엇을 다루는지에서 분류를 귀납했다. 앵커는 2606.20683의 6개 런타임 책임(observation·context·control·action·state·verification)이며, 이 축 위에 2026년 여름 문헌의 주제 클러스터를 배치한다.

#테마핵심 질문대표 논문(범위 내)
T1정의·이론·택소노미무엇이 하네스이고, 어떤 축으로 분해되는가?2606.10106, 2606.20683, 2605.13357, 2605.12239, 2605.18747, 2605.15221, 2605.12129, 2605.02092, 2606.03461, 2606.29116
T2자기진화·자동 하네스하네스를 스스로 개선/진화시킬 수 있는가?2606.09498, 2606.14249, 2606.15363, 2606.06324, 2606.05922, 2605.09998, 2605.27276, 2606.07412, 2606.17546, 2606.26859, 2606.27492, 2604.21003
T3컨텍스트 엔지니어링·관리유한한 윈도우에서 무엇을 남기고 버리는가?2606.10209, 2606.22953, 2606.22528, 2606.30005, 2605.30785, 2606.17016, 2606.31564, 2605.01920, 2605.23296, 2605.05400, 2605.08435
T4평가·벤치마크·모델vs하네스 분리하네스가 점수를 얼마나 좌우하며 어떻게 측정하는가?2606.17799, 2606.12344, 2606.19613, 2606.05548, 2606.22678, 2606.13608, 2606.08960, 2606.17454, 2606.07889, 2606.11686, 2606.07462
T5에이전트 메모리·상태세션을 넘는 상태를 어떻게 저장·검색·망각하는가?2606.24775, 2606.06448, 2606.24535, 2606.19409, 2606.15903, 2606.29914, 2606.28434
T6멀티에이전트 오케스트레이션여러 에이전트를 어떻게 조율·위임·통신시키는가?2606.13598, 2605.14483, 2606.08878, 2606.13733, 2606.31174, 2606.25514, 2605.10052, 2606.30546
T7툴 오케스트레이션·재귀·인터페이스툴 호출·서브에이전트·재귀를 어떻게 조직하는가?2605.30738, 2606.16591, 2606.30317, 2606.13643, 2606.15874, 2606.14832, 2606.14066, 2606.28436
T8안전·거버넌스·OS레벨 강제하네스가 권한·안전을 어떻게 강제하는가?2606.25189, 2606.23449, 2606.21856, 2606.28679
T9모델-하네스 공진화·RL하네스와 모델 학습을 어떻게 결합하는가?2606.25447, 2605.24220, 2605.21516, 2606.08610, 2605.27276(교차)
T10응용·산업 시스템 하네스특정 도메인에서 하네스가 어떻게 구현되는가?2606.27243, 2606.21005, 2606.27188, 2606.24598, 2606.09682, NORA(2605.02092)
여러 테마에 걸치는 논문은 주 테마에 배치하고 교차 언급한다. 예: 2606.06324(HarnessFix)는 T2(자기진화)에 두되 T1(하네스 책임 분류 ETCLOVG)과 교차한다.

각 테마의 산업 1차 자료 매핑은 §4-K에 별도로 정리한다.


4. 논문별 상세 분석

인용 형식: 제목 — (저자 대표, YYYY-MM, [arXiv ID](링크)). 모든 수치는 arXiv 초록에서 확인된 것이며, 초록에 없는 값은 단정하지 않는다.

읽기용 형식: 아래 논문 항목은 원문 내용을 줄이지 않고 서지, 무엇을 다루나, 어떻게/구성, 결과·수치, 한계·의의/교차로 나눠 읽기 쉽게 재배치했다. 수치, arXiv ID, 링크, 검증 관련 표현은 원문 문자열을 보존했다.

4-A. T1 — 정의·이론·택소노미

읽기 맥락: 이 절은 하네스라는 단어의 경계와 분해 어휘를 정리한다. 서로 다른 분류 체계가 경쟁한다는 점을 염두에 두면 뒤 절의 논문들이 더 잘 이어진다.

이 클러스터는 "하네스란 무엇인가"를 정면으로 다룬다. 2026년 여름의 가장 인상적인 사실은, 이 질문에 경쟁적으로 답하는 논문이 한 달 안에 다수 등장했다는 점 자체다.

What makes a harness a harness: necessary and sufficient conditions for an agent harness

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents

Harness Engineering as Categorical Architecture

Code as Agent Harness

It's Not the Size: Harness Design Determines Operational Stability in Small Language Models

Effective Harness Engineering for Algorithm Discovery with Coding Agents

What Makes Interaction Trajectories Effective for Training Terminal Agents?

Characterizing LLM Agentic Workflows: A Study on N8n Ecosystem

T1 공통 관점: (1) 하네스는 새로운 1급 시민이 됐으나 정의가 아직 불안정하다. (2) "하네스가 성능을 결정한다"가 관통 명제이며, scaffold collapse·비단조성이 그 경계 조건을 제공한다. (3) 분해 어휘가 6책임/11책임/3계층/범주론으로 제각각이라 표준화가 남은 과제다.

4-B. T2 — 자기진화·자동 하네스 (이 시기 최대 클러스터)

읽기 맥락: 이 절은 하네스를 사람이 한 번 설계해 고정하는 물건이 아니라, 실행 기록을 보고 스스로 고치는 대상으로 본다. 핵심은 개선과 회귀 방지를 동시에 다루는 방식이다.

하네스를 손으로 만드는 정적 산출물이 아니라, 실행 트레이스로부터 스스로 진단·수정·진화하는 대상으로 보는 계열. 배경 논문 2604.25850(AHE, 관측성 3기둥으로 편집을 falsifiable 계약화)이 이 계보의 직접 선행이며, "factual 하네스 구조는 전이되나 prose 전략은 전이 안 됨"이라는 발견을 남겼다.

Self-Harness: Harnesses That Improve Themselves

HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry

APEX: Adaptive Principle EXtraction — A Three-Layer Self-Evolution Framework

From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws (HarnessFix)

Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference (RHO)

Continual Harness: Online Adaptation for Self-Improving Foundation Agents

SIA: Self Improving AI with Harness & Weight Updates

Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills

SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

AgentX / Harness Evolution layer (SGPO)

QueenBee Planner: Skill-Evolving Communication Topologies

The Last Harness You'll Ever Build

T2 공통 관점: (1) 진화 신호원이 다양화됨 — 정답 검증셋(전통) → 과거 트레이스 self-preference(RHO) → success-trace distillation(APEX) → 모델 가중치 공동갱신(SIA). (2) 회귀 방지·falsification이 공통 안전장치 — Self-Harness의 regression testing, QueenBee의 acceptance gate, AHE의 falsifiable 계약. "요행을 정책으로 굳히지 않기"가 반복 모티프. (3) 진화 대상이 프롬프트 한 축에서 하네스·원칙·토폴로지·가중치의 다축 공진화로 확장 중.

4-C. T3 — 컨텍스트 엔지니어링·관리

읽기 맥락: 이 절은 제한된 컨텍스트 창에서 무엇을 유지하고 압축하고 버릴지 다룬다. 단순 비용 절감이 아니라 계획 유지와 안전 제약 보존까지 포함한다.

6책임 중 context 축. 2026년 여름의 전환점은 컨텍스트 관리가 "효율 최적화"에서 "안전-critical·load-bearing 계층" 으로 재규정된 것이다.

Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using Agents

Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents

Governance Decay: How Context Compaction Silently Erases Safety Constraints

LLM Agents Are Latent Context Managers: VISTA

Learning Agent-Compatible Context Management (AdaCoM)

TokenPilot: Cache-Efficient Context Management

ACE: Pluggable Adaptive Context Elasticizer across Agents

A Language for Describing Agentic LLM Contexts (ACDL)

Parallel Context Compaction for Long-Horizon LLM Agent Serving

Mise en Place for Agentic Coding: Deliberate Preparation as Context Engineering

A Dataset of Agentic AI Coding Tool Configurations

T3 공통 관점: (1) 컨텍스트 관리가 효율 문제에서 안전·신뢰성 문제로 승격(Governance Decay, Plans Don't Persist). (2) 설계 축이 "무엇을 버리나"에서 "가역적으로 무엇을 노출하나"로 이동(VISTA·ACE의 복구 가능 아카이브). (3) 캐시 연속성이 새 제약으로 부상(TokenPilot). (4) 형식화·표준화 시도(ACDL) 등장.

4-D. T4 — 평가·벤치마크·모델vs하네스 분리

읽기 맥락: 이 절은 점수가 모델만의 결과인지, 하네스와 환경까지 섞인 결과인지 분리하려는 흐름을 다룬다. 정확도뿐 아니라 지속성, 프로세스 규율, 평가 하네스 자체의 견고성도 함께 본다.

6책임 중 verification 축이 메타 레벨로 확장. 관통 주제: 벤치마크가 모델·하네스·환경을 분리 측정해야 한다.

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

Claw-SWE-Bench: Evaluating OpenClaw-style Agent Harnesses

StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns

ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer

RigorBench: Benchmarking Engineering Process Discipline

AgentBeats: Agentifying Agent Assessment

Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops

Dissecting model behavior through agent trajectories

Strained Coherence: A Pre-Failure Signal in Coding Agent Trajectories

Layer-Isolated Evaluation: No-LLM, Regression-Locked Test Harness

Act As a Real Researcher (AARRI-Bench)

T4 공통 관점: (1) 모델/하네스/환경 분리 측정이 대세(Position paper의 선언 → Claw-SWE-Bench·SSA의 정량화). (2) 평가 축이 "정확도"에서 stamina(StaminaBench)·process discipline(RigorBench)·reliability로 다변화. (3) 평가 하네스 자체가 공격 대상(hacker-fixer)이자 지역화 대상(layer-isolated). (4) 반복 확인되는 수치: 하네스 선택이 모델 선택만큼(때로 그 이상) 점수를 움직인다.

4-E. T5 — 에이전트 메모리·상태

읽기 맥락: 이 절은 세션을 넘는 기억과 런타임 상태를 다룬다. 검색 성능뿐 아니라 무엇을 잊어야 하는지, 공유 메모리를 어떻게 통제해야 하는지가 중심이다.

6책임 중 state 축. 이 시기 메모리 연구의 특징은 평가·시스템 관점의 성숙(무엇이 실제로 측정되는가에 대한 회의)이다.

Are We Ready For An Agent-Native Memory System?

Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads

Governed Shared Memory for Multi-Agent LLM Systems (MemClaw)

OpenRath: Session-Centered Runtime State for Agent Systems

Control-Plane Placement Shapes Forgetting

MemDelta: Controlled Baselines and Hidden Confounds in Agent Memory Evaluation

SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents

T5 공통 관점: (1) 메모리 연구가 "더 나은 검색"에서 "무엇을 실제 측정하나"(평가 회의: MemDelta)"무엇을 잊나"(forgetting: Control-Plane) 로 성숙. (2) 시스템·데이터관리 관점 대두(Agent Memory characterization, Are We Ready). (3) 멀티에이전트 공유 메모리 거버넌스가 프로덕션 문제로(MemClaw). (4) recall 편중 벤치의 한계 공통 지적.

4-F. T6 — 멀티에이전트 오케스트레이션

읽기 맥락: 이 절은 여러 에이전트를 어떻게 나누고, 연결하고, 권한을 부여할지 다룬다. 더 많은 에이전트가 항상 낫다는 가정보다 구조와 정보 병목이 더 중요하다는 흐름이 반복된다.

Reward Modeling for Multi-Agent Orchestration (OrchRM)

LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual RL

PerspectiveGap: A Benchmark for Multi-Agent Orchestration Prompting

How Task Structure Limits Multi-Agent Success

ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows

Unlocking Model Potentials Through Adaptive Multi-Agent Scaffolding (icat-agent)

Swarm Skills: A Portable, Self-Evolving Multi-Agent System Specification

MAS-Lab: A Specification-Driven Validation Framework

T6 공통 관점: (1) 오케스트레이션 자체가 학습·보상 모델링 대상(OrchRM·LEMON). (2) 멀티에이전트에 근본 한계가 있음이 이론(정보병목)·평가(PerspectiveGap 14.9%, ClawArena 권한병목)로 드러남 — "무조건 에이전트를 늘리면 낫다"는 가정 반박. (3) 오케스트레이션을 이식 가능·검증 가능한 명세로 만들려는 시도(Swarm Skills·MAS-Lab).

4-G. T7 — 툴 오케스트레이션·재귀·인터페이스

읽기 맥락: 이 절은 에이전트가 어떤 툴을 언제 어떻게 쓰게 할지, 그리고 서브에이전트나 재귀 하네스를 어떻게 조직할지 다룬다. 행동 표면이 코드에서 GUI·CLI·외부 툴로 넓어진다는 점이 중요하다.

6책임 중 action·observation 축.

Recursive Agent Harnesses (RAH)

MAVEN: Improving Generalization in Agentic Tool Calling

SING: Synthetic Intention Graph for Scalable Active Tool Discovery

LLM-as-Code: Agentic Programming for Agent Harness

PhoneHarness: Mixed GUI, CLI, and Tool Actions

FastContext: Training Efficient Repository Explorer for Coding Agents

Dockerless: Environment-Free Program Verifier for Coding Agents

T7 공통 관점: (1) 서브에이전트 분리가 반복 패턴 — 탐색(FastContext)·재귀 하네스(RAH)로 컨텍스트를 격리. (2) 툴 스케일 문제(SING)와 control-flow 주도권 논쟁(LLM-as-Code)이 부상. (3) action surface가 단일(코드)에서 혼합(GUI+CLI+tool)으로 확장(PhoneHarness).

4-H. T8 — 안전·거버넌스·OS레벨 강제

읽기 맥락: 이 절은 안전과 권한을 프롬프트 지침이 아니라 실행 계층에서 강제하려는 연구를 묶는다. 공통 방향은 결정론적 훅, per-call 인가, OS 레벨 정책 강제다.

ActPlane: Programmable OS-Level Policy Enforcement for Agent Harnesses

AOHP: Android Open Harness Project — OS-Level Agent Harness

Harness-MU: Safe, Governed Harness for Multi-User LLM Agents

Capability Gates Are Not Authorization: Confused-Deputy Failures in LLM Agent Frameworks

T8 공통 관점: (1) 결정론적 강제 원칙 — 안전·권한은 확률적 LLM이 아니라 실행 훅/OS 커널이 결정론적으로 강제해야 한다(Harness-MU·ActPlane·ScopeGate 공통). (2) 강제 지점이 tool layer에서 OS 커널·per-call 인가로 하강. (3) 컨텍스트 압축(§4-C Governance Decay)과 함께, 안전이 하네스의 횡단 관심사로 확립.

정정 노트(검증): §4-B의 HarnessFix ETCLOVG 7계층 약어 풀이(Execution·Tool·Context·Lifecycle·Observability·Verification·Governance)는 초록에 명시되지 않은 분석자 추정이다. 초록은 "실행환경·툴 인터페이스·컨텍스트·라이프사이클 오케스트레이션·관측성·검증·거버넌스"를 하네스가 제공하는 요소로 열거하며 ETCLOVG를 계층명으로 언급하나, 각 글자의 정확한 대응은 전문 확인이 필요하다. 또한 AgentX(2606.26859) 초록에는 정량 수치가 없어 효과 크기를 인용하지 않았다.

4-I. T9 — 모델-하네스 공진화·RL

읽기 맥락: 이 절은 하네스를 학습 밖의 고정 장치로 두지 않고, 모델 훈련·후훈련·RL과 함께 바꾸는 접근을 다룬다. 하네스 설계와 모델 업데이트가 서로 영향을 주는지가 핵심 질문이다.

4패러다임의 네 번째("agent-native training with co-evolution")에 해당. 하네스를 학습 루프 안으로 들여오는 계열.

The Interplay of Harness Design and Post-Training in LLM Agents

Polar: Agentic RL on Any Harness at Scale

Harnesses for Inference-Time Alignment over Execution Trajectories

HARBOR: A Harness Framework for Agentic Robot RL

(SIA 2605.27276은 §4-B 참조 — 하네스+가중치 공동 자기개선으로 이 테마와 교차.)

T9 공통 관점: (1) 하네스가 학습과 결합됨 — 고정 상수(2606.25447 반박) → 블랙박스 RL 대상(Polar) → 가중치 공동갱신(SIA). (2) inference-time alignment 관점에서 "partial harness가 낫다"(2605.21516)는 T1 비단조성과 수렴. (3) 하네스 엔지니어링 개념이 코딩을 넘어 로봇(HARBOR)으로 일반화.

4-J. T10 — 응용·산업 시스템 하네스

읽기 맥락: 이 절은 하네스 원리가 특정 산업·과학·로봇·레거시 시스템 안에서 어떻게 구현되는지 보여준다. 반복해서 나타나는 요소는 검증 게이트, 안전 게이트, 상태 지속성, 인간 감독이다.

특정 도메인에서 하네스 원리를 구현한 사례들. "harness engineering이 도메인 특화 인프라로 구체화"되는 지점.

NOVA: Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems

Building Agent Harnesses for Scientific Curation from Multimodal Sources (Beaver)

NORA: A Harness-Engineered Autonomous Research Agent for Spatial Data Science

A Process Harness for Uplifting Legacy Workflows to Agentic BPM (CUGA FLO)

Toward Self-Evolution-Ready Workflow Harnesses

AutoMegaKernel: A Statically-Checked Agent Harness for Megakernel Synthesis

T10 공통 관점: (1) "harness engineering"이 코딩을 넘어 추천시스템(NOVA·AgentX)·과학큐레이션(Beaver)·공간데이터(NORA)·BPM(CUGA FLO)·GPU커널(AutoMegaKernel)로 도메인 확산. (2) 공통 설계 요소가 반복 등장: verification cascade / safety gate / generator-evaluator 분리 / state persistence / 정책 프레임 — §4-A의 하네스 책임 분류가 응용에서 실체화. (3) 레거시 통합(process harness·Strangler-Fig)이 실무 관심사로.

4-K. 산업 1차 자료 (블로그·기술 리포트)

이 분야는 산업 리포트가 학술 논문만큼 중요하다. 아래는 HTTP로 실존 확인한 범위 내(2026-05~07) 1차 자료다. 블로그는 상세 내용을 candidates 기록 기반으로 요약한다.

Anthropic — "The evolution of agentic surfaces: building with Claude Managed Agents"

Anthropic — "Steering Claude Code: CLAUDE.md files, skills, hooks, rules, subagents and more"

Anthropic — "How we contain Claude across products"

Cognition — "Devin Fusion: Frontier Performance at 35% Lower Cost"

Google DeepMind — "Co-Scientist: a multi-agent AI partner"

OpenAI — Codex Changelog

배경(범위 밖) 1차 자료: OpenAI "Harness engineering"(2026-02, 용어 원출처, 원문 403→InfoQ 교차확인), Anthropic "Harness design for long-running apps"(2026-03), "Scaling Managed Agents: brain vs hands"(2026-04), "Building a C compiler with parallel Claudes"(2026-02, 16 병렬 Claude·검증기 중요성). 부록 A 참조.


5. 관통하는 트렌드

각 트렌드는 근거 논문을 동반한다. 단일 논문에서 성급히 일반화하지 않는다.

트렌드 1 — 성능 병목의 재배치: "모델이 아니라 하네스". 2026년 여름 문헌의 압도적 공통 명제. 정량 앵커: Claw-SWE-Bench(2606.12344)의 동일 모델 19.1%↔73.4%, StaminaBench(2606.19613)의 최선/최악 하네스 6배 격차, icat-agent(2606.25514)의 고정 모델 하 +8.3pp, RAH(2606.13643)의 백본 고정 71.75%→81.36%. 이론 앵커: 2605.13357(locus = model-harness-environment), 2605.12129("It's Not the Size"). 이는 §4-D의 Position paper(2606.17799)가 "벤치마크가 모델·하네스를 혼동한다"고 선언하며 방법론적 요구로 승격됐다.

트렌드 2 — 정적 하네스에서 자기진화 하네스로. 이 시기 최대 클러스터(§4-B). Self-Harness→APEX→HarnessX의 계보가 프롬프트 단일축→하네스+원칙+토폴로지→파운드리로 확장. 진화 신호원이 다양화: 정답 검증셋 → self-preference(RHO, 검증셋 없이 59%→78%) → success-trace distillation(APEX) → 가중치 공동갱신(SIA). 공통 안전장치는 회귀 방지·falsification(요행을 정책으로 굳히지 않기). 단 SEAGym(2606.17546)은 이 self-* 신호의 과적합·스냅샷 붕괴 위험을 메타평가로 경고 — 자기진화 내부의 자기 견제.

트렌드 3 — 컨텍스트·거버넌스가 "안전-critical 계층"으로 승격. 컨텍스트 관리가 효율 문제에서 안전 문제로 재규정. Governance Decay(2606.22528)는 압축이 안전 제약을 삭제해 위반율 0→30%(최대 59%)를 실증하고 압축 겨냥 인젝션 공격까지 보임. Plans Don't Persist(2606.22953)는 계획이 context-resident일 뿐 persistent가 아님을 hidden-state로 증명. 대응으로 결정론적 강제(§4-H: Harness-MU·ActPlane·ScopeGate)가 "안전은 LLM이 아니라 실행 훅/OS가 강제"라는 원칙으로 수렴.

트렌드 4 — 평가의 분해: 모델·하네스·환경을 나눠 측정. 단일 end-to-end 점수 비판(2606.17799)에서, 하네스를 1급 평가 축으로 삼는 벤치마크(Claw-SWE-Bench, ADK Arena)·프로세스 규율 측정(RigorBench)·stamina 측정(StaminaBench)·레이어 격리(2606.11686)·평가 하네스 견고화(hacker-fixer 2606.08960)로 확산. 평가 축이 정확도에서 신뢰성·규율·지속성으로 다변화.

트렌드 5 — "무엇으로 하네스를 분해하는가"의 경쟁 (미수렴). 6책임(2606.20683)·11책임(2605.13357)·범주론 삼중항(2605.12239)·3계층 code-substrate(2605.18747)·ETCLOVG(2606.06324)·source-code 12차원(2604.03515 배경). 서로 대응이 명시되지 않아 표준 분류 어휘가 아직 없다. 이는 분야가 신생임을 보여주는 신호이자 미해결 과제.

트렌드 6 — 서브에이전트·재귀·멀티에이전트의 구조화, 그리고 그 한계 인식. 재귀 하네스(RAH), 탐색 서브에이전트 분리(FastContext), 오케스트레이션 학습(OrchRM·LEMON), 이식 가능 명세(Swarm Skills·MAS-Lab). 동시에 근본 한계가 정직하게 드러남: 정보이론적 상한(2606.13733), 오케스트레이션 프롬프팅 능력 평균 14.9%(PerspectiveGap), 관리 병목=권한 부여(ClawArena). "에이전트를 늘리면 낫다"는 순진한 가정의 반박.

트렌드 7 — 도메인 확산과 산업-학술 수렴. harness engineering이 코딩을 넘어 추천(NOVA·AgentX)·과학(Beaver·NORA)·로봇(HARBOR)·BPM·GPU커널로 확산. 산업 1차 자료(Anthropic "harness machinery" 서사, Cognition 하이브리드 하네스)와 학술 개념이 같은 어휘로 수렴 — 용어 자체가 OpenAI(2026-02)에서 학술(2026-05~06)로 흘러들어온 계보가 관찰됨.


6. 발전 방향과 미해결 과제

논문들의 "한계" 섹션에서 귀납한 향후 방향.

  1. 하네스 분류 어휘의 표준화. 6/11/범주론/ETCLOVG로 난립하는 분해 축을 정렬할 합의 프레임이 필요하다(트렌드 5). 2606.20683의 6책임이 유력 후보이나, 안전·권한·관측성 같은 횡단 관심사를 어디에 놓을지 미해결.
  1. 최종 성공 너머의 평가. 2605.18747·2606.17799가 공통 지적 — 단일 참조 해답·end-to-end 점수는 유효 대안을 패널티화하고 컴포넌트 이터레이션 신호가 없다. 프로세스 규율(RigorBench)·신뢰성 감쇠(Beyond pass@1, 2603.29231 배경)·불완전 피드백 하 검증이 열린 문제.
  1. 불완전 피드백 하 자기진화의 신뢰성. self-preference·self-consistency(RHO)로 검증셋을 우회하지만, SEAGym이 경고하듯 과적합·스냅샷 붕괴 위험이 있다. "요행을 정책으로 굳히지 않는" falsification 게이트의 일반 이론이 필요.
  1. 하네스 일반화(generalization). 2604.25850(배경)의 "factual 구조는 전이되나 prose 전략은 전이 안 됨", AdaCoM의 "유사 능력 에이전트 간 전이가 최선"이 시사하듯, 하네스가 모델·태스크·도메인을 넘어 얼마나 이식되는지가 미해결(2606.20683이 명시한 open challenge).
  1. 모델-하네스 공진화의 이론. SIA(하네스+가중치)·HarnessX(트레이스→하네스+훈련 신호)·2606.25447(harness-aware post-training)이 결합을 실증하나, 두 레버가 언제 상승/상쇄하는지의 원리는 미정립.
  1. 안전을 하네스 전 계층에 관통. 컨텍스트 압축의 거버넌스 붕괴(2606.22528), 프레임워크 기본값의 confused-deputy(2606.28679), OS 레벨 강제(ActPlane)가 각각 부분 해결. 하네스의 결정론적 안전 강제를 컨텍스트·툴·메모리·멀티에이전트 전반에 일관 적용하는 통합 틀이 필요.
  1. 멀티에이전트의 원리적 설계. 정보이론적 상한(2606.13733)은 "C_min이 높으면 태스크를 재구조화하라"고 처방한다. 언제 단일 에이전트가 낫고 언제 멀티가 나은지, task-inherent 제약을 설계에 반영하는 방법론이 초기 단계.
  1. 커버리지·재현성 인프라. MemDelta(2606.29914)·MAS-Lab(2606.30546)이 보이듯 "실험에서 관찰한 행동이 프로덕션 근거가 못 된다". 통제 baseline·재현 프로토콜·live 프로덕션 측정(MemClaw)의 정착이 분야 성숙의 조건.

7. 결론

2026년 5~7월은 harness engineering이 산업 구호에서 학술 연구 프로그램으로 전환한 시기다. 이 서베이가 arXiv API로 실존 검증한 86편(범위 내)과 산업 1차 자료는 하나의 명제로 수렴한다: 에이전트 성능·안전·일반화는 모델 능력만이 아니라 모델과 하네스(그리고 환경)의 상호작용에서 창발하며, 하네스 설계가 점수를 모델 세대차만큼(때로 그 이상) 움직인다.

이 명제 위에서 분야는 네 갈래로 분화 중이다 — 하네스를 정의하고(경쟁적 분류, 아직 미수렴), 측정하고(모델/하네스 분리 평가), 자동 진화시키고(이 시기 최대 클러스터), 안전하게 강제한다(결정론적 거버넌스). 그리고 이미 다섯 번째 갈래인 모델-하네스 공진화로 넘어가고 있다.

동시에 분야의 신생성도 뚜렷하다: 분류 어휘가 표준화되지 않았고, 자기진화의 신뢰성 이론이 미비하며, 평가·재현성 인프라가 정착 중이고, 다수 논문이 단일 도메인·소규모·arXiv 사전출판 단계다. 이 서베이 자체가 그 신생 분야의 한 도구(agent harness)로 만들어졌다 — 라이브 검색·적대적 검증·검증 게이트라는 하네스 설계가 없었다면, 컷오프 이후 논문에 대한 이 보고서는 환각으로 오염됐을 것이다. 그 점에서 이 문서는 harness engineering의 대상이자 산물이다.


부록 A: 검증 실패·범위 밖 항목 (투명성)

환각(REJECTED): 0건. 발굴된 95개 arXiv ID 전부가 arXiv 공식 API에서 실존 확인됐다. 의심스러운 코드네임(LemonHarness·Claw-SWE-Bench·MemClaw·SemaClaw·ClayBuddy)조차 모두 실재했다.

범위 밖(OUT-OF-RANGE, 배경·맥락용으로만 사용): 아래 9편은 실존하나 2026-05~07 밖이라 본문 핵심 사례에서 제외하고 배경으로만 인용했다.

arXiv ID제출일제목
2601.118682026-01-17Terminal-Bench: Benchmarking Agents on CLI Tasks (평가 인프라 배경)
2603.228622026-03-24The Evolution of Tool Use in LLM Agents (툴 오케스트레이션 서베이 배경)
2603.247092026-03-25Training LLMs for Multi-Step Tool Orchestration
2603.292312026-03-31Beyond pass@1: Reliability Science for Long-Horizon Agents
2604.035152026-04-03Inside the Scaffold: Source-Code Taxonomy of Coding Agents
2604.115482026-04-13SemaClaw: Personal AI Agents through Harness Engineering
2604.210032026-04-22The Last Harness You'll Ever Build
2604.258502026-04-28Agentic Harness Engineering: Observability-Driven Evolution
2507.133342025-07-17A Survey of Context Engineering for LLMs (2025년, 범위 밖)

미확인(UNVERIFIED): 없음. 단 다음 한계를 명시한다 — (1) 대부분 arXiv 사전출판으로 동료심사 게재 여부 미확인, (2) WebSearch 비활성으로 Semantic Scholar/OpenReview/ACL 커버리지 부족, (3) Meta/FAIR 1차 자료 미발견, (4) 초록 기반 분석이라 일부 논문의 방법 세부·수치 맥락은 전문 확인 필요, (5) 산업 블로그는 HTTP 실존만 확인(내용은 candidates 기록 기반 요약).

근거 성숙도 편차(인용 시 주의): 강한 정량 앵커(Claw-SWE-Bench·Less Context·Governance Decay·StaminaBench·HarnessX 등)와 약한 근거(Mise en Place 사례 1건, ACDL 언어 제안, Categorical Architecture의 2모델·1태스크 실험, AgentX 초록 내 수치 부재)가 공존한다. HarnessFix의 ETCLOVG 약어 대응은 분석자 추정이다(§4-B 정정 노트).


부록 B: 전체 인용 목록 (CONFIRMED, 범위 내 86편)

arXiv API로 실존·제목·제출일을 검증한 2026-05~07 논문 전체. 제출일 순.

  1. Noga Peleg Pelc 외 2인 (2026-05-03). A Language for Describing Agentic LLM Contexts. arXiv:2605.01920
  2. Bing Zhou 외 5인 (2026-05-03). NORA: A Harness-Engineered Autonomous Research Agent for End-to-End Spatial Data Science. arXiv:2605.02092
  3. Andrew Zigler (2026-05-06). Mise en Place for Agentic Coding: Deliberate Preparation as Context Engineering Methodology. arXiv:2605.05400
  4. Matthias Galster 외 6인 (2026-05-08). A Dataset of Agentic AI Coding Tool Configurations. arXiv:2605.08435
  5. Seth Karten 외 7인 (2026-05-11). Continual Harness: Online Adaptation for Self-Improving Foundation Agents. arXiv:2605.09998
  6. Xinyu Zhang 외 12인 (2026-05-11). Swarm Skills: A Portable, Self-Evolving Multi-Agent System Specification for Coordination Engineering. arXiv:2605.10052
  7. Bogdan Banu (2026-05-12). Harness Engineering as Categorical Architecture. arXiv:2605.12239
  8. Yong-eun Cho (2026-05-12). It's Not the Size: Harness Design Determines Operational Stability in Small Language Models. arXiv:2605.12129
  9. Hailin Zhong 외 1인 (2026-05-13). AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents. arXiv:2605.13357
  10. Yoichi Ishibashi 외 2인 (2026-05-13). Effective Harness Engineering for Algorithm Discovery with Coding Agents. arXiv:2605.15221
  11. Xudong Chen 외 3인 (2026-05-14). LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning. arXiv:2605.14483
  12. Boyuan Wang 외 4인 (2026-05-15). Harnesses for Inference-Time Alignment over Execution Trajectories. arXiv:2605.21516
  13. Xuying Ning 외 41인 (2026-05-18). Code as Agent Harness. arXiv:2605.18747
  14. Musa Cim 외 3인 (2026-05-22). Parallel Context Compaction for Long-Horizon LLM Agent Serving. arXiv:2605.23296
  15. Binfeng Xu 외 11인 (2026-05-22). Polar: Agentic RL on Any Harness at Scale. arXiv:2605.24220
  16. Prannay Hebbar 외 6인 (2026-05-26). SIA: Self Improving AI with Harness & Weight Updates. arXiv:2605.27276
  17. Lu Yi 외 8인 (2026-05-29). Learning Agent-Compatible Context Management for Long-Horizon Tasks. arXiv:2605.30785
  18. Omkar Ghugarkar 외 3인 (2026-05-29). MAVEN: Improving Generalization in Agentic Tool Calling. arXiv:2605.30738
  19. Sidi Yang 외 13인 (2026-06-02). What Makes Interaction Trajectories Effective for Training Terminal Agents?. arXiv:2606.03461
  20. Wenbo Pan 외 7인 (2026-06-04). Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference. arXiv:2606.05922
  21. Mengzhuo Chen 외 4인 (2026-06-04). From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws. arXiv:2606.06324
  22. Yasmine Omri 외 8인 (2026-06-04). Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads. arXiv:2606.06448
  23. Jintao Huang 외 3인 (2026-06-04). ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer. arXiv:2606.05548
  24. Chuan Xiao 외 7인 (2026-06-05). Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills. arXiv:2606.07412
  25. Marut Pandya 외 2인 (2026-06-05). Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories. arXiv:2606.07889
  26. Jiayu Wang 외 10인 (2026-06-05). Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle. arXiv:2606.07462
  27. Youran Sun 외 4인 (2026-06-07). PerspectiveGap: A Benchmark for Multi-Agent Orchestration Prompting. arXiv:2606.08878
  28. Zechu Li 외 6인 (2026-06-07). HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning. arXiv:2606.08610
  29. Jaber Jaber 외 1인 (2026-06-08). AutoMegaKernel: A Statically-Checked Agent Harness for Self-Retargeting Megakernel Synthesis. arXiv:2606.09682
  30. Ziqian Zhong 외 5인 (2026-06-08). Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops. arXiv:2606.08960
  31. Sanderson Oliveira de Macedo (2026-06-08). What makes a harness a harness: necessary and sufficient conditions for an agent harness. arXiv:2606.10106
  32. Hangfan Zhang 외 7인 (2026-06-08). Self-Harness: Harnesses That Improve Themselves. arXiv:2606.09498
  33. Abhilasha Lodha 외 3인 (2026-06-08). Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents. arXiv:2606.10209
  34. Sawyer Zhang 외 2인 (2026-06-10). Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness. arXiv:2606.11686
  35. Mengyu Zheng 외 15인 (2026-06-10). Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks. arXiv:2606.12344
  36. Marc Alier Forment 외 3인 (2026-06-10). Agents All the Way Down; A Methodology for Building Custom AI Agents from Substrate to Production. arXiv:2606.11869
  37. Elias Lumer 외 3인 (2026-06-11). Recursive Agent Harnesses. arXiv:2606.13643
  38. King Yeung Tsang 외 7인 (2026-06-11). Reward Modeling for Multi-Agent Orchestration. arXiv:2606.13598
  39. Xiaoxuan Wang 외 5인 (2026-06-11). HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness. arXiv:2606.12882
  40. Xiaoyuan Liu 외 28인 (2026-06-11). AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility. arXiv:2606.13608
  41. Shi Pan 외 1인 (2026-06-11). How Task Structure Limits Multi-Agent Success: An Information-Theoretic Analysis. arXiv:2606.13733
  42. Shaoqiu Zhang 외 14인 (2026-06-12). FastContext: Training Efficient Repository Explorer for Coding Agents. arXiv:2606.14066
  43. Chenxin Li 외 20인 (2026-06-12). PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions. arXiv:2606.14832
  44. Tingyang Chen 외 13인 (2026-06-12). HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry. arXiv:2606.14249
  45. Jixuan Chen 외 12인 (2026-06-12). AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition. arXiv:2606.14674
  46. Kenneth Ge 외 1인 (2026-06-13). ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures. arXiv:2606.19380
  47. Ya-Chuan Chen 외 2인 (2026-06-13). APEX: Adaptive Principle EXtraction A Three-Layer Self-Evolution Framework for Production AI Agents. arXiv:2606.15363
  48. Dongxu Yang (2026-06-14). Control-Plane Placement Shapes Forgetting: An Architectural Study of Agent Memory Across Thirteen System Configurations. arXiv:2606.15903
  49. Jianyuan Guo 외 16인 (2026-06-14). From Question Answering to Task Completion: A Survey on Agent System and Harness Design. arXiv:2606.20683
  50. Junjia Qi 외 6인 (2026-06-14). LLM-as-Code: Agentic Programming for Agent Harness. arXiv:2606.15874
  51. Buqiang Xu 외 14인 (2026-06-15). TokenPilot: Cache-Efficient Context Management for LLM Agents. arXiv:2606.17016
  52. Qiao Xiao 외 11인 (2026-06-15). SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents. arXiv:2606.16591
  53. Yimo Lin 외 2인 (2026-06-15). Toward Self-Evolution-Ready Workflow Harnesses: A Reversible Migration Path and Convertibility Taxonomy for Expert LLM Pipelines. arXiv:2606.24598
  54. Gaurav Gupta 외 3인 (2026-06-16). Dissecting model behavior through agent trajectories. arXiv:2606.17454
  55. Congjie Zheng 외 4인 (2026-06-16). SEAGym: An Evaluation Environment for Self-Evolving LLM Agents. arXiv:2606.17546
  56. Maria I. Gorinova 외 5인 (2026-06-16). Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering. arXiv:2606.17799
  57. Fukang Wen 외 2인 (2026-06-17). OpenRath: Session-Centered Runtime State for Agent Systems. arXiv:2606.19409
  58. Vlad Sobal 외 4인 (2026-06-17). StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns. arXiv:2606.19613
  59. Sheng Zhang 외 11인 (2026-06-19). Building Agent Harnesses for Scientific Curation from Multimodal Sources. arXiv:2606.21005
  60. Yujin Tang 외 13인 (2026-06-19). Sakana Fugu Technical Report. arXiv:2606.21228
  61. Wangxuan Fan 외 2인 (2026-06-20). Harness-MU: A Safe, Governed, and Effective Harness for Multi-User LLM Agents. arXiv:2606.21856
  62. Meher Bhaskar Madiraju 외 1인 (2026-06-21). RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents. arXiv:2606.22678
  63. Shiyang Chen (2026-06-21). Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents. arXiv:2606.22528
  64. Haggai Roitman (2026-06-22). The Hitchhiker's Guide to Agentic AI: From Foundations to Systems. arXiv:2606.24937
  65. Shanhui Zhao 외 15인 (2026-06-22). AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction. arXiv:2606.23449
  66. Aman Mehta 외 1인 (2026-06-22). Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents. arXiv:2606.22953
  67. Kailong Ren 외 20인 (2026-06-23). LemonHarness Technical Report. arXiv:2606.24311
  68. Yusheng Zheng 외 7인 (2026-06-23). ActPlane: Programmable OS-Level Policy Enforcement for Agent Harnesses. arXiv:2606.25189
  69. Wei Zhou 외 7인 (2026-06-23). Are We Ready For An Agent-Native Memory System?. arXiv:2606.24775
  70. Yanki Margalit 외 4인 (2026-06-23). Governed Shared Memory for Multi-Agent LLM Systems. arXiv:2606.24535
  71. Kyungmin Kim 외 5인 (2026-06-24). The Interplay of Harness Design and Post-Training in LLM Agents. arXiv:2606.25447
  72. Yang Chen 외 3인 (2026-06-24). Unlocking Model Potentials Through Adaptive Multi-Agent Scaffolding for Efficient Issue Resolution. arXiv:2606.25514
  73. Congjia Tian 외 2인 (2026-06-25). QueenBee Planner: Skill-Evolving Communication Topologies for Token-Efficient LLM Multi-Agent Systems. arXiv:2606.27492
  74. Shaohua Liu 외 18인 (2026-06-25). NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems. arXiv:2606.27243
  75. Changxin Lao 외 61인 (2026-06-25). AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems. arXiv:2606.26859
  76. Fabiana Fournier 외 1인 (2026-06-25). A Process Harness for Uplifting Legacy Workflows to Agentic BPM: Design and Realization in CUGA FLO. arXiv:2606.27188
  77. Wenhao Zeng 외 12인 (2026-06-26). Dockerless: Environment-Free Program Verifier for Coding Agents. arXiv:2606.28436
  78. Shuzheng Gao 외 7인 (2026-06-26). SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents. arXiv:2606.28434
  79. Yutian Tang 외 2인 (2026-06-27). Characterizing Large Language Model Agentic Workflows: A Study on N8n Ecosystem. arXiv:2606.29116
  80. David Mellafe Zuvic (2026-06-27). Capability Gates Are Not Authorization: Confused-Deputy Failures in LLM Agent Frameworks. arXiv:2606.28679
  81. Binyan Xu 외 2인 (2026-06-29). LLM Agents Are Latent Context Managers: Eliciting Self-Managed Context via a Proprioceptive Dashboard. arXiv:2606.30005
  82. Kuan Wang (2026-06-29). MemDelta: Controlled Baselines and Hidden Confounds in Agent Memory Evaluation. arXiv:2606.29914
  83. Carson Rodrigues 외 1인 (2026-06-29). MCP Server Architecture Patterns for LLM-Integrated Applications. arXiv:2606.30317
  84. Jordan Augé 외 3인 (2026-06-29). MAS-Lab: A Specification-Driven Validation Framework for Reliable Multi-Agent Systems. arXiv:2606.30546
  85. Kaiwen Xiong 외 6인 (2026-06-30). ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents. arXiv:2606.31174
  86. Ning Liao 외 8인 (2026-06-30). ACE: Pluggable Adaptive Context Elasticizer across Agents. arXiv:2606.31564

부록 B-2: 산업 1차 자료 (범위 내, HTTP 검증)

  1. Anthropic (2026-05-25). How we contain Claude across products. https://www.anthropic.com/engineering/how-we-contain-claude
  2. Anthropic (2026-05-19). New in Claude Managed Agents: dreaming, outcomes, and multiagent orchestration. https://claude.com/blog/new-in-claude-managed-agents
  3. Anthropic (2026-05-19). Claude Managed Agents: self-hosted sandboxes and MCP tunnels. https://claude.com/blog/claude-managed-agents-updates
  4. Anthropic (2026-06-09). Managed Agents: schedule + environment variable vaults. https://claude.com/blog/whats-new-in-claude-managed-agents
  5. Anthropic — G. Bhat, I. He (2026-06-10). The evolution of agentic surfaces: building with Claude Managed Agents. https://claude.com/blog/building-with-claude-managed-agents
  6. Anthropic (2026-06-18). Steering Claude Code: CLAUDE.md files, skills, hooks, rules, subagents and more. https://claude.com/blog/steering-claude-code-skills-hooks-rules-subagents-and-more
  7. Anthropic (2026-06-24). Agent identity in Claude Tag: a new access model. https://claude.com/blog/agent-identity-access-model
  8. Cognition (2026-06-29). Devin Fusion: Frontier Performance at 35% Lower Cost. https://cognition.com/blog/devin-fusion
  9. Google DeepMind (2026-05-19). Co-Scientist: a multi-agent AI partner to accelerate research. https://deepmind.google/blog/co-scientist-a-multi-agent-ai-partner-to-accelerate-research/
  10. Google DeepMind (2026-06). Investing in multi-agent AI safety research. https://deepmind.google/blog/investing-in-multi-agent-ai-safety-research/
  11. OpenAI (2026-06~07). Codex Changelog. https://developers.openai.com/codex/changelog

부록 B-3: 배경 산업 자료 (범위 밖)

  1. OpenAI (2026-02-11). Harness engineering: leveraging Codex in an agent-first world. (원문 403; InfoQ 교차확인) https://openai.com/index/harness-engineering/
  2. Anthropic — P. Rajasekaran (2026-03-24). Harness design for long-running application development. https://www.anthropic.com/engineering/harness-design-long-running-apps
  3. Anthropic (2026-04-08). Scaling Managed Agents: Decoupling the brain from the hands. https://www.anthropic.com/engineering/managed-agents
  4. Anthropic — J. Hughes (2026-03-25). How we built Claude Code auto mode. https://www.anthropic.com/engineering/claude-code-auto-mode
  5. Anthropic — N. Carlini (2026-02-05). Building a C compiler with a team of parallel Claudes. https://www.anthropic.com/engineering/building-c-compiler

이 서베이는 Harness Survey 하네스(agents 4 + skills 5 + orchestrator)로 생성되었으며, 모든 arXiv 인용은 raw arXiv API로, 블로그는 HTTP 상태로 실존 검증되었다. 검증 원본: _workspace/03_verification/.