이 문서는 harness-engineering-survey-2026.md 의 가독성 개선판이며 내용 축약 없음
Harness Engineering 서베이: 2026년 5~7월 최신 연구 동향
작성: Harness Survey 에이전트 팀 (paper-scout ×3 → paper-analyst → citation-verifier → survey-synthesizer)
조사 기간: 2026년 5월 1일 ~ 7월 1일 (작성 시점 2026-07-01)
검증 원칙: 본문에 인용된 모든 arXiv 논문은 arXiv 공식 API(raw Atom XML)로 실존·제목·제출일을 독립 대조했고, 모든 블로그·기술 리포트는 HTTP 상태로 실존을 확인했다. 검증(CONFIRMED)을 통과한 자료만 본문에 인용한다. 세부 검증 결과는_workspace/03_verification/verdicts.md참조.
읽기 안내: 이 문서에서 하네스는 모델을 에이전트로 작동하게 하는 실행 계층이다. 컨텍스트는 모델이 현재 판단에 참고하는 입력·기록·상태의 묶음이다. 트레이스는 에이전트가 관찰하고, 생각하고, 툴을 호출하고, 검증한 실행 기록이다. 벤치마크는 성능·안전·프로세스 품질을 재는 평가 장치로 읽으면 된다.
요약 (Executive Summary)
2026년 5~7월은 "harness engineering(하네스 엔지니어링)" 이라는 용어가 산업 현장의 구호(2026년 2월 OpenAI가 대중화)에서 하나의 독립된 연구 주제군으로 학술적으로 결정화(crystallize)된 분기점이다. 이 서베이는 라이브 검색으로 발굴하고 arXiv API로 실존을 교차 검증한 95편의 arXiv 논문(범위 내 86편 + 배경 9편)과 18건의 산업 1차 자료를 대상으로 한다.
관통하는 단 하나의 명제는 다음과 같다:
"에이전트 성능의 병목은 대체로 모델 크기가 아니라 하네스 설계에 있다" — 그리고 이 명제가 2026년 여름 문헌 전반에서 정의(무엇이 하네스인가), 측정(하네스가 점수를 얼마나 좌우하는가), 자동화(하네스를 스스로 진화시킬 수 있는가), 거버넌스(하네스가 안전을 강제하는가)의 네 갈래로 분화하고 있다.
핵심 관찰 6가지:
- 정의의 결정화. "agent harness"의 다의성을 필요·충분조건으로 규정하려는 시도(2606.10106)와, 하네스를 6책임(2606.20683)·11책임(2605.13357)·범주론(2605.12239)으로 분해하려는 경쟁적 분류 프레임이 동시 등장했다. 아직 표준 분류 어휘는 없다.
- "harness > model size" 명제의 정량 확증. 동일 모델이 하네스(adapter) 설계만으로 Pass@1 19.1%→73.4%(2606.12344), 강한 모델도 최선/최악 하네스 간 최대 6배 격차(2606.19613)가 실측됐다.
- 자기진화 하네스의 부상. 하네스를 정적 산출물이 아니라 트레이스로부터 스스로 개선하는 대상으로 보는 계열(Self-Harness, HarnessX, HarnessFix, RHO, APEX 등)이 이 시기의 가장 큰 클러스터다.
- 컨텍스트 관리가 "안전-critical 계층"으로 재규정. 컨텍스트 압축이 안전 제약을 조용히 삭제하는 "Governance Decay"(2606.22528)와 계획이 지속되지 않는 문제(2606.22953)가 하네스 실패의 새 표면으로 드러났다.
- 평가의 재정의. 벤치마크가 모델·하네스·환경을 하나의 점수로 뭉뚱그린다는 비판(2606.17799)과, 이를 분리 측정하려는 벤치마크(Claw-SWE-Bench, StaminaBench, ADK Arena, RigorBench 등)가 쏟아졌다.
- 거버넌스·OS 레벨 강제의 대두. 툴콜 가드레일을 넘어 OS 커널(eBPF)에서 정책을 강제하거나(2606.25189), 권한/인가를 실행 훅으로 결정론적으로 처리해야 한다는(2606.21856, 2606.28679) 흐름이 형성됐다.
커버리지의 정직한 한계 (§2 참조): 이 조사는 이 환경에서 WebSearch가 비활성이라 arXiv API + 특정 기업 블로그 직접 조회에 의존했다. arXiv 사전출판에 편중되어 있고(동료심사 게재 여부 미확인), Semantic Scholar/OpenReview/ACL은 접근 제약으로 충분히 커버하지 못했다. Meta/FAIR의 1차 자료는 이 기간 발견되지 않았다. 따라서 이 서베이는 "이 기간 하네스 엔지니어링 문헌의 완전한 census"가 아니라 "arXiv를 중심으로 실존 검증된 대표 표본"이다.
1. 서론 — 하네스 엔지니어링이란
Harness(하네스) 는 언어 모델을 감싸 그것을 "환경 위에서 행동하는 에이전트"로 바꾸는 계층이다 — 프롬프트, 툴, 메모리, 컨텍스트 관리, 제어 흐름(agent loop), 관측성, 검증, 권한을 아우른다. 2606.10106(What makes a harness a harness)은 이 용어의 계보를 말의 마구(horse's tack) → 소프트웨어 테스트 하네스 → ML 평가 하네스 → 에이전트 하네스로 추적하며, 현재 이 단어가 (a) 제품 전체(Claude Code, Codex CLI), (b) 평가 스캐폴드(SWE-bench harness), (c) framework·SDK·IDE 플러그인·orchestrator와 혼용되는 다의적(polysemous) 상태임을 지적한다.
왜 지금인가. 세 가지 힘이 수렴했다.
- 모델 능력의 수렴. 프론티어 모델들의 능력차가 좁혀지면서, SemaClaw(2604.11548)의 표현대로 "모델 능력이 수렴할수록 하네스 계층이 아키텍처 차별화의 주된 지점"이 된다.
- 산업의 용어 대중화. OpenAI가 2026년 2월 "Harness engineering: leveraging Codex in an agent-first world"에서 이 용어를 밀었고(엔지니어가 구현 대신 "환경 설계·의도 명세·구조화된 피드백"에 집중), Martin Fowler가 "하네스는 컨텍스트 엔지니어링·아키텍처 제약·가비지 컬렉션을 포함한다"고 규정했다(§2·부록 A의 InfoQ 교차확인).
- 장기 자율 과제의 실전 배치. 에이전트가 수십~수백 턴의 장기 과제(코딩, 리서치, GUI 자동화)에 실전 투입되면서, 단발 프롬프트로는 다룰 수 없는 상태·메모리·검증·권한 문제가 하네스 설계 문제로 표면화됐다.
2606.20683(From Question Answering to Task Completion)은 이 전환을 에이전트 엔지니어링의 4패러다임 계보로 정식화한다:
prompt engineering → workflows & context engineering → harness engineering → agent-native training with co-evolution
이 서베이는 "harness engineering"을 세 번째 패러다임으로 놓되, 2026년 여름 문헌이 이미 네 번째(모델-하네스 공진화)로 넘어가고 있음을 보인다.
2. 조사 방법과 커버리지
검색 전략(팬아웃). 3개 축의 paper-scout를 병렬 실행했다: (축1) 학술 arXiv/Semantic Scholar/OpenReview/ACL, (축2) 산업 랩 블로그·기술 리포트·벤치마크, (축3) 인접 주제(컨텍스트 엔지니어링·메모리·멀티에이전트·자기개선·RL). 각 축은 "agent harness", "harness engineering", "agent scaffolding", "context engineering", "tool orchestration", "agentic framework", "coding agent", "agent memory", "multi-agent orchestration", "evaluation harness" 등 동의어 클러스터를 기간 한정어(2605/2606/2607)와 조합해 순회했다.
환경 제약(정직 고지). 이 실행 환경에서 WebSearch 툴이 비활성이었다. scout들은 대신 (a) arXiv 공식 API(export.arxiv.org/api/query)를 라이브 검색 채널로, (b) DuckDuckGo HTML 엔드포인트를, (c) 개별 페이지 WebFetch를 사용했다. 이 때문에 커버리지가 arXiv 사전출판에 편중된다. Semantic Scholar/OpenReview/ACL Anthology는 별도 접근이 제한적이었고, 동료심사 게재 여부는 미확인이다.
검증(적대적 게이트). 대상 논문이 모두 지식 컷오프 이후에 나왔으므로 환각 인용이 최대 위험이다. 이를 막기 위해:
- 후보에서 추출한 95개 arXiv ID 전부를 arXiv API의 원본 Atom XML로 배치 대조했다. 원본 XML은 요약 모델을 거치지 않는 1차 인덱스이므로 제목·제출일 환각이 원천 차단된다.
- 결과: 95편 전부 실존 확인, 환각 0건. 제목·저자·제출일이 후보 기록과 일치했다. 의심스러운 코드네임(LemonHarness, Claw-SWE-Bench, MemClaw, SemaClaw)조차 모두 실존했다.
- 날짜 판정: 범위 내(2026-05~07) 86편, 범위 밖 9편(배경/맥락용). arXiv ID의 YYMM 규칙(2605=2026년 5월)에 따라
2507.13334는 2025년 7월 논문으로 범위 밖 처리했다. - 블로그·기술 리포트 18건은 HTTP 상태로 확인(17건 200, OpenAI 원문 1건은 봇차단 403 → InfoQ 2차 200으로 교차확인).
커버리지 규모. 본문 인용 대상 = arXiv 86편(범위 내) + 산업 1차 자료 11건(범위 내). 이 서베이는 완전한 census가 아니라 실존 검증된 대표 표본이며, 특히 arXiv 편중과 Meta 자료 부재를 한계로 명시한다.
분석 근거. 모든 논문 분석은 arXiv API로 취득한 실제 초록 전문(_workspace/02_analysis/abstracts.md)을 1차 근거로 한다. 초록에서 확인되지 않는 세부 수치는 단정하지 않았다.
3. 택소노미 — 연구 지형
미리 정한 틀이 아니라, 검증된 논문들이 실제로 무엇을 다루는지에서 분류를 귀납했다. 앵커는 2606.20683의 6개 런타임 책임(observation·context·control·action·state·verification)이며, 이 축 위에 2026년 여름 문헌의 주제 클러스터를 배치한다.
| # | 테마 | 핵심 질문 | 대표 논문(범위 내) |
|---|---|---|---|
| T1 | 정의·이론·택소노미 | 무엇이 하네스이고, 어떤 축으로 분해되는가? | 2606.10106, 2606.20683, 2605.13357, 2605.12239, 2605.18747, 2605.15221, 2605.12129, 2605.02092, 2606.03461, 2606.29116 |
| T2 | 자기진화·자동 하네스 | 하네스를 스스로 개선/진화시킬 수 있는가? | 2606.09498, 2606.14249, 2606.15363, 2606.06324, 2606.05922, 2605.09998, 2605.27276, 2606.07412, 2606.17546, 2606.26859, 2606.27492, 2604.21003 |
| T3 | 컨텍스트 엔지니어링·관리 | 유한한 윈도우에서 무엇을 남기고 버리는가? | 2606.10209, 2606.22953, 2606.22528, 2606.30005, 2605.30785, 2606.17016, 2606.31564, 2605.01920, 2605.23296, 2605.05400, 2605.08435 |
| T4 | 평가·벤치마크·모델vs하네스 분리 | 하네스가 점수를 얼마나 좌우하며 어떻게 측정하는가? | 2606.17799, 2606.12344, 2606.19613, 2606.05548, 2606.22678, 2606.13608, 2606.08960, 2606.17454, 2606.07889, 2606.11686, 2606.07462 |
| T5 | 에이전트 메모리·상태 | 세션을 넘는 상태를 어떻게 저장·검색·망각하는가? | 2606.24775, 2606.06448, 2606.24535, 2606.19409, 2606.15903, 2606.29914, 2606.28434 |
| T6 | 멀티에이전트 오케스트레이션 | 여러 에이전트를 어떻게 조율·위임·통신시키는가? | 2606.13598, 2605.14483, 2606.08878, 2606.13733, 2606.31174, 2606.25514, 2605.10052, 2606.30546 |
| T7 | 툴 오케스트레이션·재귀·인터페이스 | 툴 호출·서브에이전트·재귀를 어떻게 조직하는가? | 2605.30738, 2606.16591, 2606.30317, 2606.13643, 2606.15874, 2606.14832, 2606.14066, 2606.28436 |
| T8 | 안전·거버넌스·OS레벨 강제 | 하네스가 권한·안전을 어떻게 강제하는가? | 2606.25189, 2606.23449, 2606.21856, 2606.28679 |
| T9 | 모델-하네스 공진화·RL | 하네스와 모델 학습을 어떻게 결합하는가? | 2606.25447, 2605.24220, 2605.21516, 2606.08610, 2605.27276(교차) |
| T10 | 응용·산업 시스템 하네스 | 특정 도메인에서 하네스가 어떻게 구현되는가? | 2606.27243, 2606.21005, 2606.27188, 2606.24598, 2606.09682, NORA(2605.02092) |
여러 테마에 걸치는 논문은 주 테마에 배치하고 교차 언급한다. 예: 2606.06324(HarnessFix)는 T2(자기진화)에 두되 T1(하네스 책임 분류 ETCLOVG)과 교차한다.
각 테마의 산업 1차 자료 매핑은 §4-K에 별도로 정리한다.
4. 논문별 상세 분석
인용 형식: 제목 — (저자 대표, YYYY-MM, [arXiv ID](링크)). 모든 수치는 arXiv 초록에서 확인된 것이며, 초록에 없는 값은 단정하지 않는다.
읽기용 형식: 아래 논문 항목은 원문 내용을 줄이지 않고서지,무엇을 다루나,어떻게/구성,결과·수치,한계·의의/교차로 나눠 읽기 쉽게 재배치했다. 수치, arXiv ID, 링크, 검증 관련 표현은 원문 문자열을 보존했다.
4-A. T1 — 정의·이론·택소노미
읽기 맥락: 이 절은 하네스라는 단어의 경계와 분해 어휘를 정리한다. 서로 다른 분류 체계가 경쟁한다는 점을 염두에 두면 뒤 절의 논문들이 더 잘 이어진다.
이 클러스터는 "하네스란 무엇인가"를 정면으로 다룬다. 2026년 여름의 가장 인상적인 사실은, 이 질문에 경쟁적으로 답하는 논문이 한 달 안에 다수 등장했다는 점 자체다.
What makes a harness a harness: necessary and sufficient conditions for an agent harness
- 서지: (S. Oliveira de Macedo, 2026-06, 2606.10106).
- 무엇을 다루나: "agent harness"의 다의성 문제를 개념 분석으로 정면 공략.
- 결과·수치: 용어 계보(마구→테스트 하네스→ML 평가 하네스→에이전트 하네스)를 재구성하고, 시스템이 하네스이기 위한 필요·충분조건을 구성적 정의로 제시한 뒤 이를 포함/배제 테스트로 조작화한다.
- 결과·수치: Claude Code·Codex CLI·Aider·Cline·OpenHands·SWE-agent 6개 실사례와 경계 사례에 적용해 일관성을 보이고, framework/SDK/IDE plugin/eval harness/orchestrator 5개 인접 개념과의 경계를 긋는다.
- 한계·의의/교차: 한계: 경험적 검증이 아닌 정합성 논증이며, 구체적 조건 목록은 초록에서 확인되지 않는다(전문 확인 필요).
- 한계·의의/교차: 의의: 이 서베이 전체의 개념적 기준점.
From Question Answering to Task Completion: A Survey on Agent System and Harness Design
- 서지: (J. Guo 외 17인, 2026-06, 2606.20683).
- 무엇을 다루나: 본 서베이의 직접 선행 서베이.
- 결과·수치: LLM 에이전트를
foundation model ⊗ execution harness로 보는 model-harness 렌즈를 세우고, 실행 하네스를 6개 결합 런타임 책임(observation·context·control·action·state·verification) 으로 분해한다. - 읽을 점: 중심 질문은 "병목이 model / harness / coupling 중 어디인가"이며, 답을 "상호작용에서 창발"로 규정한다.
- 결과·수치: 미해결 도전 4종: value-aware evaluation, safety, harness generalization, model-harness co-evolution.
- 한계·의의/교차: 의의: 이 서베이가 택소노미 골격으로 채택한 6책임 어휘의 출처.
AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents
- 서지: (H. Zhong, S. Zhu, 2026-05, 2605.13357).
- 무엇을 다루나: SWE 능력의 locus를 모델이 아니라 model-harness-environment 시스템으로 재배치.
- 결과·수치: 하네스를 런타임 기질로 형식화하고 11개 책임(task spec·context selection·tool access·project memory·task state·observability·failure attribution·verification·permissions·entropy auditing·intervention recording)과 4단계 성숙도 사다리 H0–H3, 그리고 각 실행을 감사 가능한 에피소드 패키지로 만드는 트레이스 평가 프로토콜을 제안한다.
- 한계·의의/교차: 의의: "하네스=런타임 기질" 명제를 가장 명료히 밀어붙인 논문.
- 결과·수치: 2606.20683의 6책임과 대비되는 11책임 분류.
Harness Engineering as Categorical Architecture
- 서지: (B. Banu, 2026-05, 2605.12239).
- 무엇을 다루나: 하네스 설계에 형식 이론이 없다는 문제를, 범주론적 Architecture 삼중항
(G, Know, Phi)로 형식화. - 결과·수치: 에이전트 외부화 4기둥(Memory=coalgebraic state, Skills=operad-composed, Protocols=wiring G, Harness=Architecture 전체)을 매핑하고, Swarms/DeerFlow/Ralph/Scion/LangGraph를 타깃하는 컴파일러 펑터로 인증서 보존을 검증.
- 한계·의의/교차: 한계(저자 명시): escalation 실험이 2모델·1태스크로 극히 제한적, 컴파일러는 identity/replay만 확인(출력 정합성·모델 행동 미검증).
- 한계·의의/교차: 의의: 하네스 이론 스펙트럼의 formal 극단.
Code as Agent Harness
- 서지: (X. Ning 외 36인, 2026-05, 2605.18747).
- 무엇을 다루나: 코드를 단순 산출물이 아니라 에이전트 추론·행동·환경모델링·검증의 운영 기질로 보는 "code as agent harness" 통일 렌즈.
- 결과·수치: 3계층(interface·mechanisms·scaling)으로 서베이하며, 미해결 도전으로 최종성공 너머 평가·불완전 피드백 하 검증·regression-free 개선·멀티에이전트 공유상태 일관성·안전critical 인간감독·멀티모달 확장을 명시.
- 한계·의의/교차: 의의: 2606.20683의 "기능 렌즈"와 상보적인 "기질 렌즈".
It's Not the Size: Harness Design Determines Operational Stability in Small Language Models
- 서지: (Y. Cho, 2026-05, 2605.12129).
- 무엇을 다루나: 소형모델(2–3B) 3종·24태스크로 하네스 3조건(model-only / minimal-shell / 4-stage plan→execute→verify→recover) 비교.
- 결과·수치: 파이프라인 하네스가 Gemma4 E2B에서 TSR=0.952, VTSR=1.000.
- 결과·수치: 핵심 발견 두 가지: (1) 비단조성 — minimal-shell TSR < model-only TSR(어설픈 하네스는 오히려 해롭다), (2) scaffold collapse — LLaMA 3.2 3B가 하네스 없이 복잡 포맷 요구 시 JSON 구조를 포기(TSR=0.429). ablation: planning·recovery 각각 총 이득의 ~24.7%.
- 한계·의의/교차: 의의: "하네스가 성능 결정 요인" 명제의 가장 선명한 소형모델 증거이자, 그 명제의 경계 조건(하네스가 항상 돕지는 않는다).
Effective Harness Engineering for Algorithm Discovery with Coding Agents
- 서지: (Y. Ishibashi 외, 2026-05, 2605.15221).
- 무엇을 다루나: AlphaEvolve/FunSearch 계열 알고리즘 발견에서 하네스 설계 3문항(고정 예산 하 깊게-적게 vs 얕게-많이 / evaluation hack 처리 / 파일시스템 접근 에이전트의 안전 병렬 실행)을 Vesper로 실험.
- 결과·수치: 반직관적 결론: 동일 토큰 예산에서 개체 수보다 개체 품질 스케일링이 효율적이고, 능력 있는 모델일수록 evaluation hack 생성률이 높아 hack 탐지 필요성이 모델 스케일과 함께 증가.
What Makes Interaction Trajectories Effective for Training Terminal Agents?
- 서지: (S. Yang 외 13인, 2026-06, 2606.03461).
- 무엇을 다루나: "더 강한 교사 에이전트가 더 좋은 훈련 데이터를 만든다"는 통념을 반박(pedagogical paradox): Terminal-Bench 2.0 점수가 낮은 DeepSeek-V3.2의 트레이스로 학습한 학생이 더 강한 Claude Opus 4.6 트레이스보다 일반화가 우수.
- 어떻게/구성: 원인은 Environment-Grounded Supervision — inspect-act-verify를 하네스에 노출한 트레이스가 견고한 루틴을 내면화시킴.
- 결과·수치: 15.3k 트레이스로 Qwen3-32B가 Terminal-Bench 2.0 24.3% 달성(30배 데이터의 이전 SOTA에 필적).
- 결과·수치: "harness engineering"을 재현·일반화 가능한 에이전트 지능의 1차 촉매로 규정.
Characterizing LLM Agentic Workflows: A Study on N8n Ecosystem
- 서지: (Y. Tang 외, 2026-06, 2606.29116).
- 무엇을 다루나: 6,000+ 공개 n8n 워크플로 최초 대규모 실증.
- 결과·수치: LLM이 제어로직·툴·통신·스토리지·인간검토 속에 임베드되나, fallback·repair loop·human approval gate 같은 명시적 신뢰성 메커니즘은 드물다 — 배포 확산과 신뢰성/안전/거버넌스 엔지니어링 지원 사이의 간극을 실증.
T1 공통 관점: (1) 하네스는 새로운 1급 시민이 됐으나 정의가 아직 불안정하다. (2) "하네스가 성능을 결정한다"가 관통 명제이며, scaffold collapse·비단조성이 그 경계 조건을 제공한다. (3) 분해 어휘가 6책임/11책임/3계층/범주론으로 제각각이라 표준화가 남은 과제다.
4-B. T2 — 자기진화·자동 하네스 (이 시기 최대 클러스터)
읽기 맥락: 이 절은 하네스를 사람이 한 번 설계해 고정하는 물건이 아니라, 실행 기록을 보고 스스로 고치는 대상으로 본다. 핵심은 개선과 회귀 방지를 동시에 다루는 방식이다.
하네스를 손으로 만드는 정적 산출물이 아니라, 실행 트레이스로부터 스스로 진단·수정·진화하는 대상으로 보는 계열. 배경 논문 2604.25850(AHE, 관측성 3기둥으로 편집을 falsifiable 계약화)이 이 계보의 직접 선행이며, "factual 하네스 구조는 전이되나 prose 전략은 전이 안 됨"이라는 발견을 남겼다.
Self-Harness: Harnesses That Improve Themselves
- 서지: (H. Zhang 외, 2026-06, 2606.09498).
- 무엇을 다루나: 인간 개입·외부 강한 에이전트 없이 에이전트가 자기 하네스를 개선하는 패러다임.
- 결과·수치: 3단계 루프: Weakness Mining(트레이스에서 모델별 실패 패턴 식별) → Harness Proposal(다양하되 최소의 수정 생성) → Proposal Validation(회귀 테스트 통과분만 수용).
- 결과·수치: Terminal-Bench-2.0에서 3개 모델(MiniMax M2.5, Qwen3.5-35B-A3B, GLM-5) held-out pass rate 40.5%→61.9%, 23.8%→38.1%, 42.9%→57.1%.
- 한계·의의/교차: 의의: 이 클러스터의 baseline.
- 읽을 점: APEX가 명시적으로 인용하는 선행.
HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry
- 서지: (T. Chen 외, 2026-06, 2606.14249).
- 무엇을 다루나: 타입드 하네스 프리미티브를 substitution algebra로 조립하고, AEGIS(trace-driven 멀티에이전트 진화엔진, 기호적 적응과 RL의 operational mirror)로 진화시키며, 트레이스를 하네스 업데이트 및 모델 훈련 신호로 동시 환원해 하네스-모델 루프를 닫는다.
- 결과·수치: 5개 벤치(ALFWorld·GAIA·WebShop·τ³-Bench·SWE-bench Verified) 평균 +14.5%(최대 +44.0%), baseline이 낮을수록 이득이 큼.
- 한계·의의/교차: 의의: 하네스를 조립·적응·진화 가능한 파운드리로 정식화.
APEX: Adaptive Principle EXtraction — A Three-Layer Self-Evolution Framework
- 서지: (Y. Chen 외, 2026-06, 2606.15363).
- 무엇을 다루나: Self-Harness가 프롬프트 하네스 한 축만 최적화한다는 한계를 지적하고 3층 공진화로 확장: L1 하네스(failure-mode patching) + L2 행동원칙(success-trace distillation) + L3 워크플로 토폴로지(structural fitness selection).
- 결과·수치: NVIDIA Nemotron 기반 프로덕션 에이전트 Joe에 적용, 15노드·114 실태스크로 Health Score 0.300→0.570(+90%)를 단 4 LLM 호출(~270s)로 달성.
- 한계·의의/교차: 의의: 단일축 하네스 최적화를 다차원 공진화로 일반화.
From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws (HarnessFix)
- 서지: (M. Chen 외, 2026-06, 2606.06324).
- 무엇을 다루나: 실패 트레이스를 Harness-aware Trace IR(HTIR) 로 컴파일해 실패를 책임 있는 스텝·하네스 레이어(ETCLOVG: Execution·Tool·Context·Lifecycle·Observability·Verification·Governance) 에 귀인하고, scoped repair operator로 패치를 생성·검증.
- 결과·수치: SWE-Bench Verified·Terminal-Bench 2.0·GAIA·AppWorld에서 +15.2~50.0%, 인간설계·자기진화 baseline 상회.
- 한계·의의/교차: 교차: T1의 하네스 책임 분류(7계층 ETCLOVG)를 제공.
Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference (RHO)
- 서지: (W. Pan 외, 2026-06, 2606.05922).
- 무엇을 다루나: 정답 검증셋 없이 과거 트레이스만으로 하네스를 최적화하는 자기지도 방법.
- 결과·수치: 어려운 과제 coreset을 병렬 재풀이 → self-validation/self-consistency 분석 → pairwise self-preference로 최선 업데이트 선택.
- 결과·수치: 단 1회 최적화로 SWE-Bench Pro 59%→78%(외부 채점 없이).
- 한계·의의/교차: 의의: ground-truth 부재 배포 환경에서의 하네스 진화.
Continual Harness: Online Adaptation for Self-Improving Foundation Agents
- 서지: (S. Karten 외, 2026-05, 2605.09998).
- 무엇을 다루나: embodied 에이전트를 위한 리셋 없는(reset-free) 자기개선 하네스.
- 어떻게/구성: Gemini Plays Pokemon 실험(Blue/Yellow Legacy hard/Crystal 완주)에서 관찰한 창발적 자기개선을 형식화 — 최소 환경 인터페이스에서 시작해 단일 실행 내에서 프롬프트·서브에이전트·스킬·메모리를 온라인 정제.
- 어떻게/구성: 프론티어 teacher가 relabel하는 process-reward 공학습 루프로 모델까지 갱신.
- 한계·의의/교차: 의의: 에피소드 리셋을 요구하는 프롬프트 최적화와 달리 단일 실행 내 온라인 적응.
SIA: Self Improving AI with Harness & Weight Updates
- 서지: (P. Hebbar 외, 2026-05, 2605.27276).
- 무엇을 다루나: 하네스 업데이트 학파와 test-time training 학파를 통합 — Feedback-Agent가 하네스와 가중치를 동시 갱신.
- 결과·수치: 3개 대조 도메인(중국 법률 분류·GPU 커널 최적화·단세포 RNA denoising)에서 두 레버 결합이 스캐폴드 반복 단독을 상회: LawBench +25.1%, GPU 커널 12.4% 향상, denoising +20.4%.
- 한계·의의/교차: "하네스 업데이트는 모델을 agentic하게 만들고, 가중치 업데이트는 도메인 직관을 만든다." 교차: T9(모델-하네스 공진화).
Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills
- 서지: (C. Xiao 외, 2026-06, 2606.07412).
- 무엇을 다루나: 해결 트레이스를 agent skill(반복 실패·효과적 수리 패턴 요약)로 증류해 실제 리포에서 targeted repair task를 생성하는 폐루프. execution-based validation + solver-gradient alignment reward로 검증.
- 결과·수치: SWE-bench Verified 3회 반복 후 50.40%, 동일 예산에서 자기진화 baseline 상회.
SEAGym: An Evaluation Environment for Self-Evolving LLM Agents
- 서지: (C. Zheng 외, 2026-06, 2606.17546).
- 무엇을 다루나: 자기진화의 평가 인프라.
- 결과·수치: 하네스 업데이트를 train/validation/test/replay/cost 5뷰로 측정, Harbor-호환 벤치를 동적 자기진화 소스로 변환.
- 결과·수치: Terminal-Bench 2.0·HLE에서 ACE·TF-GRPO·AHE 비교 — 잦은 업데이트가 held-out 개선에 실패하거나 유용한 중간 스냅샷이 나중에 붕괴할 수 있음을 드러냄.
- 한계·의의/교차: 의의: "자기진화가 실제로 재사용 가능한 개선인가"를 측정하는 뷰 제공.
AgentX / Harness Evolution layer (SGPO)
- 서지: (C. Lao 외 61인, 2026-06, 2606.26859).
- 무엇을 다루나: 프로덕션 배포된 멀티에이전트가 추천 실험을 자율 생성·구현·평가하는 폐루프.
- 읽을 점: Harness Evolution 레이어(SGPO) 가 실행 트레이스를 semantic-gradient 업데이트로 증류해 에이전트 자체를 지속 개선.
- 한계·의의/교차: 의의: 자기진화 하네스의 대규모 산업 배포 사례. (같은 팀 NOVA 2606.27243은 T10 참조.)
QueenBee Planner: Skill-Evolving Communication Topologies
- 서지: (C. Tian 외, 2026-06, 2606.27492).
- 무엇을 다루나: 에이전트 간 통신 토폴로지를 retrievable·self-improving design skill로 취급. outer LLM planner만 학습해 temporal communication DAG 생성.
- 한계·의의/교차: 핵심: 자기진화가 요행·거짓 설명을 정책으로 굳히지 않도록 held-out acceptance gate·variance-aware credit·insight falsification·structural dedup을 도입.
- 결과·수치: CF fulltest에서 RMSE 12.53→7.87.
- 한계·의의/교차: 교차: T6.
The Last Harness You'll Ever Build
- 서지: (H. Seong 외, 2026-04, 2604.21003) (배경/범위 밖).
- 무엇을 다루나: 2층 자동화: Harness Evolution Loop(Worker·Evaluator·Evolution 에이전트가 단일 과제 하네스 최적화) + Meta-Evolution Loop(진화 blueprint 자체를 다양한 과제에서 최적화).
- 결과·수치: "수동 하네스 엔지니어링 → 자동 하네스 엔지니어링 → 자동화의 설계 자체를 자동화"로 프레이밍.
- 한계·의의/교차: 의의: 자기진화 계열의 개념적 극한(범위 밖이나 핵심).
T2 공통 관점: (1) 진화 신호원이 다양화됨 — 정답 검증셋(전통) → 과거 트레이스 self-preference(RHO) → success-trace distillation(APEX) → 모델 가중치 공동갱신(SIA). (2) 회귀 방지·falsification이 공통 안전장치 — Self-Harness의 regression testing, QueenBee의 acceptance gate, AHE의 falsifiable 계약. "요행을 정책으로 굳히지 않기"가 반복 모티프. (3) 진화 대상이 프롬프트 한 축에서 하네스·원칙·토폴로지·가중치의 다축 공진화로 확장 중.
4-C. T3 — 컨텍스트 엔지니어링·관리
읽기 맥락: 이 절은 제한된 컨텍스트 창에서 무엇을 유지하고 압축하고 버릴지 다룬다. 단순 비용 절감이 아니라 계획 유지와 안전 제약 보존까지 포함한다.
6책임 중 context 축. 2026년 여름의 전환점은 컨텍스트 관리가 "효율 최적화"에서 "안전-critical·load-bearing 계층" 으로 재규정된 것이다.
Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using Agents
- 서지: (A. Lodha 외, 2026-06, 2606.10209).
- 무엇을 다루나: MS Dynamics 365 expense itemization(MCP 툴)에서 GPT-5 4구성 비교. no-user-model 8.0% → full-context 71.0%(1.48M 토큰, 14.56h) → 최근 5개 tool call로 pruning 79.0%(535K 토큰, 5.39h) → pruning+요약 91.6%(553K 토큰, 5.79h).
- 결과·수치: "선택적 최근 보존 + 압축 요약"이 신뢰성·효율 모두에서 full-history를 능가.
- 결과·수치: Claude Sonnet 4.5 교차확인.
Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents
- 서지: (A. Mehta, A. Datta, 2026-06, 2606.22953).
- 무엇을 다루나: replay pairing 진단(계획 유/무 궤적의 hidden-state cosine distance 측정)으로, 표준 LLM 에이전트가 계획을 지속 상태로 이월하지 못하고 컨텍스트에 남아 있어야만 의존함을 실증.
- 결과·수치: Llama-3.1-70B에서 계획 신호가 1스텝 후 4.1배 감쇠. naive 계획 축출이 ALFWorld 성공률 -34.7pp, probe-gated 재노출로도 회복 안 됨. reasoning 모델의
<think>재유도 confound를 명명·교정. - 한계·의의/교차: 의의: "계획 보호만으로는 부족" — 컨텍스트 관리가 근본 문제임을 증명.
Governance Decay: How Context Compaction Silently Erases Safety Constraints
- 서지: (S. Chen, 2026-06, 2606.22528).
- 무엇을 다루나: 컨텍스트 압축이 안전 제약을 조용히 삭제하는 실패 모드를 명명.
- 결과·수치: ConstraintRot 벤치(1,323 에피소드, 7개 모델군): 위반율이 full-context 0% → 압축 후 30%(일부 모델 59%).
- 결과·수치: 제약이 요약에 살아남으면 0%, 탈락하면 38%.
- 어떻게/구성: Compaction-Eviction Attack(요약기가 정책을 누락하도록 유도)이 전 모델을 무력화.
- 결과·수치: Constraint Pinning(거버넌스 제약을 손실 압축에서 격리)으로 위반 0% 회복.
- 한계·의의/교차: 의의: 컨텍스트 관리 = 1급 거버넌스 표면.
- 결과·수치: T8과 교차.
LLM Agents Are Latent Context Managers: VISTA
- 서지: (B. Xu 외, 2026-06, 2606.30005).
- 무엇을 다루나: 프론티어 모델이 자기 컨텍스트에 proprioceptively blind(크기·나이·사용도를 못 봄)하다는 진단.
- 어떻게/구성: 유능한 컨텍스트 관리가 이미 모델에 latent하며 필요한 건 학습된 정책이 아니라 인터페이스라는 가설.
- 결과·수치: VISTA(training-free·model-agnostic): 워킹 메모리를 타입드·addressable 블록으로, per-block 토큰/recency/access 대시보드로 노출, 블록을 복구 가능 페이로드로 아카이브.
- 결과·수치: LOCA-Bench에서 Gemini-3-Flash 22.7→50.7%, 컨텍스트 압박이 클수록 이득 증가.
Learning Agent-Compatible Context Management (AdaCoM)
- 서지: (L. Yi 외, 2026-05, 2605.30785).
- 무엇을 다루나: 외부 LLM을 RL로 학습시켜 frozen 에이전트의 컨텍스트를 유연 수정(closed-source 에이전트에도 적용 가능).
- 읽을 점: Fidelity-Reliability Trade-off 발견: vanilla ReAct 성능이 높은 에이전트는 고충실도 보존이, 낮은 에이전트는 공격적 압축이 유리.
- 읽을 점: 유사 능력 에이전트 간 전이가 가장 효과적.
- 한계·의의/교차: 의의: 재사용 가능한 컨텍스트 관리자를 향한 실용 경로.
TokenPilot: Cache-Efficient Context Management
- 서지: (B. Xu 외, 2026-06, 2606.17016).
- 무엇을 다루나: text sparsity와 프롬프트 캐시 연속성 사이의 트레이드오프(무제약 시퀀스 변형이 prefix 불일치·캐시 무효화 유발)를 규명.
- 결과·수치: Ingestion-Aware Compaction(프롬프트 prefix 안정화)+Lifecycle-Aware Eviction(잔여 효용 모니터).
- 결과·수치: PinchBench/Claw-Eval에서 비용 최대 61%(isolated)·87%(continuous) 절감.
- 결과·수치: LightMem2에 통합.
ACE: Pluggable Adaptive Context Elasticizer across Agents
- 서지: (N. Liao 외, 2026-06, 2606.31564).
- 무엇을 다루나: 무손실 메시지 계층(raw+압축 abstraction 동시 저장) + 각 스텝을 raw/abstract/drop으로 적응 배정하는 가역(reversible) 설계.
- 결과·수치: ReAct·DeepAgent·WebThinker·MiroFlow 4개 프레임워크에 무학습·무개조로 부착, truncation·summarization baseline을 일관 상회.
- 한계·의의/교차: 의의: "한번 버리면 복구 불가"라는 기존 압축의 비가역성 해결.
A Language for Describing Agentic LLM Contexts (ACDL)
- 서지: (N. Peleg Pelc 외, 2026-05, 2605.01920).
- 무엇을 다루나: 컨텍스트 구성·진화를 정밀·가독·표준적으로 기술하는 형식 명세 언어. role message sequence·dynamic content·time-indexed reference·조건/반복 구조 구성자.
- 읽을 점: 손그림/형식언어 렌더링 모두 지원(acdlang.org).
- 한계·의의/교차: 의의: 컨텍스트 엔지니어링의 문서화·커뮤니케이션 표준 시도.
Parallel Context Compaction for Long-Horizon LLM Agent Serving
- 서지: (M. Cim 외, 2026-05, 2605.23296).
- 무엇을 다루나: 순차 요약이 수십 초 블로킹·불예측 보존을 유발하는 문제를, 병렬 compaction(블록별 병렬 요약)으로 해결.
- 결과·수치: 8B~120B 4개 백본에서 요약량의 세밀·예측 가능한 제어 + end-to-end wall time 단축.
- 한계·의의/교차: 의의: 컨텍스트 관리를 서빙 시스템 문제로 다룸.
Mise en Place for Agentic Coding: Deliberate Preparation as Context Engineering
- 서지: (A. Zigler, 2026-05, 2605.05400).
- 무엇을 다루나: "vibe coding"의 대안으로 준비(mise en place) 3단계(contextual grounding·collaborative specification·task decomposition) 방법론.
- 결과·수치: 해커톤에서 ~2h 준비로 병렬 에이전트가 풀스택 플랫폼 구현.
- 읽을 점: context fluency를 신흥 개발자 역량으로 제시.
- 한계·의의/교차: 의의: 컨텍스트 엔지니어링의 실무 방법론화.
A Dataset of Agentic AI Coding Tool Configurations
- 서지: (M. Galster 외, 2026-05, 2605.08435).
- 무엇을 다루나: 5개 툴(Claude Code·Copilot·Codex·Cursor·Gemini)·8개 설정 메커니즘(Context Files·Skills·Rules·Hooks 등)의 4,738 리포·15,591 설정 아티팩트·148,519 AI 공저 커밋 큐레이션(CC BY 4.0).
- 한계·의의/교차: 의의: 하네스 설정 관행의 실증 연구 기반.
- 결과·수치: T4의 산업 관행 근거와 연결.
T3 공통 관점: (1) 컨텍스트 관리가 효율 문제에서 안전·신뢰성 문제로 승격(Governance Decay, Plans Don't Persist). (2) 설계 축이 "무엇을 버리나"에서 "가역적으로 무엇을 노출하나"로 이동(VISTA·ACE의 복구 가능 아카이브). (3) 캐시 연속성이 새 제약으로 부상(TokenPilot). (4) 형식화·표준화 시도(ACDL) 등장.
4-D. T4 — 평가·벤치마크·모델vs하네스 분리
읽기 맥락: 이 절은 점수가 모델만의 결과인지, 하네스와 환경까지 섞인 결과인지 분리하려는 흐름을 다룬다. 정확도뿐 아니라 지속성, 프로세스 규율, 평가 하네스 자체의 견고성도 함께 본다.
6책임 중 verification 축이 메타 레벨로 확장. 관통 주제: 벤치마크가 모델·하네스·환경을 분리 측정해야 한다.
Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering
- 서지: (M. Gorinova 외, 2026-06, 2606.17799).
- 무엇을 다루나: 이 테마의 선언문(position paper).
- 어떻게/구성: 현행 벤치마크가 (i) 모델을 나머지 하네스와 혼동하고, (ii) 단일 참조 해답으로 채점해 유효 대안을 패널티화하며, (iii) 컴포넌트 수준 이터레이션 신호가 없다고 비판.
- 결과·수치: "코딩 에이전트는 모델이 아니라 system harness(모델·하네스·컨텍스트·환경·피드백의 합성)"이며 어느 하나가 모델 세대차만큼 점수를 움직인다.
Claw-SWE-Bench: Evaluating OpenClaw-style Agent Harnesses
- 서지: (M. Zheng 외, 2026-06, 2606.12344).
- 무엇을 다루나: 이질적 하네스("claw")를 고정 프롬프트·예산·워크스페이스 계약·평가기 하에 공정 비교하는 adapter protocol(350 이슈, 8언어, 43 repo).
- 한계·의의/교차: 결정적 수치: 동일 GLM 5.1 백본에서 minimal direct-diff adapter는 Pass@1 19.1%, full adapter는 73.4% — adapter 설계가 성능을 좌우.
- 결과·수치: 모델 선택이 29.4pp, 하네스 선택이 27.4pp를 움직임.
- 결과·수치: 하네스·비용을 SWE 평가의 1급 축으로.
StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns
- 서지: (V. Sobal 외, 2026-06, 2606.19613).
- 무엇을 다루나: "몇 %를 푸나"가 아니라 "몇 턴을 버티나"(최대 100턴, 최대 6,000줄).
- 어떻게/구성: 프로그래밍적 테스트 생성(LLM 무관).
- 결과·수치: 발견: (1) 전 모델이 5–6턴에 실패, (2) 테스트 피드백+재시도가 통과 턴수 최대 12배 개선, (3) 강한 모델은 최선/최악 하네스 간 최대 6배 격차, 약한 모델은 어떤 하네스로도 실패.
- 읽을 점: AWS 공개(github.com/amazon-science/StaminaBench).
ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer
- 서지: (J. Huang 외, 2026-06, 2606.05548).
- 무엇을 다루나: 인간 개발자를 LLM 코딩 에이전트로 대체해 프레임워크 선택 효과를 측정(개발자 고정, 프레임워크만 변경).
- 결과·수치: 51개 Python ADK(204 pair).
- 결과·수치: 생성 성공 57%, 비용 5.6배 차(프레임워크 복잡도 proxy).
- 결과·수치: 단일 지배 프레임워크 없음(중앙값 32% 해결).
- 결과·수치: 문서·소스·파라메트릭 지식이 대체 가능(28–40% 밴드).
RigorBench: Benchmarking Engineering Process Discipline
- 서지: (M.B. Madiraju, M.S.P. Madiraju, 2026-06, 2606.22678).
- 무엇을 다루나: 결과 정확도가 아니라 프로세스 규율(Planning Fidelity·Verification Coverage·Recovery Efficiency·Abstention Quality·Atomic Transition Integrity) 최초 측정.
- 결과·수치: Agent-Skills·Superpowers·Agent-Rigor 하네스를 with/without 대조: 구조적 규율이 프로세스 품질 +41%, downstream 정확도 +17%.
- 읽을 점: "how가 what만큼 중요"의 정량 증거.
AgentBeats: Agentifying Agent Assessment
- 서지: (X. Liu 외 23인, 2026-06, 2606.13608).
- 무엇을 다루나: 고정 LLM 중심 하네스가 통합 부담·test-production mismatch를 낳는 문제를, judge agent + 표준 프로토콜(A2A·MCP) 로 해결(AAA: Agentified Agent Assessment).
- 결과·수치: 5개월 공개 대회 298 judge·467 subject 에이전트로 검증.
- 한계·의의/교차: 의의: 평가 하네스의 표준화·재현성.
Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops
- 서지: (Z. Zhong 외, 2026-06, 2606.08960).
- 무엇을 다루나: 5개 터미널 벤치 1,968태스크 중 323개(16%)가 프론티어 모델에 해킹 가능(reward hacking).
- 어떻게/구성: hacker-fixer-solver 교대 루프로 per-task 수작업 없이 exploit-저항 검증기 구축.
- 결과·수치: KernelBench 공격성공률 62%→0%.
- 읽을 점: 약한 에이전트가 강한 해커를 방어 가능.
- 읽을 점: Terminal Wrench 공개.
- 한계·의의/교차: 의의: 평가 하네스 자체의 견고화. (T2 자기진화 기법을 평가에 적용.)
Dissecting model behavior through agent trajectories
- 서지: (G. Gupta 외, 2026-06, 2606.17454).
- 무엇을 다루나: intent-execution gap(모델 의도 vs 하네스 실행의 불일치)을 형식화.
- 결과·수치: 커스터마이즈 가능 하네스 SSA로 여러 모델군 pass@1 재현/개선하고, 138k 트레이스를 code state-space로 표현해 pass@1 너머 모델별 행동차(edit frequency·testing·phase-transition) 관찰.
- 어떻게/구성: "하네스-모델 정렬이 툴·실행루프만큼 중요."
Strained Coherence: A Pre-Failure Signal in Coding Agent Trajectories
- 서지: (M. Pandya 외, 2026-06, 2606.07889).
- 무엇을 다루나: 에이전트가 문제를 인지·언급하고도 반대로 행동하는 패턴(verbalized reward hacking과 중첩).
- 결과·수치: Claude Sonnet 4.6 judge로 44 Terminal-bench-2 궤적 분석: 플래그된 궤적 94% 실패 vs 미플래그 46%(47pt 격차).
- 결과·수치: 첫 플래그가 궤적 시간 83–84% 지점에 median 등장 → 사전 경고 신호.
Layer-Isolated Evaluation: No-LLM, Regression-Locked Test Harness
- 서지: (S. Zhang 외, 2026-06, 2606.11686).
- 무엇을 다루나: 배포된 ordering 에이전트를 고정 레이어 택소노미(ontology·intent·routing·decomposition·escalation·safety·memory)로 분해, 각 레이어를 결정론적 no-LLM assertion slice로 CI에서 검사(238 케이스, ~10ms/case).
- 결과·수치: 핵심 발견 masking: 집계 pass-rate는 -1.7~5.9pp만 움직이나 해당 slice는 -25~91pp 폭락 → 집계 지표가 가리는 회귀를 지역화.
- 한계·의의/교차: 의의: 하네스의 결정론적 스캐폴드 컴포넌트 테스트.
Act As a Real Researcher (AARRI-Bench)
- 서지: (J. Wang 외, 2026-06, 2606.07462).
- 무엇을 다루나: "agentic harness"를 명시적 평가 대상으로 삼아 연구 인턴 시나리오 평가.
- 결과·수치: 최고 구성(Mini-SWE-Agent+Claude Opus 4.7)도 68.3%, 미묘하지만 결정적인 디테일을 놓침.
- 읽을 점: "researcher-like AI는 복잡한 스캐폴딩이 아니라 연구 행동 탐구가 필요."
T4 공통 관점: (1) 모델/하네스/환경 분리 측정이 대세(Position paper의 선언 → Claw-SWE-Bench·SSA의 정량화). (2) 평가 축이 "정확도"에서 stamina(StaminaBench)·process discipline(RigorBench)·reliability로 다변화. (3) 평가 하네스 자체가 공격 대상(hacker-fixer)이자 지역화 대상(layer-isolated). (4) 반복 확인되는 수치: 하네스 선택이 모델 선택만큼(때로 그 이상) 점수를 움직인다.
4-E. T5 — 에이전트 메모리·상태
읽기 맥락: 이 절은 세션을 넘는 기억과 런타임 상태를 다룬다. 검색 성능뿐 아니라 무엇을 잊어야 하는지, 공유 메모리를 어떻게 통제해야 하는지가 중심이다.
6책임 중 state 축. 이 시기 메모리 연구의 특징은 평가·시스템 관점의 성숙(무엇이 실제로 측정되는가에 대한 회의)이다.
Are We Ready For An Agent-Native Memory System?
- 서지: (W. Zhou 외, 2026-06, 2606.24775).
- 무엇을 다루나: 에이전트 메모리를 데이터 관리 관점(representation·extraction·retrieval/routing·maintenance 4모듈)으로 12개 시스템×5 워크로드(11 데이터셋) 체계 평가.
- 결과·수치: 단일 지배 아키텍처 없음 — 효과는 메모리 구조가 워크로드 병목과 정렬되는가에 의존. localized maintenance가 global reorganization보다 비용 효율적.
- 한계·의의/교차: 의의: 메모리 서베이/평가의 기준.
Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads
- 서지: (Y. Omri 외, 2026-06, 2606.06448).
- 무엇을 다루나: 에이전트 메모리의 첫 시스템 특성화.
- 결과·수치: 4축 시스템 택소노미 + phase-aware 프로파일링 하네스(construction/retrieval/generation 비용 귀속) + 10개 시스템 특성화 + scheduling·capability floor·freshness-latency·fleet-scale 등 10개 시스템 권고.
- 한계·의의/교차: 의의: 메모리를 시스템 인프라 문제로 규정.
Governed Shared Memory for Multi-Agent LLM Systems (MemClaw)
- 서지: (Y. Margalit 외, 2026-06, 2606.24535).
- 무엇을 다루나: fleet-memory 문제를 형식화하고 4대 실패모드(unauthorized leakage·stale propagation·contradiction persistence·provenance collapse) 규정. scoped retrieval·temporal supersession·provenance·policy-governed propagation 프리미티브를 프로덕션 서비스 MemClaw에 구현, ArgusFleet 하네스로 평가.
- 어떻게/구성: live 프로덕션 측정으로 설계-only 연구가 놓치는 결함(sub-tenant scope 우회, 파이프라인 순서 충돌) 노출.
- 한계·의의/교차: 의의: "장기 컨텍스트 검색만으로는 프로덕션 멀티에이전트 메모리에 불충분."
OpenRath: Session-Centered Runtime State for Agent Systems
- 서지: (F. Wen 외, 2026-06, 2606.19409).
- 무엇을 다루나: 파편화된 런타임 상태(transcript·tool effect·memory event·branch provenance·replay) 문제를 Session을 1급 런타임 값으로 두어 해결(PyTorch-like 프로그래밍 모델).
- 어떻게/구성: Session은 branchable·inspectable·replayable. fork/merge/replay가 외부 트레이스 재구성이 아닌 명시적 런타임 연산.
- 한계·의의/교차: 의의: 하네스의 상태 층을 프로그래밍 추상으로 승격.
Control-Plane Placement Shapes Forgetting
- 서지: (D. Yang, 2026-06, 2606.15903).
- 무엇을 다루나: LLM이 메모리 파이프라인의 어디(recall plane vs control plane)에 위치하는지가 망각 실패 모드를 결정.
- 결과·수치: 13개 구성·385 적대 케이스: deterministic primitive는 lexical/temporal엔 충분하나 canonicalization 실패, inscribe-time LLM은 canonicalization 회복하나 intent-aware deletion 실패, mutation-time hook이 intent-aware deletion(78–85%)과 거의 모든 범주를 동시 개선(91.7–93.2%).
- 읽을 점: ForgetEval 공개.
- 어떻게/구성: "프로덕션 실패는 recall이 아니라 forgetting 실패인데 기존 벤치는 recall만 측정."
MemDelta: Controlled Baselines and Hidden Confounds in Agent Memory Evaluation
- 서지: (K. Wang, 2026-06, 2606.29914).
- 무엇을 다루나: 메모리 평가의 숨은 교란변수 경고.
- 결과·수치: 한 번에 한 컴포넌트만 바꾸는 통제 프로토콜(LongMemEval-S): 임베딩 모델만 바꿔도 정확도 ±6.2pp 이동, 모델군에 따라 RAG vs full-context 순위 역전, agent self-memory(42%)가 basic retrieval(47%)에 미달.
- 결과·수치: "임베딩 고정·모델군 층화·write-path 비용 보고" 권고.
- 한계·의의/교차: 의의: 메모리 성능 주장의 방법론적 엄밀성 요구.
SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents
- 서지: (S. Gao 외, 2026-06, 2606.28434).
- 무엇을 다루나: 정적 압축 대신 에이전트가 언제·무엇을·어떻게 압축할지 학습(flexible memory tool + Memory-aware GRPO, step-level credit).
- 결과·수치: SWE-Bench Verified 4B 43.4%·30B 60.2%, 성능·효율 모두 baseline 상회.
- 한계·의의/교차: 교차: T3.
T5 공통 관점: (1) 메모리 연구가 "더 나은 검색"에서 "무엇을 실제 측정하나"(평가 회의: MemDelta) 와 "무엇을 잊나"(forgetting: Control-Plane) 로 성숙. (2) 시스템·데이터관리 관점 대두(Agent Memory characterization, Are We Ready). (3) 멀티에이전트 공유 메모리 거버넌스가 프로덕션 문제로(MemClaw). (4) recall 편중 벤치의 한계 공통 지적.
4-F. T6 — 멀티에이전트 오케스트레이션
읽기 맥락: 이 절은 여러 에이전트를 어떻게 나누고, 연결하고, 권한을 부여할지 다룬다. 더 많은 에이전트가 항상 낫다는 가정보다 구조와 정보 병목이 더 중요하다는 흐름이 반복된다.
Reward Modeling for Multi-Agent Orchestration (OrchRM)
- 서지: (K.Y. Tsang 외, 2026-06, 2606.13598).
- 무엇을 다루나: 인간 주석·비싼 sub-agent rollout 없이 오케스트레이션 레벨에서 직접 품질 평가(중간 산출물로 Bradley-Terry win-lose pair).
- 결과·수치: 토큰 최대 10배 효율, MAS test-time scaling 최대 +8%.
- 읽을 점: 여러 도메인 전이.
LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual RL
- 서지: (X. Chen 외, 2026-05, 2605.14483).
- 무엇을 다루나: 역할·용량·의존성을 통합한 실행형 오케스트레이션 명세를 생성하는 오케스트레이터. orchestration-level GRPO + localized counterfactual signal(편집된 span에만 reward contrast).
- 결과·수치: 6개 벤치(MMLU·GSM8K·HumanEval 등)에서 SOTA.
PerspectiveGap: A Benchmark for Multi-Agent Orchestration Prompting
- 서지: (Y. Sun 외, 2026-06, 2606.08878).
- 무엇을 다루나: "각 sub-agent가 무엇을 알아야 하는가"를 결정하는 능력 평가(110 시나리오).
- 결과·수치: 27개 상용 모델: GPT-5.5가 압도(62.0%)하나 평균 pass rate 14.9%, Opus 4.7은 강한 코딩에도 오케스트레이션 프롬프팅이 약함.
- 어떻게/구성: "멀티에이전트 오케스트레이션 프롬프팅은 별개의 과소평가된 능력."
How Task Structure Limits Multi-Agent Success
- 서지: (S. Pan, M. Luo, 2026-06, 2606.13733).
- 무엇을 다루나: 정보이론적 상한: 제약 그래프 분할로 생기는 정보 병목(minimum cut cost C_min)에 따라 MAS 성공확률이 지수적으로 감쇠.
- 어떻게/구성: SWE-bench 제출 데이터로 검증.
- 한계·의의/교차: "C_min이 높으면 에이전트/통신을 늘리지 말고 태스크를 재구조화하라." 의의: 멀티에이전트의 근본 한계 이론.
ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows
- 서지: (K. Xiong 외, 2026-06, 2606.31174).
- 무엇을 다루나: 리더 LLM의 관리 능력만 격리 측정(고정 sub-agent 풀, 41 시나리오, execution-based, LLM judge 없음).
- 결과·수치: Subagent-Management Score(SMS)=정확도×least-privilege·modality-routing.
- 결과·수치: 발견: 관리 병목은 지각이 아니라 권한 부여(어떤 모델도 workspace-permission precision 50% 미달), 비용과 관리 품질 decoupled(API 비용 100배 차이인데 점수는 4배 미만).
- 한계·의의/교차: 교차: T7(재귀 하네스), T8(권한).
Unlocking Model Potentials Through Adaptive Multi-Agent Scaffolding (icat-agent)
- 서지: (Y. Chen 외, 2026-06, 2606.25514).
- 무엇을 다루나: 공유 컨텍스트를 동기 event-based 메시지 패싱으로 대체한 탈중앙 스캐폴딩. rubric 기반 이슈 품질 검사로 워크플로 전략적 pivot(잘 정의된 이슈는 병렬 패칭·검증, 저품질은 예비 탐색).
- 결과·수치: SWE-bench Verified +3.6~8.4%, SWE-bench Pro 67.4%(이전 SOTA 59.10% 대비 +8.3pp), 인스턴스당 비용 $1.18 절감.
- 어떻게/구성: "견고한 스캐폴드가 고정 모델의 잠재 능력을 해방."
Swarm Skills: A Portable, Self-Evolving Multi-Agent System Specification
- 서지: (X. Zhang 외, 2026-05, 2605.10052).
- 무엇을 다루나: Anthropic Skills 표준을 멀티에이전트로 확장(roles·workflows·execution bounds + self-evolution 구조).
- 읽을 점: 성공 트레이스를 새 Swarm Skill로 자동 증류·패치(Effectiveness·Utilization·Freshness 채점).
- 읽을 점: zero-adapter cross-agent 이식성(progressive disclosure).
- 한계·의의/교차: 교차: T2.
- 읽을 점: "Coordination Engineering"을 프롬프트/컨텍스트 엔지니어링 다음 패러다임으로 제시.
MAS-Lab: A Specification-Driven Validation Framework
- 서지: (J. Augé 외, 2026-06, 2606.30546).
- 무엇을 다루나: 즉흥적·명령형 MAS 개발(데모 최적화)의 신뢰성 문제를, 선언적 스펙 레이어(Spec) + MAS-OS(실행/제어 프리미티브) + Lab overlay(관측·평가) 3층으로 해결.
- 읽을 점: "실험에서 관찰한 행동이 프로덕션 행동의 근거가 되지 못한다"는 문제의식.
- 읽을 점: 의미적 의도와 운영 관심사 분리.
- 한계·의의/교차: 의의: MAS를 스크립트 모음에서 엔지니어링된 분산 시스템으로.
T6 공통 관점: (1) 오케스트레이션 자체가 학습·보상 모델링 대상(OrchRM·LEMON). (2) 멀티에이전트에 근본 한계가 있음이 이론(정보병목)·평가(PerspectiveGap 14.9%, ClawArena 권한병목)로 드러남 — "무조건 에이전트를 늘리면 낫다"는 가정 반박. (3) 오케스트레이션을 이식 가능·검증 가능한 명세로 만들려는 시도(Swarm Skills·MAS-Lab).
4-G. T7 — 툴 오케스트레이션·재귀·인터페이스
읽기 맥락: 이 절은 에이전트가 어떤 툴을 언제 어떻게 쓰게 할지, 그리고 서브에이전트나 재귀 하네스를 어떻게 조직할지 다룬다. 행동 표면이 코드에서 GUI·CLI·외부 툴로 넓어진다는 점이 중요하다.
6책임 중 action·observation 축.
Recursive Agent Harnesses (RAH)
- 서지: (E. Lumer 외, 2026-06, 2606.13643).
- 무엇을 다루나: 재귀 단위를 model call이 아니라 파일시스템·코드실행·계획을 갖춘 완전한 하네스로 두는 패턴 명명("harness recursion").
- 어떻게/구성: 부모가 스크립트로 서브에이전트 하네스를 병렬 spawn.
- 결과·수치: GPT-5 고정 시 Codex baseline 71.75%→81.36%(Oolong-Synthetic, 최대 4M 토큰) — 모델이 아닌 하네스 기여.
- 결과·수치: Claude Sonnet 4.5로 89.77%.
- 읽을 점: Anthropic dynamic workflows 언급.
- 한계·의의/교차: 교차: T6.
MAVEN: Improving Generalization in Agentic Tool Calling
- 서지: (O. Ghugarkar 외, 2026-05, 2605.30738).
- 무엇을 다루나: 구조적 분해·적응형 툴 오케스트레이션·중간 검증의 경량 기호 스캐폴드.
- 결과·수치: GPT-OSS-120b를 48%→71%(무학습).
- 결과·수치: 프론티어에 필적하며 비용 ~1/10.
- 어떻게/구성: MAVEN-Bench(부분 추론 품질 vs end-to-end 성공 격차 노출) 도입.
SING: Synthetic Intention Graph for Scalable Active Tool Discovery
- 서지: (Q. Xiao 외, 2026-06, 2606.16591).
- 무엇을 다루나: 툴 생태계가 수백~수천 API로 확장될 때 exhaustive schema injection의 closed-world 한계를, intention-tool graph(사용자 의도·툴 능력·협업 패턴 연결)로 동적 검색해 해결.
- 결과·수치: 7,471 툴에서 Global Recall@5 +59.8%, 성공률 +28.9%, full-corpus schema 노출 99.8% 감소.
- 한계·의의/교차: 의의: 하네스의 툴 인터페이스 확장성.
LLM-as-Code: Agentic Programming for Agent Harness
- 서지: (J. Qi 외, 2026-06, 2606.15874).
- 무엇을 다루나: 토큰 폭발·control-flow 환각·불신뢰 완료는 버그가 아니라 결정론적 작업(루프·분기·시퀀싱)을 확률 시스템에 맡긴 아키텍처적 귀결이라 주장.
- 결과·수치: 프로그램이 모든 control flow를 지배하고 LLM은 그 안의 adaptive 컴포넌트(LLM-as-Code)로만 호출.
- 결과·수치: 컨텍스트가 실행 이력의 call tree(DAG)로 구성돼 call depth로 길이 결정. computer-use 장기 시각 시퀀스 안정성 향상.
- 한계·의의/교차: 의의: "모델 오케스트레이터" vs "프로그램 지배" 논쟁의 한 극.
PhoneHarness: Mixed GUI, CLI, and Tool Actions
- 서지: (C. Li 외, 2026-06, 2606.14832).
- 무엇을 다루나: 폰 에이전트를 GUI 컨트롤러가 아니라 혼합 액션(GUI·CLI·host-side tool) 라우팅 하네스로. deterministic action routing + bounded GUI delegation + auditable trace.
- 어떻게/구성: 검증 가능한 side effect로 채점(그럴듯한 답이 아니라).
- 결과·수치: 75.0% pass(최강 non-PhoneHarness 대비 +12.9pp).
- 어떻게/구성: "신뢰할 폰 자동화는 시각 GUI 제어가 아니라 action-surface routing·검증 실행에 의존."
FastContext: Training Efficient Repository Explorer for Coding Agents
- 서지: (S. Zhang 외, 2026-06, 2606.14066).
- 무엇을 다루나: repo 탐색이 토큰 예산을 소모하고 solver 컨텍스트를 오염시키는 문제를, 전용 탐색 서브에이전트(4B–30B, on-demand 병렬 툴콜, 간결한 경로·라인 반환)로 분리.
- 결과·수치: SWE-bench Multilingual/Pro/QA에서 해결률 +5.5%, 토큰 최대 60% 감소.
- 한계·의의/교차: 교차: T3·T6.
- 읽을 점: MS 공개.
Dockerless: Environment-Free Program Verifier for Coding Agents
- 서지: (W. Zeng 외, 2026-06, 2606.28436).
- 무엇을 다루나: Docker 환경 없이 패치를 실행하지 않고 agentic repo 탐색 증거로 검증. verifier 벤치에서 최강 오픈소스 +14.3 AUC.
- 결과·수치: SFT filter+RL reward로 완전 환경-free post-training: SWE-bench Verified 62.0%.
- 한계·의의/교차: 의의: 검증 하네스의 인프라 비용 제거.
T7 공통 관점: (1) 서브에이전트 분리가 반복 패턴 — 탐색(FastContext)·재귀 하네스(RAH)로 컨텍스트를 격리. (2) 툴 스케일 문제(SING)와 control-flow 주도권 논쟁(LLM-as-Code)이 부상. (3) action surface가 단일(코드)에서 혼합(GUI+CLI+tool)으로 확장(PhoneHarness).
4-H. T8 — 안전·거버넌스·OS레벨 강제
읽기 맥락: 이 절은 안전과 권한을 프롬프트 지침이 아니라 실행 계층에서 강제하려는 연구를 묶는다. 공통 방향은 결정론적 훅, per-call 인가, OS 레벨 정책 강제다.
ActPlane: Programmable OS-Level Policy Enforcement for Agent Harnesses
- 서지: (Y. Zheng 외, 2026-06, 2606.25189).
- 무엇을 다루나: 툴콜 가드레일은 tool layer를 우회하는 시스템 액션을 놓치고 OS 샌드박스는 불투명 에러를 낸다는 문제를, eBPF 기반 OS 커널 정책 엔진으로 해결(IFC DSL로 cross-event 정책).
- 결과·수치: "policy context는 태스크에 가까운 에이전트에, 강제는 모든 실행 경로를 덮는 OS에." 간접 실행 경로 컴플라이언스 향상, 오버헤드 1.9–8.4%.
AOHP: Android Open Harness Project — OS-Level Agent Harness
- 서지: (S. Zhao 외, 2026-06, 2606.23449).
- 무엇을 다루나: 앱 중심 OS가 에이전트 지원이 없다는 문제를, 에이전트를 1급 OS 액터로 두는 AOSP 기반 하네스로. personalized service composition·efficient agent interface·secure information flow 3기제. task 완료율 +21.12%, 토큰 비용 -51.55%, 안전정책 준수 향상.
- 한계·의의/교차: 의의: agent-native OS의 오픈 테스트베드.
Harness-MU: Safe, Governed Harness for Multi-User LLM Agents
- 서지: (W. Fan 외, 2026-06, 2606.21856).
- 무엇을 다루나: "거버넌스 제약(누가 인가·무엇이 제한·누구 지시 우선)은 결정론적 런타임 변수이므로 LLM이 아니라 실행 훅이 강제해야 한다"는 통찰.
- 어떻게/구성: 언어 생성과 안전 오케스트레이션 분리(model-agnostic·zero-tuning).
- 결과·수치: Muses-Bench에서 모든 접근제어 공격에 프라이버시 보존, utility +0.28~0.39, 지시준수 +48.9pp.
- 한계·의의/교차: 논문이 명시적으로 "Harness Engineering 철학을 advance"함.
Capability Gates Are Not Authorization: Confused-Deputy Failures in LLM Agent Frameworks
- 서지: (D. Mellafe Zuvic, 2026-06, 2606.28679).
- 무엇을 다루나: LangChain/LangGraph·LlamaIndex·Stripe Agent Toolkit이 툴 노출과 인가를 혼동(각 호출을 구체 인자값으로 재인가하지 않음)함을 감사.
- 읽을 점: 셋 다 기본 capability gating은 있으나 결정론적 fail-closed per-call value 인가 게이트가 없음.
- 결과·수치: ScopeGate(5단계 PDP/PEP: scope·authorization·money ceiling·idempotency·default deny) 제안 — 동일 무단 payout이 LangChain 기본 dispatch에선 실행되나 ScopeGate에선 차단(0/48 static bypass).
- 한계·의의/교차: 의의: 프레임워크 기본값의 보안 결함 실증.
T8 공통 관점: (1) 결정론적 강제 원칙 — 안전·권한은 확률적 LLM이 아니라 실행 훅/OS 커널이 결정론적으로 강제해야 한다(Harness-MU·ActPlane·ScopeGate 공통). (2) 강제 지점이 tool layer에서 OS 커널·per-call 인가로 하강. (3) 컨텍스트 압축(§4-C Governance Decay)과 함께, 안전이 하네스의 횡단 관심사로 확립.
정정 노트(검증): §4-B의 HarnessFix ETCLOVG 7계층 약어 풀이(Execution·Tool·Context·Lifecycle·Observability·Verification·Governance)는 초록에 명시되지 않은 분석자 추정이다. 초록은 "실행환경·툴 인터페이스·컨텍스트·라이프사이클 오케스트레이션·관측성·검증·거버넌스"를 하네스가 제공하는 요소로 열거하며 ETCLOVG를 계층명으로 언급하나, 각 글자의 정확한 대응은 전문 확인이 필요하다. 또한 AgentX(2606.26859) 초록에는 정량 수치가 없어 효과 크기를 인용하지 않았다.
4-I. T9 — 모델-하네스 공진화·RL
읽기 맥락: 이 절은 하네스를 학습 밖의 고정 장치로 두지 않고, 모델 훈련·후훈련·RL과 함께 바꾸는 접근을 다룬다. 하네스 설계와 모델 업데이트가 서로 영향을 주는지가 핵심 질문이다.
4패러다임의 네 번째("agent-native training with co-evolution")에 해당. 하네스를 학습 루프 안으로 들여오는 계열.
The Interplay of Harness Design and Post-Training in LLM Agents
- 서지: (K. Kim 외, 2026-06, 2606.25447).
- 무엇을 다루나: 하네스(노출 툴·툴 설명·per-step 부가정보)가 보통 고정 엔지니어링 디테일로 취급되나, post-training과 상호작용함을 규명.
- 결과·수치: ALFWorld를 하네스가 제어 가능 차원이 되도록 + task/tool 환경 shift 하 평가로 확장.
- 어떻게/구성: harness-aware post-training이 in-distribution뿐 아니라 OOD 적응도 개선하며, 최소 설계 하네스는 강한 환경 shift에서 급락.
- 한계·의의/교차: 의의: 하네스 설계를 학습과 분리된 상수로 두면 안 됨을 실증.
Polar: Agentic RL on Any Harness at Scale
- 서지: (B. Xu 외, 2026-05, 2605.24220).
- 무엇을 다루나: 커스텀 하네스를 RL 환경 인터페이스로 포팅하는 어려움을, 하네스를 블랙박스로 취급(LLM API 프록시, 토큰 단위 상호작용 기록, token-faithful 궤적 재구성)하는 rollout 프레임워크로 해결.
- 결과·수치: 하네스·훈련 인프라·RL 알고리즘에 agnostic. simple GRPO로 Qwen3.5-4B를 SWE-Bench Verified에서 Codex 하네스 +22.6, Claude Code +4.8, Qwen Code +0.6, Pi +6.2점.
- 읽을 점: NeMo Gym 환경 등록.
- 한계·의의/교차: 의의: "어떤 하네스에서든" 학습 신호 보존.
Harnesses for Inference-Time Alignment over Execution Trajectories
- 서지: (B. Wang 외, 2026-05, 2605.21516).
- 무엇을 다루나: 하네스를 inference-time trajectory alignment 렌즈로 두 기제(task decomposition·guided execution)로 분리. workflow granularity·retry budget·guidance reweighting이 성능 한계를 어떻게 형성하는지 정량화하고 실패 모드(over-decomposition·over-pruning·hallucinated execution) 규명.
- 한계·의의/교차: 핵심: effective harness는 partial일 수 있다 — 초기 스텝만 지정하고 나머지는 에이전트에 맡기는 편이 완전 구조화 워크플로보다 pass rate가 높을 수 있음.
- 한계·의의/교차: 교차: T1의 "비단조성"과 공명.
HARBOR: A Harness Framework for Agentic Robot RL
- 서지: (Z. Li 외, 2026-06, 2606.08610).
- 무엇을 다루나: 로봇 RL 자동화를 harness-engineering 문제로 프레이밍 — 시뮬레이터 코드베이스+태스크 명세에서 환경 설정→정책 훈련까지 자동화.
- 어떻게/구성: 고수준 목표를 bounded stage로 분해(specialized agent·standardized command·persistent artifact·executable gate·reusable knowledge), 탈중앙 병렬 trial로 스케일.
- 결과·수치: 6벤치·16태스크(manipulation·locomotion·bimanual), 실로봇 전이.
- 한계·의의/교차: 의의: 하네스 엔지니어링 개념을 로봇 RL로 확장.
(SIA 2605.27276은 §4-B 참조 — 하네스+가중치 공동 자기개선으로 이 테마와 교차.)
T9 공통 관점: (1) 하네스가 학습과 결합됨 — 고정 상수(2606.25447 반박) → 블랙박스 RL 대상(Polar) → 가중치 공동갱신(SIA). (2) inference-time alignment 관점에서 "partial harness가 낫다"(2605.21516)는 T1 비단조성과 수렴. (3) 하네스 엔지니어링 개념이 코딩을 넘어 로봇(HARBOR)으로 일반화.
4-J. T10 — 응용·산업 시스템 하네스
읽기 맥락: 이 절은 하네스 원리가 특정 산업·과학·로봇·레거시 시스템 안에서 어떻게 구현되는지 보여준다. 반복해서 나타나는 요소는 검증 게이트, 안전 게이트, 상태 지속성, 인간 감독이다.
특정 도메인에서 하네스 원리를 구현한 사례들. "harness engineering이 도메인 특화 인프라로 구체화"되는 지점.
NOVA: Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems
- 서지: (S. Liu 외, 2026-06, 2606.27243).
- 무엇을 다루나: 산업 광고 추천모델 아키텍처 진화를 검증-인식 하네스로 자동화. architecture gradient(비미분 SGD-inspired 업데이트) + verification cascade(구조·실행·offline·online 4단계, 무효 후보 조기 차단) + L1–L4 task-level control(고위험은 Copilot 인간감독 라우팅).
- 결과·수치: L2/L3에서 최고 pass rate 54.5%/60.0%, literature-to-production 사이클 13배 단축, 온라인 A/B GMV +1.25~2.02%.
- 한계·의의/교차: 의의: 검증 게이트 내장 하네스의 대규모 배포.
Building Agent Harnesses for Scientific Curation from Multimodal Sources (Beaver)
- 서지: (S. Zhang 외, 2026-06, 2606.21005).
- 무엇을 다루나: frontier agent + multimodal evidence tooling + task scaffolding + artifact-grounded autoresearch를 결합, provenance 보존하며 논문에서 구조화 정보 추출.
- 결과·수치: GRAS 81.0(프론티어 대비 +23pt). ablation: task scaffolding·multimodal tooling·provenance가 각각 유의 기여.
- 읽을 점: "과학 큐레이션에서 harness design이 성능의 중심 결정 요인."
NORA: A Harness-Engineered Autonomous Research Agent for Spatial Data Science
- 서지: (B. Zhou 외, 2026-05, 2605.02092).
- 무엇을 다루나: GIScience 특화 멀티에이전트(21 workflow skill·9 specialist sub-agent·커스텀 MCP).
- 어떻게/구성: "scientific research agent를 위한 harness engineering을 형식화" — lifecycle hook·safety gate·generator-evaluator 분리·human-in-the-loop·state persistence로 재현성 보장.
- 결과·수치: 6 도메인 전문가+3 LLM 리뷰어 평가.
- 한계·의의/교차: 의의: 제목에 "harness-engineered"를 명시한 도메인 하네스.
A Process Harness for Uplifting Legacy Workflows to Agentic BPM (CUGA FLO)
- 서지: (F. Fournier, L. Limonad, 2026-06, 2606.27188).
- 무엇을 다루나: 결정론적 워크플로 엔진을 교체하지 않고 정책 지배 agentic 계층으로 감싸는 "process harness".
- 어떻게/구성: Task-Decision-Flow 모델(TaskAgent·DecisionAgent·FlowAgent, 명시적 policy FRAME).
- 읽을 점: 명령형 요구(결정론적 실행)와 규범적 요구(정책 프레임 자율성) 조화.
- 한계·의의/교차: 의의: 하네스가 레거시 시스템을 점진 uplift하는 패턴.
Toward Self-Evolution-Ready Workflow Harnesses
- 서지: (Y. Lin 외, 2026-06, 2606.24598).
- 무엇을 다루나: 정적 "LLM+script" 워크플로를 Strangler-Fig 마이그레이션으로 합성 가능·타입드·감사 가능 스테이지로 리팩터.
- 결과·수치: A/B/C 3층 convertibility taxonomy를 system harness 내 라우팅 스테이지로 구현.
- 한계·의의/교차: 의의: 레거시→자기진화 준비 하네스의 마이그레이션 경로.
AutoMegaKernel: A Statically-Checked Agent Harness for Megakernel Synthesis
- 서지: (J. Jaber, O. Jaber, 2026-06, 2606.09682).
- 무엇을 다루나: 스케줄을 실행 전 정적 검증(deadlock/race-freedom, 7,160 적대 스케줄에서 false-accept 0)하는 statically-checked 하네스 + 무인 autoresearch 루프가 megakernel 자기개선(1.25–1.72배).
- 한계·의의/교차: 의의: 정적 안전 검증을 하네스에 내장한 사례.
T10 공통 관점: (1) "harness engineering"이 코딩을 넘어 추천시스템(NOVA·AgentX)·과학큐레이션(Beaver)·공간데이터(NORA)·BPM(CUGA FLO)·GPU커널(AutoMegaKernel)로 도메인 확산. (2) 공통 설계 요소가 반복 등장: verification cascade / safety gate / generator-evaluator 분리 / state persistence / 정책 프레임 — §4-A의 하네스 책임 분류가 응용에서 실체화. (3) 레거시 통합(process harness·Strangler-Fig)이 실무 관심사로.
4-K. 산업 1차 자료 (블로그·기술 리포트)
이 분야는 산업 리포트가 학술 논문만큼 중요하다. 아래는 HTTP로 실존 확인한 범위 내(2026-05~07) 1차 자료다. 블로그는 상세 내용을 candidates 기록 기반으로 요약한다.
Anthropic — "The evolution of agentic surfaces: building with Claude Managed Agents"
- 서지: (2026-06-10, claude.com).
- 무엇을 다루나: 에이전트 인프라 3단계 진화를 명시: Messages API(2023, 직접 루프 구현) → Claude Agent SDK(2025, "Claude Code의 하네스 machinery" 제공) → Managed Agents(2026, brain/hands 분리 관리형). append-only 세션 로그, 시크릿 vault, TTFT 60% 단축.
- 결과·수치: "harness machinery"라는 표현을 산업이 명시적으로 사용한 1차 서사.
Anthropic — "Steering Claude Code: CLAUDE.md files, skills, hooks, rules, subagents and more"
- 서지: (2026-06-18, claude.com).
- 무엇을 다루나: 하네스 커스터마이징 7수단: CLAUDE.md(상시 지침)·rules(경로 스코프)·skills(동적 로드)·subagents(분리 컨텍스트)·hooks(이벤트 트리거)·output styles·append system prompt.
- 결과·수치: 서베이 주제(컨텍스트 엔지니어링·스킬·훅·서브에이전트)에 직결되는 실무 하네스 구성요소의 1차 문서. (본 하네스 프로젝트 자체가 이 구성요소를 사용한다.)
Anthropic — "How we contain Claude across products"
- 서지: (2026-05-25, anthropic.com).
- 무엇을 다루나: 하네스의 실행 격리·안전 계층(claude.ai gVisor, Claude Code OS 샌드박스, Cowork 봉인 VM)과 환경·모델·외부콘텐츠 3계층 방어.
- 결과·수치: T8(거버넌스)의 산업 대응.
Cognition — "Devin Fusion: Frontier Performance at 35% Lower Cost"
- 서지: (2026-06-29, cognition.com).
- 무엇을 다루나: 하이브리드 모델 하네스 — frontier 에이전트 + 저비용 sidekick 병렬 운용, 경량 분류기가 컨텍스트 compaction 시점에 모델 동적 라우팅(캐시 페널티 회피).
- 결과·수치: 내부 PR 88%를 자동 라우팅, 비용 35~41% 절감.
- 결과·수치: T3(컨텍스트)·T9(모델 라우팅)의 산업 대응.
Google DeepMind — "Co-Scientist: a multi-agent AI partner"
- 서지: (2026-05-19, deepmind.google).
- 무엇을 다루나: Gemini 기반 멀티에이전트 연합(generation/reflection/ranking/evolution/meta-review + supervisor)으로 과학 가설 생성·토너먼트 랭킹.
- 결과·수치: T6(오케스트레이션)의 산업 대응.
OpenAI — Codex Changelog
- 서지: (2026-06~07, developers.openai.com).
- 무엇을 다루나: 코딩 에이전트 하네스의 실제 구현 변화(토큰 예산 추적, MCP 툴 검색 기본화, 원격 실행기).
- 어떻게/구성: 하네스 운영 기능의 실시간 기록.
배경(범위 밖) 1차 자료: OpenAI "Harness engineering"(2026-02, 용어 원출처, 원문 403→InfoQ 교차확인), Anthropic "Harness design for long-running apps"(2026-03), "Scaling Managed Agents: brain vs hands"(2026-04), "Building a C compiler with parallel Claudes"(2026-02, 16 병렬 Claude·검증기 중요성). 부록 A 참조.
5. 관통하는 트렌드
각 트렌드는 근거 논문을 동반한다. 단일 논문에서 성급히 일반화하지 않는다.
트렌드 1 — 성능 병목의 재배치: "모델이 아니라 하네스". 2026년 여름 문헌의 압도적 공통 명제. 정량 앵커: Claw-SWE-Bench(2606.12344)의 동일 모델 19.1%↔73.4%, StaminaBench(2606.19613)의 최선/최악 하네스 6배 격차, icat-agent(2606.25514)의 고정 모델 하 +8.3pp, RAH(2606.13643)의 백본 고정 71.75%→81.36%. 이론 앵커: 2605.13357(locus = model-harness-environment), 2605.12129("It's Not the Size"). 이는 §4-D의 Position paper(2606.17799)가 "벤치마크가 모델·하네스를 혼동한다"고 선언하며 방법론적 요구로 승격됐다.
트렌드 2 — 정적 하네스에서 자기진화 하네스로. 이 시기 최대 클러스터(§4-B). Self-Harness→APEX→HarnessX의 계보가 프롬프트 단일축→하네스+원칙+토폴로지→파운드리로 확장. 진화 신호원이 다양화: 정답 검증셋 → self-preference(RHO, 검증셋 없이 59%→78%) → success-trace distillation(APEX) → 가중치 공동갱신(SIA). 공통 안전장치는 회귀 방지·falsification(요행을 정책으로 굳히지 않기). 단 SEAGym(2606.17546)은 이 self-* 신호의 과적합·스냅샷 붕괴 위험을 메타평가로 경고 — 자기진화 내부의 자기 견제.
트렌드 3 — 컨텍스트·거버넌스가 "안전-critical 계층"으로 승격. 컨텍스트 관리가 효율 문제에서 안전 문제로 재규정. Governance Decay(2606.22528)는 압축이 안전 제약을 삭제해 위반율 0→30%(최대 59%)를 실증하고 압축 겨냥 인젝션 공격까지 보임. Plans Don't Persist(2606.22953)는 계획이 context-resident일 뿐 persistent가 아님을 hidden-state로 증명. 대응으로 결정론적 강제(§4-H: Harness-MU·ActPlane·ScopeGate)가 "안전은 LLM이 아니라 실행 훅/OS가 강제"라는 원칙으로 수렴.
트렌드 4 — 평가의 분해: 모델·하네스·환경을 나눠 측정. 단일 end-to-end 점수 비판(2606.17799)에서, 하네스를 1급 평가 축으로 삼는 벤치마크(Claw-SWE-Bench, ADK Arena)·프로세스 규율 측정(RigorBench)·stamina 측정(StaminaBench)·레이어 격리(2606.11686)·평가 하네스 견고화(hacker-fixer 2606.08960)로 확산. 평가 축이 정확도에서 신뢰성·규율·지속성으로 다변화.
트렌드 5 — "무엇으로 하네스를 분해하는가"의 경쟁 (미수렴). 6책임(2606.20683)·11책임(2605.13357)·범주론 삼중항(2605.12239)·3계층 code-substrate(2605.18747)·ETCLOVG(2606.06324)·source-code 12차원(2604.03515 배경). 서로 대응이 명시되지 않아 표준 분류 어휘가 아직 없다. 이는 분야가 신생임을 보여주는 신호이자 미해결 과제.
트렌드 6 — 서브에이전트·재귀·멀티에이전트의 구조화, 그리고 그 한계 인식. 재귀 하네스(RAH), 탐색 서브에이전트 분리(FastContext), 오케스트레이션 학습(OrchRM·LEMON), 이식 가능 명세(Swarm Skills·MAS-Lab). 동시에 근본 한계가 정직하게 드러남: 정보이론적 상한(2606.13733), 오케스트레이션 프롬프팅 능력 평균 14.9%(PerspectiveGap), 관리 병목=권한 부여(ClawArena). "에이전트를 늘리면 낫다"는 순진한 가정의 반박.
트렌드 7 — 도메인 확산과 산업-학술 수렴. harness engineering이 코딩을 넘어 추천(NOVA·AgentX)·과학(Beaver·NORA)·로봇(HARBOR)·BPM·GPU커널로 확산. 산업 1차 자료(Anthropic "harness machinery" 서사, Cognition 하이브리드 하네스)와 학술 개념이 같은 어휘로 수렴 — 용어 자체가 OpenAI(2026-02)에서 학술(2026-05~06)로 흘러들어온 계보가 관찰됨.
6. 발전 방향과 미해결 과제
논문들의 "한계" 섹션에서 귀납한 향후 방향.
- 하네스 분류 어휘의 표준화. 6/11/범주론/ETCLOVG로 난립하는 분해 축을 정렬할 합의 프레임이 필요하다(트렌드 5). 2606.20683의 6책임이 유력 후보이나, 안전·권한·관측성 같은 횡단 관심사를 어디에 놓을지 미해결.
- 최종 성공 너머의 평가. 2605.18747·2606.17799가 공통 지적 — 단일 참조 해답·end-to-end 점수는 유효 대안을 패널티화하고 컴포넌트 이터레이션 신호가 없다. 프로세스 규율(RigorBench)·신뢰성 감쇠(Beyond pass@1, 2603.29231 배경)·불완전 피드백 하 검증이 열린 문제.
- 불완전 피드백 하 자기진화의 신뢰성. self-preference·self-consistency(RHO)로 검증셋을 우회하지만, SEAGym이 경고하듯 과적합·스냅샷 붕괴 위험이 있다. "요행을 정책으로 굳히지 않는" falsification 게이트의 일반 이론이 필요.
- 하네스 일반화(generalization). 2604.25850(배경)의 "factual 구조는 전이되나 prose 전략은 전이 안 됨", AdaCoM의 "유사 능력 에이전트 간 전이가 최선"이 시사하듯, 하네스가 모델·태스크·도메인을 넘어 얼마나 이식되는지가 미해결(2606.20683이 명시한 open challenge).
- 모델-하네스 공진화의 이론. SIA(하네스+가중치)·HarnessX(트레이스→하네스+훈련 신호)·2606.25447(harness-aware post-training)이 결합을 실증하나, 두 레버가 언제 상승/상쇄하는지의 원리는 미정립.
- 안전을 하네스 전 계층에 관통. 컨텍스트 압축의 거버넌스 붕괴(2606.22528), 프레임워크 기본값의 confused-deputy(2606.28679), OS 레벨 강제(ActPlane)가 각각 부분 해결. 하네스의 결정론적 안전 강제를 컨텍스트·툴·메모리·멀티에이전트 전반에 일관 적용하는 통합 틀이 필요.
- 멀티에이전트의 원리적 설계. 정보이론적 상한(2606.13733)은 "C_min이 높으면 태스크를 재구조화하라"고 처방한다. 언제 단일 에이전트가 낫고 언제 멀티가 나은지, task-inherent 제약을 설계에 반영하는 방법론이 초기 단계.
- 커버리지·재현성 인프라. MemDelta(2606.29914)·MAS-Lab(2606.30546)이 보이듯 "실험에서 관찰한 행동이 프로덕션 근거가 못 된다". 통제 baseline·재현 프로토콜·live 프로덕션 측정(MemClaw)의 정착이 분야 성숙의 조건.
7. 결론
2026년 5~7월은 harness engineering이 산업 구호에서 학술 연구 프로그램으로 전환한 시기다. 이 서베이가 arXiv API로 실존 검증한 86편(범위 내)과 산업 1차 자료는 하나의 명제로 수렴한다: 에이전트 성능·안전·일반화는 모델 능력만이 아니라 모델과 하네스(그리고 환경)의 상호작용에서 창발하며, 하네스 설계가 점수를 모델 세대차만큼(때로 그 이상) 움직인다.
이 명제 위에서 분야는 네 갈래로 분화 중이다 — 하네스를 정의하고(경쟁적 분류, 아직 미수렴), 측정하고(모델/하네스 분리 평가), 자동 진화시키고(이 시기 최대 클러스터), 안전하게 강제한다(결정론적 거버넌스). 그리고 이미 다섯 번째 갈래인 모델-하네스 공진화로 넘어가고 있다.
동시에 분야의 신생성도 뚜렷하다: 분류 어휘가 표준화되지 않았고, 자기진화의 신뢰성 이론이 미비하며, 평가·재현성 인프라가 정착 중이고, 다수 논문이 단일 도메인·소규모·arXiv 사전출판 단계다. 이 서베이 자체가 그 신생 분야의 한 도구(agent harness)로 만들어졌다 — 라이브 검색·적대적 검증·검증 게이트라는 하네스 설계가 없었다면, 컷오프 이후 논문에 대한 이 보고서는 환각으로 오염됐을 것이다. 그 점에서 이 문서는 harness engineering의 대상이자 산물이다.
부록 A: 검증 실패·범위 밖 항목 (투명성)
환각(REJECTED): 0건. 발굴된 95개 arXiv ID 전부가 arXiv 공식 API에서 실존 확인됐다. 의심스러운 코드네임(LemonHarness·Claw-SWE-Bench·MemClaw·SemaClaw·ClayBuddy)조차 모두 실재했다.
범위 밖(OUT-OF-RANGE, 배경·맥락용으로만 사용): 아래 9편은 실존하나 2026-05~07 밖이라 본문 핵심 사례에서 제외하고 배경으로만 인용했다.
| arXiv ID | 제출일 | 제목 |
|---|---|---|
| 2601.11868 | 2026-01-17 | Terminal-Bench: Benchmarking Agents on CLI Tasks (평가 인프라 배경) |
| 2603.22862 | 2026-03-24 | The Evolution of Tool Use in LLM Agents (툴 오케스트레이션 서베이 배경) |
| 2603.24709 | 2026-03-25 | Training LLMs for Multi-Step Tool Orchestration |
| 2603.29231 | 2026-03-31 | Beyond pass@1: Reliability Science for Long-Horizon Agents |
| 2604.03515 | 2026-04-03 | Inside the Scaffold: Source-Code Taxonomy of Coding Agents |
| 2604.11548 | 2026-04-13 | SemaClaw: Personal AI Agents through Harness Engineering |
| 2604.21003 | 2026-04-22 | The Last Harness You'll Ever Build |
| 2604.25850 | 2026-04-28 | Agentic Harness Engineering: Observability-Driven Evolution |
| 2507.13334 | 2025-07-17 | A Survey of Context Engineering for LLMs (2025년, 범위 밖) |
미확인(UNVERIFIED): 없음. 단 다음 한계를 명시한다 — (1) 대부분 arXiv 사전출판으로 동료심사 게재 여부 미확인, (2) WebSearch 비활성으로 Semantic Scholar/OpenReview/ACL 커버리지 부족, (3) Meta/FAIR 1차 자료 미발견, (4) 초록 기반 분석이라 일부 논문의 방법 세부·수치 맥락은 전문 확인 필요, (5) 산업 블로그는 HTTP 실존만 확인(내용은 candidates 기록 기반 요약).
근거 성숙도 편차(인용 시 주의): 강한 정량 앵커(Claw-SWE-Bench·Less Context·Governance Decay·StaminaBench·HarnessX 등)와 약한 근거(Mise en Place 사례 1건, ACDL 언어 제안, Categorical Architecture의 2모델·1태스크 실험, AgentX 초록 내 수치 부재)가 공존한다. HarnessFix의 ETCLOVG 약어 대응은 분석자 추정이다(§4-B 정정 노트).
부록 B: 전체 인용 목록 (CONFIRMED, 범위 내 86편)
arXiv API로 실존·제목·제출일을 검증한 2026-05~07 논문 전체. 제출일 순.
- Noga Peleg Pelc 외 2인 (2026-05-03). A Language for Describing Agentic LLM Contexts. arXiv:2605.01920
- Bing Zhou 외 5인 (2026-05-03). NORA: A Harness-Engineered Autonomous Research Agent for End-to-End Spatial Data Science. arXiv:2605.02092
- Andrew Zigler (2026-05-06). Mise en Place for Agentic Coding: Deliberate Preparation as Context Engineering Methodology. arXiv:2605.05400
- Matthias Galster 외 6인 (2026-05-08). A Dataset of Agentic AI Coding Tool Configurations. arXiv:2605.08435
- Seth Karten 외 7인 (2026-05-11). Continual Harness: Online Adaptation for Self-Improving Foundation Agents. arXiv:2605.09998
- Xinyu Zhang 외 12인 (2026-05-11). Swarm Skills: A Portable, Self-Evolving Multi-Agent System Specification for Coordination Engineering. arXiv:2605.10052
- Bogdan Banu (2026-05-12). Harness Engineering as Categorical Architecture. arXiv:2605.12239
- Yong-eun Cho (2026-05-12). It's Not the Size: Harness Design Determines Operational Stability in Small Language Models. arXiv:2605.12129
- Hailin Zhong 외 1인 (2026-05-13). AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents. arXiv:2605.13357
- Yoichi Ishibashi 외 2인 (2026-05-13). Effective Harness Engineering for Algorithm Discovery with Coding Agents. arXiv:2605.15221
- Xudong Chen 외 3인 (2026-05-14). LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning. arXiv:2605.14483
- Boyuan Wang 외 4인 (2026-05-15). Harnesses for Inference-Time Alignment over Execution Trajectories. arXiv:2605.21516
- Xuying Ning 외 41인 (2026-05-18). Code as Agent Harness. arXiv:2605.18747
- Musa Cim 외 3인 (2026-05-22). Parallel Context Compaction for Long-Horizon LLM Agent Serving. arXiv:2605.23296
- Binfeng Xu 외 11인 (2026-05-22). Polar: Agentic RL on Any Harness at Scale. arXiv:2605.24220
- Prannay Hebbar 외 6인 (2026-05-26). SIA: Self Improving AI with Harness & Weight Updates. arXiv:2605.27276
- Lu Yi 외 8인 (2026-05-29). Learning Agent-Compatible Context Management for Long-Horizon Tasks. arXiv:2605.30785
- Omkar Ghugarkar 외 3인 (2026-05-29). MAVEN: Improving Generalization in Agentic Tool Calling. arXiv:2605.30738
- Sidi Yang 외 13인 (2026-06-02). What Makes Interaction Trajectories Effective for Training Terminal Agents?. arXiv:2606.03461
- Wenbo Pan 외 7인 (2026-06-04). Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference. arXiv:2606.05922
- Mengzhuo Chen 외 4인 (2026-06-04). From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws. arXiv:2606.06324
- Yasmine Omri 외 8인 (2026-06-04). Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads. arXiv:2606.06448
- Jintao Huang 외 3인 (2026-06-04). ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer. arXiv:2606.05548
- Chuan Xiao 외 7인 (2026-06-05). Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills. arXiv:2606.07412
- Marut Pandya 외 2인 (2026-06-05). Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories. arXiv:2606.07889
- Jiayu Wang 외 10인 (2026-06-05). Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle. arXiv:2606.07462
- Youran Sun 외 4인 (2026-06-07). PerspectiveGap: A Benchmark for Multi-Agent Orchestration Prompting. arXiv:2606.08878
- Zechu Li 외 6인 (2026-06-07). HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning. arXiv:2606.08610
- Jaber Jaber 외 1인 (2026-06-08). AutoMegaKernel: A Statically-Checked Agent Harness for Self-Retargeting Megakernel Synthesis. arXiv:2606.09682
- Ziqian Zhong 외 5인 (2026-06-08). Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops. arXiv:2606.08960
- Sanderson Oliveira de Macedo (2026-06-08). What makes a harness a harness: necessary and sufficient conditions for an agent harness. arXiv:2606.10106
- Hangfan Zhang 외 7인 (2026-06-08). Self-Harness: Harnesses That Improve Themselves. arXiv:2606.09498
- Abhilasha Lodha 외 3인 (2026-06-08). Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents. arXiv:2606.10209
- Sawyer Zhang 외 2인 (2026-06-10). Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness. arXiv:2606.11686
- Mengyu Zheng 외 15인 (2026-06-10). Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks. arXiv:2606.12344
- Marc Alier Forment 외 3인 (2026-06-10). Agents All the Way Down; A Methodology for Building Custom AI Agents from Substrate to Production. arXiv:2606.11869
- Elias Lumer 외 3인 (2026-06-11). Recursive Agent Harnesses. arXiv:2606.13643
- King Yeung Tsang 외 7인 (2026-06-11). Reward Modeling for Multi-Agent Orchestration. arXiv:2606.13598
- Xiaoxuan Wang 외 5인 (2026-06-11). HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness. arXiv:2606.12882
- Xiaoyuan Liu 외 28인 (2026-06-11). AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility. arXiv:2606.13608
- Shi Pan 외 1인 (2026-06-11). How Task Structure Limits Multi-Agent Success: An Information-Theoretic Analysis. arXiv:2606.13733
- Shaoqiu Zhang 외 14인 (2026-06-12). FastContext: Training Efficient Repository Explorer for Coding Agents. arXiv:2606.14066
- Chenxin Li 외 20인 (2026-06-12). PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions. arXiv:2606.14832
- Tingyang Chen 외 13인 (2026-06-12). HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry. arXiv:2606.14249
- Jixuan Chen 외 12인 (2026-06-12). AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition. arXiv:2606.14674
- Kenneth Ge 외 1인 (2026-06-13). ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures. arXiv:2606.19380
- Ya-Chuan Chen 외 2인 (2026-06-13). APEX: Adaptive Principle EXtraction A Three-Layer Self-Evolution Framework for Production AI Agents. arXiv:2606.15363
- Dongxu Yang (2026-06-14). Control-Plane Placement Shapes Forgetting: An Architectural Study of Agent Memory Across Thirteen System Configurations. arXiv:2606.15903
- Jianyuan Guo 외 16인 (2026-06-14). From Question Answering to Task Completion: A Survey on Agent System and Harness Design. arXiv:2606.20683
- Junjia Qi 외 6인 (2026-06-14). LLM-as-Code: Agentic Programming for Agent Harness. arXiv:2606.15874
- Buqiang Xu 외 14인 (2026-06-15). TokenPilot: Cache-Efficient Context Management for LLM Agents. arXiv:2606.17016
- Qiao Xiao 외 11인 (2026-06-15). SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents. arXiv:2606.16591
- Yimo Lin 외 2인 (2026-06-15). Toward Self-Evolution-Ready Workflow Harnesses: A Reversible Migration Path and Convertibility Taxonomy for Expert LLM Pipelines. arXiv:2606.24598
- Gaurav Gupta 외 3인 (2026-06-16). Dissecting model behavior through agent trajectories. arXiv:2606.17454
- Congjie Zheng 외 4인 (2026-06-16). SEAGym: An Evaluation Environment for Self-Evolving LLM Agents. arXiv:2606.17546
- Maria I. Gorinova 외 5인 (2026-06-16). Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering. arXiv:2606.17799
- Fukang Wen 외 2인 (2026-06-17). OpenRath: Session-Centered Runtime State for Agent Systems. arXiv:2606.19409
- Vlad Sobal 외 4인 (2026-06-17). StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns. arXiv:2606.19613
- Sheng Zhang 외 11인 (2026-06-19). Building Agent Harnesses for Scientific Curation from Multimodal Sources. arXiv:2606.21005
- Yujin Tang 외 13인 (2026-06-19). Sakana Fugu Technical Report. arXiv:2606.21228
- Wangxuan Fan 외 2인 (2026-06-20). Harness-MU: A Safe, Governed, and Effective Harness for Multi-User LLM Agents. arXiv:2606.21856
- Meher Bhaskar Madiraju 외 1인 (2026-06-21). RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents. arXiv:2606.22678
- Shiyang Chen (2026-06-21). Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents. arXiv:2606.22528
- Haggai Roitman (2026-06-22). The Hitchhiker's Guide to Agentic AI: From Foundations to Systems. arXiv:2606.24937
- Shanhui Zhao 외 15인 (2026-06-22). AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction. arXiv:2606.23449
- Aman Mehta 외 1인 (2026-06-22). Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents. arXiv:2606.22953
- Kailong Ren 외 20인 (2026-06-23). LemonHarness Technical Report. arXiv:2606.24311
- Yusheng Zheng 외 7인 (2026-06-23). ActPlane: Programmable OS-Level Policy Enforcement for Agent Harnesses. arXiv:2606.25189
- Wei Zhou 외 7인 (2026-06-23). Are We Ready For An Agent-Native Memory System?. arXiv:2606.24775
- Yanki Margalit 외 4인 (2026-06-23). Governed Shared Memory for Multi-Agent LLM Systems. arXiv:2606.24535
- Kyungmin Kim 외 5인 (2026-06-24). The Interplay of Harness Design and Post-Training in LLM Agents. arXiv:2606.25447
- Yang Chen 외 3인 (2026-06-24). Unlocking Model Potentials Through Adaptive Multi-Agent Scaffolding for Efficient Issue Resolution. arXiv:2606.25514
- Congjia Tian 외 2인 (2026-06-25). QueenBee Planner: Skill-Evolving Communication Topologies for Token-Efficient LLM Multi-Agent Systems. arXiv:2606.27492
- Shaohua Liu 외 18인 (2026-06-25). NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems. arXiv:2606.27243
- Changxin Lao 외 61인 (2026-06-25). AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems. arXiv:2606.26859
- Fabiana Fournier 외 1인 (2026-06-25). A Process Harness for Uplifting Legacy Workflows to Agentic BPM: Design and Realization in CUGA FLO. arXiv:2606.27188
- Wenhao Zeng 외 12인 (2026-06-26). Dockerless: Environment-Free Program Verifier for Coding Agents. arXiv:2606.28436
- Shuzheng Gao 외 7인 (2026-06-26). SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents. arXiv:2606.28434
- Yutian Tang 외 2인 (2026-06-27). Characterizing Large Language Model Agentic Workflows: A Study on N8n Ecosystem. arXiv:2606.29116
- David Mellafe Zuvic (2026-06-27). Capability Gates Are Not Authorization: Confused-Deputy Failures in LLM Agent Frameworks. arXiv:2606.28679
- Binyan Xu 외 2인 (2026-06-29). LLM Agents Are Latent Context Managers: Eliciting Self-Managed Context via a Proprioceptive Dashboard. arXiv:2606.30005
- Kuan Wang (2026-06-29). MemDelta: Controlled Baselines and Hidden Confounds in Agent Memory Evaluation. arXiv:2606.29914
- Carson Rodrigues 외 1인 (2026-06-29). MCP Server Architecture Patterns for LLM-Integrated Applications. arXiv:2606.30317
- Jordan Augé 외 3인 (2026-06-29). MAS-Lab: A Specification-Driven Validation Framework for Reliable Multi-Agent Systems. arXiv:2606.30546
- Kaiwen Xiong 외 6인 (2026-06-30). ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents. arXiv:2606.31174
- Ning Liao 외 8인 (2026-06-30). ACE: Pluggable Adaptive Context Elasticizer across Agents. arXiv:2606.31564
부록 B-2: 산업 1차 자료 (범위 내, HTTP 검증)
- Anthropic (2026-05-25). How we contain Claude across products. https://www.anthropic.com/engineering/how-we-contain-claude
- Anthropic (2026-05-19). New in Claude Managed Agents: dreaming, outcomes, and multiagent orchestration. https://claude.com/blog/new-in-claude-managed-agents
- Anthropic (2026-05-19). Claude Managed Agents: self-hosted sandboxes and MCP tunnels. https://claude.com/blog/claude-managed-agents-updates
- Anthropic (2026-06-09). Managed Agents: schedule + environment variable vaults. https://claude.com/blog/whats-new-in-claude-managed-agents
- Anthropic — G. Bhat, I. He (2026-06-10). The evolution of agentic surfaces: building with Claude Managed Agents. https://claude.com/blog/building-with-claude-managed-agents
- Anthropic (2026-06-18). Steering Claude Code: CLAUDE.md files, skills, hooks, rules, subagents and more. https://claude.com/blog/steering-claude-code-skills-hooks-rules-subagents-and-more
- Anthropic (2026-06-24). Agent identity in Claude Tag: a new access model. https://claude.com/blog/agent-identity-access-model
- Cognition (2026-06-29). Devin Fusion: Frontier Performance at 35% Lower Cost. https://cognition.com/blog/devin-fusion
- Google DeepMind (2026-05-19). Co-Scientist: a multi-agent AI partner to accelerate research. https://deepmind.google/blog/co-scientist-a-multi-agent-ai-partner-to-accelerate-research/
- Google DeepMind (2026-06). Investing in multi-agent AI safety research. https://deepmind.google/blog/investing-in-multi-agent-ai-safety-research/
- OpenAI (2026-06~07). Codex Changelog. https://developers.openai.com/codex/changelog
부록 B-3: 배경 산업 자료 (범위 밖)
- OpenAI (2026-02-11). Harness engineering: leveraging Codex in an agent-first world. (원문 403; InfoQ 교차확인) https://openai.com/index/harness-engineering/
- Anthropic — P. Rajasekaran (2026-03-24). Harness design for long-running application development. https://www.anthropic.com/engineering/harness-design-long-running-apps
- Anthropic (2026-04-08). Scaling Managed Agents: Decoupling the brain from the hands. https://www.anthropic.com/engineering/managed-agents
- Anthropic — J. Hughes (2026-03-25). How we built Claude Code auto mode. https://www.anthropic.com/engineering/claude-code-auto-mode
- Anthropic — N. Carlini (2026-02-05). Building a C compiler with a team of parallel Claudes. https://www.anthropic.com/engineering/building-c-compiler
이 서베이는 Harness Survey 하네스(agents 4 + skills 5 + orchestrator)로 생성되었으며, 모든 arXiv 인용은 raw arXiv API로, 블로그는 HTTP 상태로 실존 검증되었다. 검증 원본: _workspace/03_verification/.