Chimera-agent: 통제되고 자가 진화하는 에이전트
요약
Chimera-agent는 여러 AI 모델의 답변을 비교하고 합성하여 종합적인 응답을 생성하는 에이전트 프레임워크입니다. 사용자가 제공한 사실(facts)과 재사용 가능한 기술(reusable skills)을 저장하며, 목표 달성을 위해 계획 수립, 도구 사용, 결과 검증 과정을 거칩니다. 이는 기존 단일 모델 기반의 AI 어시스턴트를 넘어선 자가 진화적이고 통제된 에이전트 기능을 제공합니다.
핵심 포인트
- 여러 모델의 답변을 비교하고 합성하여 정확도를 높입니다.
- 사용자 사실(facts)과 재사용 기술(skills)을 저장/활용할 수 있습니다.
- 목표 기반으로 계획-도구 사용-검증 과정을 거쳐 작업을 수행합니다.
- 오픈 소스이며, 엔드투엔드로 작동하는 에이전트 기능을 제공합니다.

통제되고, 자가 진화하며, 검증되는 에이전트.
여러 모델들이 답변을 내놓고, 또 하나의 모델이 그 답변들을 비교합니다. Chimera는 사용자가 대화 전반에 걸쳐 알려준 사실들(facts)을 저장할 수 있습니다.
English · Português · Español · Deutsch · Français · Italiano · Polski · 中文 · 日本語 · Русский
대부분의 AI 어시스턴트는 단일(single) 모델에 모든 것을 걸고, 채팅이 끝나면 모든 것을 잊어버립니다. 어려운 질문에 대해서는 Chimera가 여러 AI 모델들에게 동시에 질문하고, 하나의 모델이 그 답변들을 비교하며, 합성기(synthesizer)가 이들을 조합합니다. 또한 사용자가 알려준 사실들을 대화 전반에 걸쳐 저장할 수 있으며, 반복적인 작업들을 재사용 가능한 기술(reusable skills)로 바꿀 수 있습니다. 솔직한 주의사항: 축적된 학습이 과제 수행 능력을 측정 가능하게 향상시킨 것으로는 아직 입증되지 않았습니다 — 7개의 사전 등록된 실행 결과에서는 유의미한 효과가 발견되지 않았으며, 재현되지 않은 하나의 긍정적인 결과는 철회되었습니다 (bench/learning_lift/RESULTS.md)
목표(goal)를 제시하면 계획을 세우고, 도구(tools)를 사용하며, 스스로 작업 결과를 확인하고, 실제로 작동하는 것만 유지합니다.
Apache-2.0 라이선스의 무료 오픈 소스이며, 초기 단계이지만 활발하게 개발되고 있습니다. 이미 엔드투엔드로 작동합니다: 채팅을 하거나, 에이전트가 자체적으로 작업을 완료하도록 하거나, 좋아하는 메시징 앱의 봇으로 실행하거나, 서버에 배포하여 24시간 연중무휴로 작동하게 할 수 있으며, 저장된 사실들과 재사용 가능한 기술들을 확인할 수 있습니다. 알파 버전이며 — 견고하고 광범위하게 테스트되었습니다 (6,100개 이상의 자동화 테스트, 모든 변경 사항에 대한 엄격한 타입 체크 및 린팅) — 하지만 아직 프로덕션 환경에서 충분히 단련되지는 않았습니다.
대부분의 AI 도구는 하나의 모델을 질문하고 그것이 맞기를 바라는 것과 같습니다. 어려운 질문에 대해서는 Chimera가 여러 모델들에게 질문하고, 하나의 모델이 그 답변들을 비교하며, 합성기가 이들을 조합합니다. 또한 목표를 수행하기 위해 도구를 사용하고, 작업 결과를 확인하며, 사용자가 알려준 사실들을 저장할 수도 있습니다. 다음은 시스템을 차별화하는 요소들입니다 (쉽게 설명하자면):
🧠
여러 모델로 여러 답변을 얻습니다. 어려운 질문에 대해 Chimera는 여러 모델에게 동일한 것을 요청하고, 하나의 모델이 그 답변들을 비교하게 한 다음, 최종 모델이 종합적인 응답을 작성합니다. (이는 빠르고 저렴할 때만 수행됩니다.) - 🚀
단순히 말하는 것이 아니라 실제로 작업합니다. 목표를 제시하면 그것을 세분화하고, 도구를 사용하며, 파일을 편집하고, 테스트를 실행하며, 통과했을 경우에만 변경 사항을 유지합니다. 무언가 잘못되면 되돌리고 다시 시도하므로, 뒤처리를 남기지 않습니다. - 🧬
사용자가 알려준 사실을 저장하고 재사용 가능한 기술을 만들 수 있습니다. Chimera는 대화 전반에 걸쳐 사용자의 선호 사항과 중요한 사실들을 유지할 수 있으며, 반복적인 작업을 재사용 가능한 기술로 바꿀 수 있습니다. 솔직한 주의사항: 축적된 학습이 과제 수행 능력을 측정 가능하게 더 좋게 만든 것으로는 밝혀지지 않았습니다. 7번의 사전 등록된 실행에서는 유의미한 효과를 발견하지 못했으며, 재현되지 않은 하나의 긍정적인 결과도 철회했습니다 (bench/learning_lift/RESULTS.md). - 🛡️
설계 단계부터 안전합니다. 모든 위험한 행동은 먼저 안전성 검사를 거치며, 파괴적인 것은 확인을 요청하고, 신뢰할 수 없는 코드는 격리된 네트워크가 차단된 컨테이너에서 실행될 수 있습니다. (이러한 검사는 실제 경계인 샌드박스나 컨테이너 격리가 아니라 저렴한 첫 번째 필터입니다. SECURITY.md를 참조하세요.) - 🔌
어떤 모델이든, 어디서든 실행됩니다. 크고 호스팅되는 모델을 사용하든, 자체 로컬 모델을 사용하든 단일 인터페이스를 통해 사용할 수 있습니다. 노트북이나 5달러짜리 서버에서, 연중무휴로요. - 🧩
진정으로 사용자 소유입니다. 오픈소스이며, 종속성이 없고, 공급업체 계정이 필요하지 않습니다. 사용자가 실행하고, 소유하며, 모든 것을 변경할 수 있습니다.
Chimera는 거대한 에이전트 프로젝트들을 능가하려고 애쓰지 않습니다. 다섯 개의 선두 주자(OpenClaw, Hermes, nanobot, CrewAI, LangGraph)에 대한 실제 리버스 엔지니어링 연구를 통해 모두 열어두고 있는 세 가지 요소에 베팅하며, 이를 핵심으로 삼았습니다:
🧬 적합도 신호(fitness signal)를 통한 자가 진화. 다른 에이전트들은 발생한 모든 것을 단순히 추가하거나, 사람의 풀 리퀘스트(human pull requests)로 '학습'합니다. 하지만 학습된 변화가 실제로 도움이 되었는지 측정하는 것은 없습니다. Chimera는 검증된 결과가 도움을 주었다고 증명할 때만 변경 사항을 유지합니다: 진화 단계는 모델의 주장이 아니라 실제 작업 트리 차이(real working-tree diff)와 정직한 A/B 테스트를 통해 제어됩니다. 이것이 중요하다는 독립적인 증거가 있습니다: EvoAgentBench (arXiv 2607.05202)는 자동적이고 게이트가 없는 경험 인코딩 방식들이 일상적으로 **부정 전이(negative transfer)**를 생성한다는 것을 측정했습니다—하나의 인기 있는 방법은 자신이 미세 조정되지 않은 작업에서 −12.3 포인트를 하락시켰습니다. Chimera의 게이트는 이제 **전이 홀아웃(transfer holdout)**도 실행합니다: 학습된 변화가 승격되기 전에 분리되고 동일한 역량의 슬라이스에서 성능 저하를 일으키지 않아야 합니다. 따라서 자신이 평가하는 것만 암기할 수 없습니다. - 🛡️ 아키텍처 기반 보안. 프롬프트 인젝션(Prompt injection)은 이제 패치 불가능하다고 광범위하게 간주됩니다; 인기 있는 에이전트들은 앱 계층에서 완화하거나 범위를 벗어난 것으로 선언합니다 (135k개의 공개 노출 인스턴스를 배포한 제품과 악성 스킬로 약 12%가 채워진 마켓플레이스가 있습니다). Chimera는 실제 방어 계층을 제공하며, 0.53.0 버전부터 사용자가 앉아 있는 모든 표면—chimera chat, assist, 그리고 데스크톱 앱의 채팅 및 코딩 턴인 tui, 메시징 봇(solve과 agent)—에서 기본적으로 활성화되어 있습니다.
플래그로 처리합니다). 이는 오염된 출처(taint provenance)를 휴리스틱하게(verbatim reference/content flow,실제 데이터 흐름이 아님 — 오염된 텍스트를 패러프레이징하여 세탁하는 모델) 추적하고, 모든 외부 읽기 작업을 제어 토큰을 제거한 데이터 울타리(data fence) 내부에서 반환하며, 오염된 실행의 나머지 부분에 대한 위험한 도구 접근을 제한하고, 부작용이 있는 재시도를 보호합니다. 신뢰할 수 없는 코드는 옵트인 방식으로 잠긴 컨테이너 내에서 실행됩니다. 내장된 7-공격 코퍼스에서 7/7개의 유해 호출이 차단되었는데, 이는 모델이 루프에 이미 주입되어 공격자의 도구 호출을 시도하는 상황에서 측정되었습니다. 이 차단율은 결코 단독으로 발표되지 않습니다: 동일한 보고서에는 '가격(price)'이 포함되는데, 이는 동일한 표면을 건드리는 무해 코퍼스에서 측정됩니다. 가격이란 거절(refusals)이 아니라 *질문(questions)*입니다 — 8개의 합법적인 행 중 5개가 외부의 무언가를 읽었고 각각 질문이 됩니다; 사람이 답변할 경우, 0/8은 거부되고; 아무도 물어볼 사람이 없을 경우, 5/8은 거부되는데, 이는 설계상 침묵이 곧 거절이기 때문입니다 (bench/injection/RESULTS.md
;chimera redteam
양쪽 절반을 모두 출력합니다 — 공격만으로 점수를 매긴 방어는 자명한 최대치를 가집니다: 모든 것을 거부하는 것입니다). 방어되지 않은 쪽은 측정에 의한 것이 아니라 구성상 100%입니다: 언래핑된 도구는 항상 실행되므로, 이 계층을 기준선 시스템(baseline system)으로 취급하기보다는 정의적 하한선(definitional floor)으로 간주해야 합니다. 이는 모델이 애초에 얼마나 쉽게 주입될 수 있는지에 대해서는 아무것도 말해주지 않습니다 — 더 어려운, 열린 쪽은 (chimera/eval/injection.py
).
SECURITY.md
어떤 부분이 여전히 통과되는지(서브 에이전트 핸드오프, 융합/요약, OpenAI 호환 엔드포인트 등, 후자가 의도적으로 관리되지 않은 상태로 남겨진 이유가 아무도 질문에 답할 사람이 없기 때문)를 명확히 밝힙니다. 즉, 격리 경계는 샌드박스이며, 이 레이어는 그 위에 추가된 심층 방어(defense-in-depth)입니다. - 📊
솔직하고 공개된 벤치마크. 인기 리더보드의 '해결됨' 사례 중 약 20%가 실제로는 잘못되었습니다. Chimera는 자신보다 이기지 못한 실행까지 포함하여 모든 수치를 신뢰 구간(confidence interval)과 함께 보고하며, 유의미성을 위해 재실행하지 않고, 검증 실패 시 스스로 주장을 철회합니다. 이러한 수치들, 귀무 가설(nulls), 그리고 철회된 내용들은 모두 Benchmarks에 있습니다.
한 문장으로 요약하면: 관리되고, 자가 진화하는 에이전트 — 증명되었고, 관리됩니다. 이는 알파 버전이며, 그렇게 말합니다.
의도적으로 함께 발표된 네 가지 기록된 결과가 있습니다. 이 중 두 개는 가설을 지지하고(통합했을 때만 유의미함), 하나는 우리와 반대되는 결과를 보였으며, 나머지 하나는 우리가 철회한 내용입니다. (데스크톱 앱의 성숙도 및 벤치마크(Maturity & Benchmarks) 화면에서도 확인할 수 있습니다. 이 화면은 프로젝트 자체의 커버리지를 보고하므로 Vite 개발 서버(npm --prefix apps/desktop run dev)에서만 렌더링됩니다.) chimera app
프로덕션 빌드를 제공하며, (이 정보는) 표시하지 않으며, 네이티브 설치 프로그램도 마찬가지입니다.
약한 모델의 성능 향상(유의미함). 저렴한 모델(mistral-small-3.2-24b)
)
- Chimera의 재시도 루프(retry loop) 대 동일 모델 단독 실행 (사전에 등록된 n=100 테스트 스위트 기준)*
(설계 및 작업은 어떤 모델 호출 이전에 확정되고 푸시됨): 48.0% → 71.0% (+23.0pp), 쌍별95% 신뢰구간 (CI) [+12.6%, +28.6%] — 통계적으로 유의미함(신뢰구간이 0을 제외함), 28개 작업에서 루프가 복구됨(원래 실패 → 검증된 성공) 5개의 회귀(regressions)에 대응하여. 단일 모델, 단일 시드/작업, 작고 독립적인 Python 작업 —SWE-bench와 다름, 실제 리포지토리에 일반화되지 않음. 한 번의 실행, 재시도 없음.이전 동일 스위트 실행을 대체함(9.0% → 15.0%, +6.0pp) 해당 이전 실행은 에이전트가 테스트할 수 있는 파일로 그레이딩된 하네스(harness)를 사용했음. 깨끗하게 복원된 테스트로 재실행하자, 에이전트가 한 작업에서 자체 그레이딩 테스트를 다시 작성하고 있었던 것이 포착됨 — 따라서 취약점은 실제였고 — 그리고 향상은 더 크게 재현되었음. 이전 실행의
정확히 그것일 확률은 3분의 1에 불과하며, 이는 운 좋은 샘플로 간주되어 철회되었습니다. 테스트는 우리가 이전에 본 적 없는 41개 인스턴스에 대해 실행되었으며, 다른 것은 아무것도 변경하지 않았습니다. 그 효과는재출현했습니다(+9.8%, 등록된 +5~+20 범위 내) run 2보다 더 어려웠던 슬라이스에서 나타났습니다. 두 경우 모두에서 불일치 쌍(discordant pairs)은 Chimera가 2에 대해 9를 실행했으며 (p ≈ 2.6%는 귀무가설 하에서), 이 메커니즘이 재현되었으며, 이것이 흥미로운 부분입니다. 네 번째 실행에서는 동일한 41개 인스턴스에 대해 중간 팔(middle arm, 단순 스캐폴드, diff-gate 없음)을 복원하여, 세 가지 모두가 정확히 하나의 구성 요소로만 차이가 나도록 했습니다. 세 경우 모두 동일한 비율로 편집되었습니다 (41개 중 27–28개의 패치); 변화하는 것은 편집이 정확할 빈도입니다: arm은 기준선 대비 14/41, 50% + 스캐폴드는 16/41, 59% + 스캐폴드 및 diff-gate는 18/41, 67% 입니다. 두 구성 요소 모두 대략 동등한 비율로 기여합니다 (+각각 4.9%, 둘 다 단독으로는 유의미하지 않음) — 이는 스캐폴드가 대부분을 차지할 것이라는 우리 자신의 등록된 예측과 모순되며, diff-gate가
.⚠️ 감사 완료되었으나, 아직 재평가되지 않음 (study 30, S30-35). 실행 3과 4에서 해결된 패치 5개는 테스트 파일도 수정합니다. 이 다섯 가지 수정 사항은 모든 것이 평가되기 전에 하네스(harness)가 초기화하는 파일을 대상으로 하며, 그 중 하나를 실패로 계산한다고 해서 아무런 변화의 부호도 바뀌지 않고 (감사). 리프트는 더 강력한 테스트 환경에서 아직 읽히지 않았습니다(전체 개발자 스위트, SWE-ABS); 해당 평가는 추정치가 아니라 받아야 할 것입니다. -
Terminal-Bench (겸손하게). 공식 벤치마크에 N=40 A/B를 사전 등록했으며, 양쪽 팔(arms) 모두 동일한 모델(deepseek-chat-v3.1)을 사용합니다.
: 7.5% → 2.5% 스캐폴드와 함께 쌍으로 비교했을 때 $ ext{Δ} -5.0 ext{pp}$, $95 ext{% CI } [-5.0 ext{%}, +1.6 ext{%}] ext{ — 유의미하지 않음}$. 스캐폴드는 이미 역량이 충분한 모델을 끌어올리지 못했습니다 (이것은 스캐폴딩이 도움이 되는 약한
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub AI Tools의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기