Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 부분 코드 실행의 어려움을 해결하기 위해 다중 에이전트 프레임워크인 AgentExecutor를 제안합니다. 이 프레임워크는 세 단계 설계(환경 준비, 동적 탐색, 접두사 진화)로 구성되어 LLM 에이전트들의 협업을 통해 누락된 컨텍스트를 추론하고 코드를 실행하는 효율적인 방법을 제시합니다.
LLM 에이전트의 기술 진화 시 발생하는 과적합 문제를 해결하기 위해 전역적 기술 진화 프레임워크인 GSE를 제안합니다. GSE는 기술 관계 그래프(SRG)를 통해 기술 간 호환성을 유지하며, 클러스터 기반 통합을 통해 재사용 가능한 능력을 추상화합니다.
저장소를 먼저 탐색하여 코딩 에이전트의 비용 효율적인 라우팅을 수행하는 SuperScout 프레임워크를 제안합니다. 7B 규모의 탐색기가 저장소를 분석하고 구조화된 핸드오프를 생성하여, 최적의 모델로 작업을 배정함으로써 비용을 획기적으로 절감합니다.
에이전트 워크플로 프레임워크의 실행 상태 지속성 및 재개(resume) 시맨틱스를 분석하고, 기계 검증 가능한 계약인 RESUME CONTRACT를 제안합니다. LangGraph, CrewAI 등 주요 프레임워크의 결함을 TLA+로 검증하고, 이를 해결하기 위한 REMIT 시스템을 소개합니다.
LLM 에이전트의 루프, 도구 오류, 목표 이탈 등의 실패를 실시간으로 탐지하고 복구하는 효율적인 모니터링 시스템을 제안합니다. 마이크로초 단위의 저비용 모니터와 결정론적 검증을 결합하여, 추가적인 LLM 호출 비용을 최소화하면서도 에이전트의 작업 성공률을 크게 향상시켰습니다.
STAIR는 코딩 에이전트가 과거의 수정 과정을 계층적 계획으로 변환하여 재사용할 수 있게 하는 프레임워크입니다. 미세한 진단부터 높은 수준의 전략까지 경험을 인코딩하여 새로운 문제 해결 시 프롬프트로 제공합니다. 이를 통해 SWE-bench Verified에서 높은 성능 향상을 입증했습니다.
생성형 및 에이전틱 AI 시대에 필요한 '에이전틱 엔지니어'의 역량과 교육 체계를 제안합니다. ACCEL 프레임워크를 통해 커리큘럼, 협업, 지속적 학습을 중심으로 한 통합적 교육 아키텍처를 제시합니다.
레거시 COBOL 코드를 Java로 마이그레이션할 때 기능적 일관성을 보장하기 위한 에이전트 기반 테스트 합성 방법인 'Locksmith Loop'를 제안합니다. 이 방식은 에이전트 루프를 통해 프로그램 분기를 탐색하고 변이를 수행하여 높은 코드 커버리지를 달성합니다.
코딩 에이전트의 RAG 과정에서 발생하는 코드 파편의 중복 문제를 해결하기 위한 VITAL-RAG를 소개합니다. 코드 객체별로 의미론적 중복을 제거하여 토큰 효율성을 높이고 검색 성능을 대폭 향상시켰습니다.
NL2Test는 트래픽 캡처와 자연어 시나리오를 결합하여 API 회귀 테스트를 자동 생성하는 도구입니다. LLM과 결정론적 알고리즘을 활용해 테스트 케이스 카빙과 어설션 생성을 수행하며, 실제 산업 현장에서 높은 코드 채택률을 입증했습니다.
본 연구는 인간과 CLLM의 협업을 강화하기 위해 프롬프트 엔지니어링과 TDD를 결합한 '바이브 코딩(Vibe Coding)' 접근 방식을 제안합니다. 네 가지 상호작용 모델을 통해 에이전틱 워크플로우와 협업 워크플로우의 성능을 비교 분석했습니다.
LLM의 논리적 추론 한계를 극복하기 위해 SWI-Prolog를 활용한 MCP 서버인 Euclid-MCP를 제안합니다. Euclid-IR이라는 중간 표현을 통해 LLM이 결정론적 논리 추론을 수행할 수 있도록 지원하며, 보안 및 규정 준수 분야에서 높은 정확도를 보입니다.
자율 코딩 에이전트의 작업 상태를 단순한 주장이 아닌 기계적으로 검증 가능한 증거를 기반으로 제어하는 'Proof-or-Stop' 프레임워크를 제안합니다. 이 방식은 에이전트의 출력을 신뢰 모델에 따른 증거와 결합하여 라이프사이클 전환을 강제함으로써 오류를 획기적으로 줄입니다.
JoyNexus는 VLA 모델의 후학습 및 평가를 위한 다중 테넌트 통합 서비스를 제안합니다. 기존 단일 테넌트 할당 방식의 비효율성을 해결하기 위해, 트레이닝, 추론, 환경 서비스를 분리하고 공유 자원을 활용하는 것이 핵심입니다. 이를 통해 여러 테넌트가 동시에 워크로드를 제출해도 격리가 유지되며, 그룹 배치 기능을 도입하여 GPU 시간과 서비스 활용도를 크게 개선합니다.
CADAQUES는 자율 탐색 시스템의 비용 문제를 해결하기 위해 설계된 오픈 소스 Python 프레임워크입니다. 이 아키텍처는 쿼리 응답 오라클과 쿼리 제안 드라이버로 루프를 분리하고, 평가와 결정 과정 모두에 대해 시간, CPU, 금전적 비용 등 공통 예산을 부과합니다. 이를 통해 자원 소비를 명시적으로 관리하며 효율적인 탐색을 가능하게 합니다.
TARS는 VS Code에 통합되어 코드 이해를 돕는 LLM 기반 에이전트입니다. 이 에이전트는 가벼운 마음 이론(Theory of Mind) 패러다임을 활용하여 개발자의 전문 지식, 역할, 선호도를 프로파일링합니다. 이를 바탕으로 설명의 깊이와 어조를 조정하며, RAG를 통해 프로젝트 문서에 근거한 설명을 제공하여 코드 이해 과정을 지원합니다.
본 글은 구조 공학 워크플로우의 복잡성을 다루기 위해 아티팩트 중심의 새로운 LLM 에이전트 워크벤치인 StructureClaw를 제안합니다. 이는 타입 지정 도구와 공유 아티팩트 상태를 활용하여, 단순한 답변 생성이 아닌 완전한 증거 사슬을 요구합니다. 또한 150개의 통제된 시나리오로 구성된 StructureClaw-Bench를 통해 에이전트의 실제 워크플로우 성능을 평가했습니다.
FirmPilot은 IoT 펌웨어의 동적 분석을 위한 재호스팅 파이프라인의 취약점을 해결하는 증거 기반 다중 에이전트 프레임워크입니다. 이 시스템은 부팅, 상태, 네트워킹 전반의 복잡한 종속성을 반복적인 환경 재구축과 증거 기반 아티팩트 델타를 통해 안정적으로 복구합니다. 테스트 결과, FirmPilot은 웹 서비스 및 네트워크 도달 가능성 등에서 기존 대비 높은 성능 향상을 입증했습니다.
AI 코딩 에이전트가 프로젝트 설정 과정에서 발생하는 공급망 공격 취약점을 분석했습니다. 공격자는 README나 requirements 파일만 수정하여 신뢰할 수 없는 레지스트리나 취약한 패키지를 설치하도록 유도할 수 있습니다. 이 문제는 모델 자체보다 '에이전트 하니스-모델 조합'의 보안 설계에 달려있으며, 결정론적 사전 설치 확인이 가장 효과적인 방어책입니다.
본 글은 복잡한 AI 에이전트 시스템의 진화 과정에서 발생하는 '행동 국소화(Behavior localization)' 문제를 다룹니다. 개발자가 목표 동작을 구현하는 모든 코드를 식별하기 어렵기 때문에, 저자들은 행동 중심 표현인 'Harness Handbook'을 제안합니다. 이는 각 행동과 해당 소스 코드를 연결하여 에이전트의 수정 및 계획 과정을 돕습니다.