Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
기존의 정적인 웹 생성 평가 방식의 한계를 극복하기 위해 에이전트 기반의 자동화된 평가 프레임워크인 LiveEvalBench를 제안합니다. 이 프레임워크는 빌드, 코드, UI 테스터 역할을 수행하는 에이전트들이 협업하여 웹 프로젝트의 전체 라이프사이클을 상호작용적으로 평가합니다.
자연어 버그 리포트를 기반으로 웹 GUI 버그를 자동으로 재현하는 LLM 에이전트 시스템 ReBug을 제안합니다. ReBug은 누락된 전제 조건을 재구성하고 브라우저 내에서 직접 실행 및 검증하는 2단계 프로세스를 통해 높은 재현 성공률을 달성했습니다.
Linux 커널 주석 내의 오래된 함수 참조를 탐지하고 수정하는 ReCite 프레임워크를 제안합니다. LLM과 Git 히스토리를 활용하여 코드-주석 불일치를 해결하며, 실제 커널 패치 수락을 통해 유효성을 입증했습니다.
LLM을 활용한 터미널 사용자 인터페이스(TUI) 테스트의 가능성을 조사한 연구입니다. 197개의 실제 TUI 애플리케이션을 대상으로 LLM과 무작위 탐색 방식을 비교 분석하여, LLM이 특정 결함 발견에 효율적이지만 아직 완벽한 해결책은 아님을 밝혀냈습니다.
장기 코딩 에이전트의 학습 효율을 높이기 위해 에이전트가 스스로 행동 경계를 설정하는 '의미론적 자기 분할' 기법을 제안합니다. 에이전트가 자신의 추측에 이름을 붙임으로써 실패와 수정 과정을 명확히 구분하고, 이를 통해 고품질의 지도 학습 데이터를 생성할 수 있음을 입증했습니다.
ECLAIR은 소프트웨어 공학의 과학적 발견을 위해 LLM을 인과 추론 원칙에 따라 통합한 AI 프레임워크입니다. 가설 생성부터 분석까지 과학적 프로세스를 자동화하며, 인간 참여형 설계를 통해 추론의 정확성을 확보합니다.
에이전트 기반 소프트웨어 엔지니어링 환경에서 발생하는 새로운 비용 구조를 분석하고 이를 추정하기 위한 ACEM 모델을 제안합니다. LLM 토큰 소비, 인간의 감독(HITL), 인프라 비용을 중심으로 기존의 소프트웨어 규모 측정 지표와 연결하는 프레임워크를 다룹니다.
LLM 추론 과정의 복잡한 교차 계층 문제를 해결하기 위한 비침습적 근본 원인 분석(RCA) 프레임워크인 TELLER를 제안합니다. NVTX/CUPTI 트레이스와 로그를 결합하여 요청별 호출 체인을 재구성하고, TPE 토크나이저를 통해 효율적인 분석을 수행합니다.
코딩 LLM 평가의 신뢰성을 높이기 위해 테스트 스위트의 결함을 찾아내는 코딩 에이전트 연구를 소개합니다. 에이전트가 적대적 테스트 케이스를 생성하고 인증 체인을 통해 버그를 검증함으로써, 기존 공식 스위트가 놓치는 '정답이지만 버그가 있는' 제출물을 효과적으로 식별합니다.
LLM이 소프트웨어 취약점을 추론할 때 도메인 지식을 위반하는 문제를 해결하기 위해 EntailLLM을 제안합니다. 논리 프로그래밍과 함수 호출 그래프를 활용하여 LLM의 분석 경로를 검증함으로써 신뢰성을 높입니다.
사무 업무 기반의 장기적 사후 학습(Post-Training)이 소프트웨어 엔지니어링 능력을 향상시킨다는 연구 결과입니다. Qwen3.5 모델을 사무 워크플로우로 학습시킨 결과, 소프트웨어 관련 과업이 아님에도 SWE-Bench Pro 점수가 향상되었습니다.
본 논문은 요구사항 도출 인터뷰를 돕기 위해 스크립트 생성, 실시간 주제 추적, 후속 질문 생성을 결합한 AI 지원 워크플로우를 제안합니다. 실험 결과, AI 지원 인터뷰는 교육만 받은 경우보다 더 정교한 목표 모델을 생성하며 높은 품질의 스크립트를 제공함을 입증했습니다.
코딩 에이전트의 저장소 수준 취약점 탐지 능력을 평가하기 위한 새로운 벤치마크인 VulnGym을 제안합니다. GitHub 어드바이저리를 기반으로 세밀한 취약점 추적 주석을 제공하여 에이전트의 코드 로컬라이제이션 및 증거 구축 능력을 진단합니다.
LLM의 저장소 수준 코드 생성을 위해 부분 의존 그래프를 활용한 DyRetriever를 제안합니다. 기존 RAG의 한계를 극복하기 위해 LLM의 의미론적 이해를 바탕으로 다중 홉 추론을 수행하며, 효율적인 컨텍스트 검색을 가능하게 합니다.
AArch64 기계어에서 소스 코드 없이 취약점을 탐지하기 위해 설명 가능한 디지털 트윈 기술을 제안합니다. 디지털 트윈을 통해 프로그램 실행 상태를 재현하고, 클레이니 대수 기반의 심볼릭 규칙을 유한 오토마타로 컴파일하여 취약점을 탐지합니다.
Brevis는 무손실 텐서 압축을 프로그램 합성 문제로 공식화하여 모델 체크포인트의 저장 공간을 효율적으로 줄이는 연구입니다. 타입 지정 DSL과 A* 탐색을 통해 텐서 구조를 포착하는 최적의 프로그램을 합성하며, 기존 범용 및 텐서 특화 압축기보다 뛰어난 압축률을 보여줍니다.
AgenticRepair는 에이전트 기반의 다각적 프로그램 컨텍스트 엔지니어링을 통해 자동화된 보안 취약점 수정을 수행하는 프레임워크입니다. 코드 구조, 런타임 실행, 커밋 히스토리라는 세 가지 핵심 컨텍스트를 활용하여 기존 방식보다 높은 패치 성공률을 달성했습니다.
에이전틱 AI 시스템의 복잡한 다단계 동작을 검증하기 위한 새로운 방법론을 제시하는 조사 논문입니다. 257편의 논문을 분석하여 행동, 안전, 시간적, 규제, 다중 에이전트라는 5차원 분류 체계를 구축하고 현재 기술의 격차를 규명합니다.
AuditCoder는 코드 생성 시 프로그램과 함께 감사 가능한 생성 추적을 출력하여 생성 결정과 수정 이력을 보존하는 프레임워크를 제안합니다. 작업 그래프를 통해 책임 식별자를 할당하고, 검증 실패 시 특정 영역만 국소적으로 수정할 수 있는 기능을 제공합니다.
AI 코딩 에이전트의 대규모 코드 생성을 효과적으로 검토하기 위한 새로운 시스템 ARCTIC을 제안합니다. 의도 예측, 드리프트 탐지, 코드 스포트라이트 기능을 통해 정확성, 보안, 성능 중심의 고도화된 코드 비평을 수행합니다.