Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM의 코드 생성 정확도를 높이기 위해 Route, Align, Verify의 세 단계로 구성된 RAV 프레임워크를 제안합니다. 백본 모델 수정 없이 프롬프트 라우팅, LoRA 적응, 실행 기반 검증을 통해 MBPP 벤치마크에서 유의미한 성능 향상을 달성했습니다.
소프트웨어 엔지니어링 워크플로우에 통합되는 코딩 에이전트가 정적 상태를 벗어나 스스로를 업데이트하는 '자기 진화형 코딩 에이전트' 연구를 체계적으로 정리한 서베이 논문입니다. 에이전트의 진화 객체에 대한 분류 체계를 제안하고, 실행 가능한 피드백과 저장소 컨텍스트가 갖는 역할 및 과제를 분석합니다.
LLM의 코드 생성 능력을 다각도로 평가하기 위한 새로운 벤치마크인 CodeAssay를 제안합니다. 검증된 정답과 다중 지표를 활용하여 기존 테스트 기반 평가의 한계를 보완하고 모델 간 성능 격차를 더욱 명확히 드러냅니다.
EffiHolmes는 대규모 소프트웨어의 시간 비효율성 수정 위치를 국소화하기 위한 LLM 기반 프레임워크입니다. 차분 프로파일링과 도메인 가이드 LLM 추론을 통해 실행 노이즈를 극복하고 근본적인 비효율성 로직을 찾아냅니다.
기존의 정적인 웹 생성 평가 방식의 한계를 극복하기 위해 에이전트 기반의 자동화된 평가 프레임워크인 LiveEvalBench를 제안합니다. 이 프레임워크는 빌드, 코드, UI 테스터 역할을 수행하는 에이전트들이 협업하여 웹 프로젝트의 전체 라이프사이클을 상호작용적으로 평가합니다.
자연어 버그 리포트를 기반으로 웹 GUI 버그를 자동으로 재현하는 LLM 에이전트 시스템 ReBug을 제안합니다. ReBug은 누락된 전제 조건을 재구성하고 브라우저 내에서 직접 실행 및 검증하는 2단계 프로세스를 통해 높은 재현 성공률을 달성했습니다.
Linux 커널 주석 내의 오래된 함수 참조를 탐지하고 수정하는 ReCite 프레임워크를 제안합니다. LLM과 Git 히스토리를 활용하여 코드-주석 불일치를 해결하며, 실제 커널 패치 수락을 통해 유효성을 입증했습니다.
LLM을 활용한 터미널 사용자 인터페이스(TUI) 테스트의 가능성을 조사한 연구입니다. 197개의 실제 TUI 애플리케이션을 대상으로 LLM과 무작위 탐색 방식을 비교 분석하여, LLM이 특정 결함 발견에 효율적이지만 아직 완벽한 해결책은 아님을 밝혀냈습니다.
LLM 에이전트의 루프, 도구 오류, 목표 이탈 등의 실패를 실시간으로 탐지하고 복구하는 효율적인 모니터링 시스템을 제안합니다. 마이크로초 단위의 저비용 모니터와 결정론적 검증을 결합하여, 추가적인 LLM 호출 비용을 최소화하면서도 에이전트의 작업 성공률을 크게 향상시켰습니다.
오픈 소스 소프트웨어 개발이 기업의 매출 총이익률을 평균 4-5% 높인다는 연구 결과가 발표되었습니다. 이는 외부 기여자의 지식을 활용한 노동 생산성 향상이 주요 원인이며, 내부 R&D와의 결합이 수익성 달성의 핵심 조건입니다.
장기 코딩 에이전트의 학습 효율을 높이기 위해 에이전트가 스스로 행동 경계를 설정하는 '의미론적 자기 분할' 기법을 제안합니다. 에이전트가 자신의 추측에 이름을 붙임으로써 실패와 수정 과정을 명확히 구분하고, 이를 통해 고품질의 지도 학습 데이터를 생성할 수 있음을 입증했습니다.
ECLAIR은 소프트웨어 공학의 과학적 발견을 위해 LLM을 인과 추론 원칙에 따라 통합한 AI 프레임워크입니다. 가설 생성부터 분석까지 과학적 프로세스를 자동화하며, 인간 참여형 설계를 통해 추론의 정확성을 확보합니다.
에이전트 기반 소프트웨어 엔지니어링 환경에서 발생하는 새로운 비용 구조를 분석하고 이를 추정하기 위한 ACEM 모델을 제안합니다. LLM 토큰 소비, 인간의 감독(HITL), 인프라 비용을 중심으로 기존의 소프트웨어 규모 측정 지표와 연결하는 프레임워크를 다룹니다.
LLM 추론 과정의 복잡한 교차 계층 문제를 해결하기 위한 비침습적 근본 원인 분석(RCA) 프레임워크인 TELLER를 제안합니다. NVTX/CUPTI 트레이스와 로그를 결합하여 요청별 호출 체인을 재구성하고, TPE 토크나이저를 통해 효율적인 분석을 수행합니다.
코딩 LLM 평가의 신뢰성을 높이기 위해 테스트 스위트의 결함을 찾아내는 코딩 에이전트 연구를 소개합니다. 에이전트가 적대적 테스트 케이스를 생성하고 인증 체인을 통해 버그를 검증함으로써, 기존 공식 스위트가 놓치는 '정답이지만 버그가 있는' 제출물을 효과적으로 식별합니다.
LLM이 소프트웨어 취약점을 추론할 때 도메인 지식을 위반하는 문제를 해결하기 위해 EntailLLM을 제안합니다. 논리 프로그래밍과 함수 호출 그래프를 활용하여 LLM의 분석 경로를 검증함으로써 신뢰성을 높입니다.
사무 업무 기반의 장기적 사후 학습(Post-Training)이 소프트웨어 엔지니어링 능력을 향상시킨다는 연구 결과입니다. Qwen3.5 모델을 사무 워크플로우로 학습시킨 결과, 소프트웨어 관련 과업이 아님에도 SWE-Bench Pro 점수가 향상되었습니다.
본 논문은 요구사항 도출 인터뷰를 돕기 위해 스크립트 생성, 실시간 주제 추적, 후속 질문 생성을 결합한 AI 지원 워크플로우를 제안합니다. 실험 결과, AI 지원 인터뷰는 교육만 받은 경우보다 더 정교한 목표 모델을 생성하며 높은 품질의 스크립트를 제공함을 입증했습니다.
코딩 에이전트의 저장소 수준 취약점 탐지 능력을 평가하기 위한 새로운 벤치마크인 VulnGym을 제안합니다. GitHub 어드바이저리를 기반으로 세밀한 취약점 추적 주석을 제공하여 에이전트의 코드 로컬라이제이션 및 증거 구축 능력을 진단합니다.
LLM의 저장소 수준 코드 생성을 위해 부분 의존 그래프를 활용한 DyRetriever를 제안합니다. 기존 RAG의 한계를 극복하기 위해 LLM의 의미론적 이해를 바탕으로 다중 홉 추론을 수행하며, 효율적인 컨텍스트 검색을 가능하게 합니다.