Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 MISRA-C++ 2023 코딩 가이드라인을 Rust 언어에 체계적으로 매핑하는 MISRust 연구를 소개합니다. Rust의 언어 설계가 기존 안전 규칙을 어떻게 자동으로 충족하는지 분석하고, unsafe Rust 사용 시 필요한 가이드라인을 제안합니다.
LLM 에이전트의 실패를 진단하기 위해 코퍼스 수준의 트레이스를 분석하는 멀티 에이전트 시스템 'Insights Generator(IG)'를 제안합니다. IG는 가설 제안과 테스트를 통해 체계적인 행동 패턴을 자연어로 요약하며, 전문가의 성능을 30.4pp 향상시키는 효과를 입증했습니다.
비결정론적인 플래키 테스트(Flaky tests)의 재현 문제를 해결하기 위해 구축된 새로운 데이터셋 ReproFlake를 소개합니다. 이 데이터셋은 재현 가능한 환경, 실패 재현 스크립트, 자동 수정 스크립트 및 실행 로그를 포함하여 연구자들이 플래키 테스트를 효과적으로 탐지하고 디버깅할 수 있도록 지원합니다.
AI 코딩 에이전트의 Pull Request(PR) 결과가 에이전트의 실제 역량을 정확히 반영하지 못한다는 연구 결과입니다. 거절된 PR의 상당수가 에이전트의 오류가 아닌 워크플로 제약이나 근거 부족 때문임을 밝히며, 상호작용을 고려한 새로운 평가 방식의 필요성을 제안합니다.
LLM을 이용한 레거시 코드 현대화 과정에서 모델이 자신의 출력 결과가 동작을 변경했는지 스스로 검토하는 능력이 부족함을 연구했습니다. 실험 결과, 모델의 성능이나 가격과 상관없이 특정 코드 구조에서 의미론적 오류가 빈번하게 발생하며 자기 검토 기능이 신뢰할 수 없는 안전망임을 확인했습니다.
생물학 연구 프롬프트에서 LLM의 거절 행동을 분석하는 새로운 벤치마크인 RefusalBench를 소개합니다. 기존의 단순 거절률 지표가 모델의 실제 안전 교정 능력을 왜곡할 수 있음을 지적하며, 모델 제공자별 특성과 계층별 판별력을 분석합니다.
LLM의 분포 외(OOD) 상황에서 발생하는 정렬 실패를 감지하기 위한 새로운 벤치마크인 MOOD를 제안합니다. 연구 결과, 기존 가드 모델은 OOD 상황에서 일반화 성능이 낮으며, OOD 탐지기를 결합할 때 재현율이 크게 향상됨을 입증했습니다.
ASSEMBLAGE-DEEPHISTORY는 시간적 이력, 교차 빌드 다양성, CVE 레이블을 통합한 새로운 바이너리 데이터셋 프레임워크를 제안합니다. 248개 오픈 소스 프로젝트의 73,610개 바이너리를 포함하며, LLM의 바이너리 취약성 추론 능력과 임베딩 클러스터링 성능을 검증합니다.
FuzzingBrain V2는 멀티 에이전트 LLM을 활용하여 소프트웨어 취약점을 자동으로 탐지하고 재현하는 시스템입니다. 높은 오탐률과 컨텍스트 부족 문제를 해결하기 위해 제어 흐름 기반 추상화와 이중 계층 퍼징 기술을 도입했습니다. AIxCC 2025 데이터셋에서 90%의 탐지율을 기록하며 실제 제로 데이 취약점 발견 능력을 입증했습니다.
LLM 에이전트를 활용하여 C/C++, Java 등 소프트웨어의 퍼즈 하네스(fuzz harnesses)를 자율적으로 생성하고 검증하는 QuartetFuzz 시스템을 제안합니다. 4가지 원칙 프레임워크를 통해 논리적 정확성과 API 준수 등을 체계적으로 보장하며, 실제 프로젝트에서 다수의 CVE를 발견하는 성과를 거두었습니다.
SymTEE는 TEE 애플리케이션의 입력 검증 누락 문제를 탐지하기 위한 LLM 지원 심볼릭 실행 프레임워크입니다. AST 분석과 GPT-5를 결합하여 KLEE 호환 하네스를 자동 생성함으로써, 복잡한 환경 설정 없이도 높은 정밀도로 보안 취약점을 찾아냅니다.
PITMuS는 변이 테스트 도구인 PIT의 XML 메타데이터와 디버그 정보를 활용하여 소스 레벨의 버그 데이터셋을 자동으로 생성하는 도구입니다. 기존 벤치마크의 데이터 오염 문제를 해결하기 위해 최신 소스 코드에 제어된 버그를 주입하여 구조화된 데이터셋을 제공합니다.
SWE 에이전트의 학습 데이터 품질을 높이기 위해 개발자의 패치를 활용하는 P2T(Patches-to-Trajectories) 방법론을 제안합니다. 기존 SFT 방식의 결함을 해결하기 위해 단계별 효과성과 궤적 길이를 최적화하여 고품질의 추론 궤적을 생성합니다.
Java 디자인 패턴 코드 요약 시 결정론적(규칙 기반) 방식과 확률론적(LLM 기반) 방식의 성능을 비교 연구했습니다. 연구 결과, LLM은 풍부한 문맥과 의미론적 정렬에 강점이 있는 반면, 규칙 기반 방식은 간결함과 재현성 측면에서 우수함을 확인했습니다.
코딩 에이전트가 이슈 해결 과정에서 발생하는 '엉킨 리팩토링(Tangled Refactoring)' 현상을 분석한 연구입니다. 에이전트가 인간보다 엉킨 리팩토링을 적게 수행하지만, 컴파일 가능성을 저하시키는 원인이 됨을 밝히고 이를 완화하는 정제 접근 방식을 제안합니다.
TEE 애플리케이션의 잘못된 파티셔닝 문제를 자동으로 복구하는 프레임워크 TEERepair를 제안합니다. DSL을 통해 보안 규칙을 정의하고 LLM을 활용하여 문맥에 맞는 패치를 생성하며, 높은 복구 성공률을 입증했습니다.
Astragalus는 네트워크 설정 오류를 해결하기 위해 구문 중심(syntax-driven) 접근 방식을 사용하는 새로운 자동 설정 복구(ACR) 방법론입니다. 기존의 의미론 중심 방식과 달리 기존 코드를 이식하는 방식을 사용하여 복잡한 제약 조건 구축 비용을 줄이고 확장성을 높였습니다.
LLM이 생성한 테스트 스위트의 품질을 평가하기 위한 새로운 벤치마크인 SWE-Mutation을 소개합니다. 에이전트 기반 프레임워크를 통해 변이된 솔루션을 생성하여 테스트 스위트의 판별력을 측정하며, 현재 LLM의 성능이 신뢰할 수 있는 테스트 생성에 미치지 못함을 입증합니다.
본 논문은 블록체인 애플리케이션의 탈중앙화된 배포 및 운영을 위한 새로운 아키텍처를 제안합니다. DAO의 거버넌스 개념과 DevOps 관행을 결합하여, 스마트 계약의 자동화된 테스트와 결정론적 배포를 지원하는 분산형 프레임워크를 제시합니다.
기존 모델 해석 방법론들이 베이스라인을 간과하여 발생하는 오류를 지적하고, 이를 해결하기 위한 새로운 해석 원칙을 제안합니다. 그래디언트 기반 방법과 테일러 전개를 통합하여 베이스라인의 중요성을 입증하고, 기여도 오차를 통한 정밀한 품질 평가 방식을 권장합니다.