Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Windows 운영체제의 방대한 바이너리 중 취약점 분석 가치가 높은 함수를 선별하는 LLM 기반 파이프라인을 제안합니다. Symbolicate-Enrich-Sample 방식을 통해 수백만 개의 함수를 분석 가능한 수준의 우선순위 목록으로 압축합니다.
MAAD는 요구사항을 다중 뷰 아키텍처 청사진으로 변환하기 위해 4개의 특화된 에이전트를 활용하는 지식 기반 프레임워크입니다. RAG와 계층적 메모리를 통합하여 아키텍처 표준을 준수하고 설계 이력을 관리하며, 자동화된 품질 평가를 제공합니다.
본 연구는 요구사항 엔지니어링 과정에서 협업과 프로젝트 성공을 저해하는 엔지니어의 바람직하지 않은 속성을 조사했습니다. 실무자 설문과 인터뷰를 통해 17가지 속성을 식별하고 이를 네 가지 범주로 분류하여 개념도를 제시했습니다.
AI 에이전트 기술(Agent skills)의 보안 경계를 분석하기 위해 ClawHub Security Signals 데이터셋을 활용한 연구를 소개합니다. VirusTotal, 정적 분석, NVIDIA SkillSpector 간의 탐지 불일치를 분석하여 에이전트 보안을 위한 계층화된 거버넌스의 필요성을 강조합니다.
소프트웨어 아키텍처 설계를 위한 12가지 멀티 에이전트 LLM 협업 토폴로지를 비교 분석한 연구입니다. 실험 결과, 구조적 적대적 방식(v4b)이 가장 우수한 성능을 보였으며, 병렬 병합 방식은 토큰 기아 현상으로 인해 가장 낮은 성능을 기록했습니다.
주행 VLM의 검증을 위해 누락된 테스트 슬라이스를 추천하는 SliceScorer와 SliceNav를 제안합니다. SliceScorer는 노출 기반 및 이웃 실패 사전 확률을 결합하여 고위험 커버리지 격차를 식별하며, SliceNav는 LLM을 통해 검증 워크플로우를 자동화합니다.
본 논문은 산업 현장에서 생성형 AI를 요구사항 공학(RE)에 적용할 때 발생하는 워크플로 변화와 도구 통합의 중요성을 연구합니다. AI가 PO와 개발자 간의 상호작용을 재편하고, 도구 통합 여부에 따라 생산성 격차가 발생함을 실증적으로 분석합니다.
LLM 에이전트가 생성한 다중 파일 코드 변경 사항을 효과적으로 리뷰하기 위한 참여적 설계 연구를 다룹니다. 개발자의 신뢰 보정(trust-calibration)을 돕는 3단계 워크플로우와 7가지 디자인 구성 요소를 제안합니다.
LLM 기반 Go 코드 리뷰의 성능을 높이기 위해 이슈 목록 생성 및 다양한 컨텍스트 증강 전략을 제안하는 연구입니다. 인접 컨텍스트, LSP 기반 의미론, IR 기반 공동 변경 컨텍스트를 활용하여 리뷰 정확도를 크게 향상시켰습니다.
GitHub의 279개 오픈 소스 프로젝트를 분석하여 머신러닝 전용 코드 스멜과 일반 Python 코드 스멜의 차이를 연구했습니다. 프로젝트 특성이 코드 품질에 미치는 영향을 조사하여 도메인별 맞춤형 품질 보증 전략의 필요성을 제시합니다.
재현 패키지의 품질을 자동으로 평가하기 위해 멀티 에이전트 접근 방식을 탐구한 연구입니다. 51개의 재현성 기준을 도출하여 자동화된 검사 및 보고서 생성 프로토타입을 구현하였으며, 높은 일관성과 정확도를 확인했습니다.
OpenEvolve를 활용하여 텐서 네트워크의 수축 순서 최적화 알고리즘을 개발하는 사례 연구를 다룹니다. LLM 선택과 평가 지표 설계의 중요성을 강조하며, 검증기 가이드형 진화 코딩 에이전트의 가능성을 제시합니다.
Stack Overflow의 21만 개 이상의 데이터를 분석하여 소프트웨어 로깅의 트렌드와 주제를 연구한 논문입니다. LLM 기반 분류를 통해 11개 주제를 식별했으며, 컨테이너 환경에서의 로깅이 가장 어려운 과제임을 밝혀냈습니다.
AI 지원 명세 기반 개발 시 발생하는 보안 취약점 문제를 해결하기 위해 다층 보안 모델과 보안 지식 전이 방법을 제안하는 연구입니다. 실험 결과, 제안된 모델을 적용했을 때 보안 실패 사례가 유의미하게 감소함을 확인했습니다.
기존 벤치마크가 간과한 웹페이지의 복잡한 상호작용 동작을 평가하기 위해 새로운 벤치마크인 WebIGBench를 제안합니다. 시각적 충실도를 넘어 상호작용 일관성을 측정하며, MLLM의 프론트엔드 코드 생성 능력을 정밀하게 평가합니다.
AI-PROPELLER은 Magellan 에이전트 워크플로를 활용하여 절차 간(interprocedural) 코드 레이아웃을 최적화하는 기술입니다. 실제 하드웨어 성능 카운터를 보상 신호로 사용하는 진화 루프를 통해 대규모 애플리케이션에서 유의미한 성능 향상을 입증했습니다.
멀티 에이전트 LLM 시스템의 아키텍처가 생성된 코드의 구조적 복잡도에 미치는 영향을 HumanEval 벤치마크를 통해 분석한 연구입니다. 분석가-코더 분리와 테스터 도입이 코드 복잡도를 높이는 반면, 디버거는 복잡도를 낮추는 효과가 있음을 밝혔습니다.
인간과 LLM이 생성한 코드의 보안성을 객관적으로 비교하기 위한 자동화된 연구 프레임워크를 제안합니다. 이 프레임워크는 인간 단독, LLM 단독, 하이브리드 방식의 실험을 지원하며 정적 및 동적 분석을 통해 보안 품질을 측정합니다.
Microsoft 엔지니어 16,223명의 데이터를 활용하여 GitHub Copilot이 실제 개발 생산성에 미치는 영향을 분석한 연구입니다. 고정 효과 모델을 통해 개인차와 작업량 변수를 통제한 결과, Copilot 사용 시 PR 완료율이 최대 40.5% 증가함을 입증했습니다.
기존 DORA 프레임워크의 한계를 극복하기 위해 배포 리듬의 규칙성을 측정하는 '전달 일관성(DC)' 지표를 제안합니다. 120주간의 데이터를 통해 DC와 Delivery Health Matrix를 결합하여 엔지니어링 팀의 성과를 더욱 정밀하게 진단할 수 있음을 입증했습니다.