Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
ProfMalPlus는 정적·동적 분석과 LLM 에이전트 협업을 결합하여 악성 NPM 패키지를 탐지하는 새로운 프레임워크를 제안합니다. 객체 민감형 동작 그래프와 다중 에이전트 추론을 통해 기존 탐지기보다 월등히 높은 성능을 입증했습니다.
코딩 에이전트가 실패 사례를 통해 도메인 규칙을 학습하고 보존할 수 있도록 하는 '반례 보완 스케치 기반 에이전트 합성' 방법론을 제안합니다. 인간의 스케치와 에이전트의 구현, 그리고 반례를 통한 지속적인 수리 과정을 통해 정책을 진화시키는 저장소 네이티브 방식을 다룹니다.
본 논문은 리포지토리 레벨 문서(README 등)의 부정확성으로 발생하는 'README 버그'를 실시간으로 탐지하고 복구하는 READU라는 불일치 기반 기법을 제시합니다. READU는 소스 코드나 외부 의존성과 같은 진실의 원천과의 불일치를 찾아내고, 이를 바탕으로 문서 패치를 자동으로 합성하여 높은 효율성을 입증했습니다.
본 논문은 자율주행 시스템(ADS)의 복잡한 테스트 문제를 다루며, 6개국 9개사 전문가 인터뷰를 통해 산업 현장의 관행과 과제를 분석했습니다. 현재는 시나리오 기반 및 X-in-the-loop 방식이 주류이나, 향후 AI와 월드 모델을 활용한 자동화되고 데이터 기반의 폐쇄 루프 테스트 프레임워크가 필요함을 제안합니다.
본 논문은 복합 시스템의 이질적인 도메인 간 연결성을 다루는 '도메인 간 디지털 트윈(trans-domain digital twin)'을 제안합니다. 이는 정렬된 공유 상태를 통해 데이터, 모델, 목표, 제어 등을 명시적으로 결합하는 운영적 공식화입니다. 제안된 프레임워크는 7개 계층의 아키텍처와 오케스트레이션 코어를 포함하며, 적응 및 안전성 검증에 대한 기준을 제시합니다.
본 논문은 코드 변경으로 인해 발생하는 행동 차이를 효과적으로 노출시키는 새로운 LLM 기반의 차분 테스트 접근 방식인 DiffTestGen을 제안합니다. DiffTestGen은 정적 호출 그래프 분석과 프로젝트 문서를 활용하여 유효한 진입점을 식별하고, '합집합 커버리지' 메트릭으로 반복적인 피드백을 제공합니다. 평가 결과, 기존 방법보다 훨씬 높은 비율로 행동 차이를 노출시키고 코드 커버리지를 크게 향상시켰습니다.
본 논문은 프롬프트의 미세한 구문적 구성 요소들이 open LLMs가 생성하는 코드의 보안에 미치는 영향을 연구했습니다. 파서 기반 접근 방식을 통해 다양한 구문 변형을 체계적으로 생성하고, 여러 open LLM 및 언어 전반에서 그 영향이 코드 보안에 미치는 것을 평가했습니다. 이 결과는 특정 구문 요소와 위치가 불안전한 코드 생성 가능성에 일관되게 영향을 준다는 점을 보여줍니다.
본 검토 논문은 LLM 사용이 증가하는 과학 연구 분야에서 필요한 핵심 역량을 분석했습니다. 194개 논문을 분석한 결과, 도메인 전문 지식과 AI 출력물에 대한 감독 능력이 가장 중요하며, 메타인지, 윤리적 책임성, 프롬프트 엔지니어링 등 통합적인 역량 세트가 요구됨을 제시합니다.
본 논문은 자동차 도메인과 같이 다양한 툴이 공존하는 환경에서 모델 상호운용성 문제를 해결하기 위한 LLM 기반 접근 방식을 제시합니다. 이 방법론은 모델 인스턴스를 메타모델에 매핑하고, 여러 메타모델을 병합하여 구조적으로 유효한 대상 모델을 자동으로 생성할 수 있음을 보여줍니다.
본 연구는 LLM이 동일한 코딩 작업에 대해 다른 자연어 프롬프트를 받을 때 발생하는 '언어 편향'을 조사했습니다. Python과 Java를 포함한 460개 작업을 다국어로 번역하고 수동으로 큐레이션하여, 기능적 정확성 및 구조적 품질 등 여러 차원에서 생성된 코드를 평가했습니다.
본 연구는 모바일 앱 자동 코드 생성 시 발생하는 디자인 원칙 무시 문제를 해결하기 위해, 소프트웨어 디자인 패턴의 변이성을 포착하고 활용하는 방법을 제안합니다. Universal Variability Language (UVL)를 사용하여 주요 디자인 패턴의 구조적/행동적 변이 지점을 모델링하고, 이를 Jinja 템플릿과 통합하여 Swift 코드를 생성할 수 있습니다.
본 논문은 양자 컴퓨팅 환경의 복잡성을 다루며, 디자인 과학 연구(DSR) 방법론을 활용하여 사회기술적 관점의 평가 프레임워크를 제시합니다. 이 프레임워크는 '중력 우물'과 '사회기술적 바람직 요소'라는 두 가지 분석 구성 요소를 도입했습니다. 이를 통해 실무자들이 아키텍처 유연성을 유지하며 환경을 선택할 수 있도록 돕습니다.
본 논문은 자연어 명제를 실행 가능한 단언(executable assertions)으로 자동 형식화하는 프레임워크 'Monty'를 제안합니다. Monty는 단언의 유효성 기대와 자연어 모호성을 다루며, 새로운 적합도 점수 측정법을 도입했습니다. 이를 통해 기존 LLM 기반 방식보다 훨씬 높은 신뢰도로 정답 단언을 생성함을 입증했습니다.
본 글은 여러 장치를 아우르는 복합적인 사용자 목표를 평가하기 위한 대규모 벤치마크인 DevicesWorld를 소개한다. 이 프레임워크는 모바일, 데스크톱, IoT 세 가지 환경을 통합하여 크로스 디바이스 상호작용 및 종단 간 작업을 포함하는 6,140개의 태스크를 제공한다. 평가 결과, 기존 LLM 에이전트 시스템들은 낮은 성공률(최고 12.5%)을 보였으며, 정보 습득이나 장치 간의 의존성 처리에서 어려움을 겪는 것으로 분석되었다.
본 논문은 지속형 워크플로우 엔진의 업그레이드 위험을 정량화하는 새로운 확률 모델을 제시합니다. 기존 방식들이 모든 변경을 최대 위험으로 간주하여 비효율적이었던 문제를 해결하고자 합니다. 이 모델은 원격 측정 데이터만을 사용하여, 드라이-런 없이도 버전 간 실행 업그레이드 위험(WUR) 점수를 신뢰 구간과 불확실성으로 제공합니다.
LLM 기반 자율 에이전트의 진화에 따라 통합된 평가 인프라가 중요해지고 있습니다. AgentCompass는 오픈 소스이며 확장 가능한 프레임워크로, 벤치마크, 하네스, 환경 세 가지 독립 구성 요소를 제공하여 재현성 높은 에이전트 평가를 가능하게 합니다.
VisualRepair는 LLM 기반의 자동화 프로그램 복구(APR)에서 발생하는 시각적 정보 활용 문제를 해결하기 위해 제안된 MLLM 프레임워크입니다. 이 프레임워크는 이미지 타입 인식 도구 호출(ITTC)과 동적 테스트 시간 영역 집중(DTRF)이라는 두 가지 핵심 모듈을 포함합니다. 실험 결과, VisualRepair가 기존 최고 기준선보다 우수한 성능을 보여 자동화된 시각적 소프트웨어 문제 수리에 효과적임을 입증했습니다.
본 논문은 LLM이 생성한 코드의 자체 복구 능력을 평가하기 위해 PoPE(Popperian Placebo-controlled Evaluation)라는 새로운 방법론을 제안합니다. 이 방법은 오류 내용을 채널별 위약과 짝지어, 사전에 정의된 스캐폴드를 유지하며 작업 관련 내용만 제거하여 모델의 성능을 측정합니다. 실험 결과, 프롬프트와 가중치 채널 모두에서 기대했던 복구 능력이 명확히 관찰되지 않았으며, 이는 기존 자체 평가 방식에 대한 근본적인 의문을 제기합니다.
본 논문은 LLM이 생성한 계획 경로에서 발생하는 실패를 연구하며, 특히 '삭제(omission)'가 점수 개선에 기여하는 현상을 분석합니다. 이를 통해 단순 생략만으로 높은 점수를 얻는 문제를 지적하고, 모델 매개 타입 기반 상태 기록을 활용하여 사후 생략 스플라이스를 감지하고 무력화하는 방법을 제안합니다.
본 연구는 코드 조각만으로 출처를 추적하고, 인간과 LLM이 사용하는 보안 패턴의 차이를 분석하는 오픈 소스 파이프라인을 구축했습니다. 9개 언어 모델과 Stack Overflow API를 활용하여 민감한 프로그래밍 작업 31가지에 대한 샘플을 수집하고, 이를 통해 출처 분류기 및 보안 패턴 비교 분석 결과를 제시합니다.