Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
커스텀 로직을 API 호출로 교체하는 리팩터링에 대한 최초의 실증적 연구를 소개합니다. 연구팀은 AKIRA라는 하이브리드 프레임워크를 제안하여 정적 패턴 매칭과 의미론적 추론을 결합함으로써 기존 기술 대비 높은 재현율과 정밀도를 달성했습니다.
HarmonyOS의 ArkUI로 UI를 자동 포팅하기 위한 LLM 기반 접근 방식인 ArkTrans를 제안합니다. 휴리스틱 스켈레톤 구축과 패턴 매칭 기반의 사후 수정을 통해 기존 LLM의 한계를 극복하고 높은 컴파일 성공률을 달성했습니다.
AI 코딩 에이전트의 공급망 보안 위협을 평가하기 위한 최초의 런타임 검증 벤치마크인 MalSkillBench를 제안합니다. 코드와 프롬프트가 결합된 악성 기술을 탐지하기 위해 3,944개의 악성 샘플과 샌드박스 기반 검증 파이프라인을 구축했습니다.
JSON 데이터를 RDF로 변환하여 시맨틱 상호운용성을 확보하는 MetaConfigurator 워크플로를 제안합니다. AI를 활용해 RML 매핑, SPARQL 쿼리 생성, 지식 그래프 시각화를 통합적으로 지원하여 연구 데이터 관리의 기술적 장벽을 낮춥니다.
미 국방부(DoD)의 소프트웨어 획득 경로(SWP)가 AI 시스템의 독특한 요구사항을 충족할 수 있는지 시나리오 기반으로 평가한 연구입니다. 분석 결과, 데이터 출처 및 생애주기 관리 등 AI 특화 통제 항목이 분산되어 있어 정책과 실행 간의 간극이 존재함을 확인했습니다.
GiANT는 실제 감사 보고서에서 취약점 정보를 자동으로 추출하는 프레임워크로, CoT와 분할 정복 전략을 사용합니다. 이를 통해 생성된 GiAnt Corpus는 높은 신뢰성을 바탕으로 스마트 컨트랙트 보안 연구를 위한 벤치마크를 제공합니다.
양자 소프트웨어의 침묵하는 오류를 탐지하고 수정하기 위한 멀티 에이전트 프레임워크인 QBugLM을 제안합니다. OpenQASM 3.0을 대상으로 버그 주입부터 시뮬레이션 검증까지 자동화된 파이프라인을 구축하여 LLM의 양자 디버깅 능력을 벤치마킹했습니다.
본 논문은 이상적인 센싱에 의존하는 기존 SIL 시뮬레이션의 한계를 극복하기 위해 인지 기반 폐루프 시뮬레이션 프레임워크를 제안합니다. 인과적 확률 모델을 통합하여 안개나 비와 같은 환경 조건에서 발생하는 현실적인 인지 오류를 체계적으로 주입하고 검증합니다.
GitHub의 새로운 프로젝트들을 분석한 결과, 코딩 에이전트의 도입률이 이전 연구 대비 두 배 이상 증가했음을 확인했습니다. AI 보조 커밋 비율이 급격히 높아지며 에이전트 도입 양상이 더욱 집약적으로 변하고 있습니다.
LLM 에이전트가 개발자 문서를 작성할 때 파일 간 의존성을 효과적으로 추적할 수 있도록 돕는 Context-as-AI-Service(CAIS)를 제안합니다. CAIS는 소스 코드와 API 참조 등을 인덱싱하여 에이전트가 정확한 증거를 검색할 수 있는 레이어를 제공합니다.
자율적 데이터 과학 에이전트의 세션 간 메모리 부족 문제를 해결하기 위해 CBR(사례 기반 추론)과 SLM을 결합한 연구를 제안합니다. Gemma 4 31B를 백본으로 사용하여 구조화된 사례 기록과 품질 필터링을 통해 에이전트의 추론 정확도와 안정성을 높였습니다.
클라우드 인프라 코드(IaC)의 점진적 수정 능력을 평가하기 위한 새로운 벤치마크인 SWE-InfraBench를 소개합니다. AWS CDK와 같은 명령형 도구를 활용하여 실제 기업 환경의 코드 수정 과제를 LLM에 부여하고 그 성능을 측정합니다.
연구 산출물 배포를 위한 멀티 도메인 벤치마크인 DeployBench를 소개합니다. AI/ML 및 시스템 수준의 의존성을 포함한 51개 작업을 통해 LLM 에이전트의 실제 배포 능력을 평가합니다.
본 논문은 LLM과 외부 도구 간의 상호작용을 지원하는 MCP 서버의 런타임 결함에 대한 최초의 경험적 분류 체계를 제시합니다. 473개의 GitHub 저장소를 분석하여 11개의 상위 카테고리와 27개의 하위 카테고리로 구성된 체계를 도출했습니다.
자율 소프트웨어 에이전트 사용 시 개발자가 수행하는 인간 감독(human oversight)의 실태를 조사한 연구입니다. 17명의 개발자 인터뷰를 통해 사전 제어, 공동 계획, 실시간 모니터링, 사후 검토라는 네 가지 감독 형태를 발견했습니다.
본 논문은 코드 LLM의 안전 정렬로 인한 거부(Refusal) 현상을 해결하기 위해 Abliteration 기법을 제안합니다. 잔차 스트림에서 거부 방향을 직교 투영하여 제거함으로써, 모델의 코드 생성 능력은 유지하면서 특정 취약점 주입 요청에 대한 거부율을 획기적으로 낮출 수 있음을 입증했습니다.
DeFi 결합성(composability)에서 발생하는 경제적 보안 리스크를 분석하기 위한 새로운 공식 프레임워크를 제안합니다. MEV 비간섭 개념과 로컬 MEV 지표를 통해 스마트 컨트랙트 간 상호작용 시 발생하는 취약점을 체계적으로 측정합니다.
산업 자동화용 PLC 소프트웨어(ST)의 품질 검증을 위한 변이 테스트 데이터셋인 STMutants를 제안합니다. 108개의 정교한 변이체를 포함하며, LLM을 활용한 변이 탐지 성능 평가를 통해 데이터셋의 유용성을 입증했습니다.
LLM 코딩 에이전트를 활용해 다양한 에이전트 개발 키트(ADK)의 성능을 자동 평가하는 'ADK Arena' 방법론을 제안합니다. 51개의 Python 프레임워크를 분석한 결과, API 복잡도에 따른 비용 차이와 프레임워크별 성능 편차를 확인했습니다.
Stack Exchange의 역공학(RE) 토론을 활용한 대규모 데이터셋인 REStack을 제안합니다. 15년 이상의 데이터를 분석하여 23개의 의미론적 주제를 식별했으며, RE 실무 연구 및 LLM 기반 개발 지원 도구 개발을 위한 자원을 제공합니다.