Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
이기종 에이전트 시스템에서 일관된 거버넌스를 유지하기 위한 '증명 기반 에이전트 동작(PCAA)' 모델을 제안합니다. 런타임에 종속되지 않는 동작 인증서를 통해 에이전트의 승인 및 실행 과정을 표준화하고 검증하는 체계를 다룹니다.
LLM이 코드를 생성할 때 작업 명세 외의 미세한 문맥적 단서가 알고리즘 선택에 큰 영향을 미친다는 연구 결과입니다. 실험을 통해 특정 단서가 알고리즘 분포를 체계적으로 변화시킴을 확인했으며, 이를 완화하기 위해 직접적인 알고리즘 명명 방식을 제안합니다.
산불 탐지용 DNN 시스템의 신뢰성을 높이기 위한 veriFIRE 프로젝트의 연구를 소개합니다. 항공 플랫폼의 일관성 속성을 검증하기 위해 애플리케이션 요구사항을 신경망 검증기용 쿼리로 인코딩하는 방법론을 제시합니다.
심층 신경망(DNN)의 취약점을 식별하기 위해 잠재 공간을 활용하는 블랙박스 테스트 프레임워크 'Latte'를 제안합니다. VQ-VAE를 통해 의미론적 유사성을 유지하면서도 결함 노출과 다양성을 극대화하는 테스트 케이스 생성이 가능합니다.
심층 신경망의 파라미터를 직접 조작하는 다양한 공격에 대응하기 위한 일반화된 방어 체계인 ParDef를 제안합니다. ParDef는 키 기반 재매개변수화, QC-LDPC 양자화, 적응형 강건 추론을 통합하여 모델 성능 저하를 최소화하면서 공격 성공률을 낮춥니다.
신경망의 신뢰성을 평가하기 위해 베이지안 최적화와 살리언시 기법을 결합한 새로운 테스트 프레임워크 BayesWarp를 제안합니다. 이 방식은 데이터의 의미론적 근접성을 유지하면서도 효율적으로 모델의 실패 사례를 찾아내어 테스트 효과를 높입니다.
본 논문은 프로세스 마이닝 결과물을 URN 기반의 유스케이스 맵(UCM)으로 변환하는 PM4Py-UCM 라이브러리를 제안합니다. 이를 통해 마이닝된 프로세스를 요구사항 공학(RE) 활동에 직접 활용할 수 있는 파이프라인과 계층적 분해 전략을 제시합니다.
LLM 에이전트가 개발자 문서를 정확하게 작성하고 검토할 수 있도록 파일 간 의존성을 시각화하고 검색하는 Context-as-a-Service(CaaS)를 제안합니다. CaaS는 소스 코드와 API 참조를 인덱싱하여 에이전트가 코드베이스 전반의 의존성 체인을 효과적으로 추적하게 돕습니다.
LLM 챗봇이 의료, 금융 등 특정 조직의 복합적인 정책을 준수하는지 평가하는 연구를 소개합니다. 기존 벤치마크가 놓치고 있는 복합 정책 위반 문제를 해결하기 위해 자동화 도구인 COPAL을 제안합니다.
본 연구는 양자 내성 암호(PQC)를 소프트웨어 시스템에 통합할 때 발생하는 기술적, 인간적, 조직적 과제를 분석한 SoK 논문입니다. 기존의 기술 중심 연구에서 벗어나 HOT(Human, Organisation, Technology) 프레임워크를 통해 사회 기술적 관점의 통합적 접근을 제안합니다.
LLM 서빙 프레임워크에서 발생하는 명시적 오류 없는 품질 저하(silent errors)를 진단하는 시스템 Ekka를 제안합니다. 참조 구현체와의 차분 디버깅 방식을 통해 중간 실행 상태를 비교하여 근본 원인을 자동으로 식별합니다.
Rocq(Coq) 환경에서 정리, 의존성, 정의를 효율적으로 추출하고 분석할 수 있는 도구인 TheoremExtr를 소개합니다. 파싱 및 런타임 단계에서 정보를 분석하며, 프로젝트 간 유사도 검색을 지원하는 웹사이트도 함께 제공합니다.
본 연구는 RAG 기반 취약점 탐지 프레임워크인 Vul-RAG의 재현성과 복제 가능성을 Open-weight 모델을 통해 검증합니다. 실험 결과, 로컬 환경에서도 결과가 재현됨을 확인했으나 모델 규모의 증가가 성능 향상으로 직결되지 않는 정체 현상을 발견했습니다.
경험적 소프트웨어 공학(ESE) 분야의 피어 리뷰 현황을 조사한 연구입니다. 논문 제출 증가와 생성형 AI 사용 급증으로 인한 리뷰 부하 및 품질 저하 문제를 다루며, 커뮤니티의 설문 결과를 바탕으로 개선 방향을 제시합니다.
LLM 에이전트의 효과적인 근본 원인 분석(RCA)을 위해 데이터 중심에서 객체 중심 모델링으로 전환하는 UModel 프레임워크를 제안합니다. 시맨틱 그래프와 U-SPL 쿼리 인터페이스를 통해 파편화된 데이터를 통합하고 시스템 탐색 능력을 강화합니다.
개별 소스 코드 라인의 삭제 시점을 예측하는 최초의 프레임워크인 CLSA를 소개합니다. AST 구조와 라인 엔트로피 등 정적 요소를 활용해 코드의 생존 기간을 모델링하며, 유지보수 및 기술 부채 관리에 기여합니다.
통신 도메인의 복잡한 소프트웨어 엔지니어링 능력을 평가하기 위한 최초의 커밋 기반 벤치마크인 TeleSWEBench를 제안합니다. srsRAN 5G 저장소의 실제 커밋을 활용하며, LLM 기반 평가 프레임워크인 TeleJudge를 통해 에이전트의 성능을 다각도로 측정합니다.
소프트웨어 공학 학생들이 연구 논문 작성 과정에서 LLM을 활용한 교육적 경험을 분석한 보고서입니다. 학생들은 브레인스토밍, 방법론 명확화, 글쓰기 개선 등에 LLM을 사용했으며, 동시에 생성된 콘텐츠의 정확성 검증에 대한 우려도 함께 보고되었습니다.
자율주행 VLM의 검증을 위해 누락된 테스트 영역을 식별하는 SliceScorer와 SliceNav를 제안합니다. SliceScorer는 노출 기반 및 이웃 실패 사전 확률을 결합하여 위험한 테스트 슬라이스를 추천하며, SliceNav는 LLM을 통해 검증 워크플로우를 자동화합니다.
안전 필수 시스템을 위해 Rocq를 활용하여 형식 검증된 마이크로컨트롤러 펌웨어를 구축하는 새로운 파이프라인을 제안합니다. 베어메탈 CPS 가상 머신인 Encore!를 통해 임베디드 환경에서도 검증된 코드를 실행할 수 있는 방법을 제시합니다.