Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
멀티 에이전트 LLM 시스템의 디버깅 비용을 줄이기 위해 지식 그래프를 활용한 '제로-리플레이' 예측 방식을 제안합니다. 리플레이를 직접 수행하지 않고도 어떤 이벤트가 시스템에 큰 영향을 미치는지 예측하여 디버깅 효율성을 극대화합니다.
스프레드시트 방식의 한계를 극복하기 위해 Python의 pandas를 활용한 재현 가능한 데이터 분석 워크플로를 제안합니다. Excel과 pandas를 상호 보완적인 도구로 정의하며, 데이터의 검증, 버전 관리 및 자동화를 위한 체계적인 가이드를 제공합니다.
코드 LLM의 아키텍처 추론 능력을 높이기 위해 에이전트적 판단(Agentic Judgment) 파이프라인을 제안합니다. ACJ와 AQJ라는 두 가지 판단기를 통해 아키텍처 복잡도와 품질을 평가하며, 이를 통해 미세 조정된 Qwen 모델이 SWE-bench Verified에서 높은 성능 향상을 보였습니다.
소프트웨어 개발에서 의도와 제약 조건을 명확히 전달하는 사양(Specifications)의 중요성을 다룹니다. 특히 에이전트형 AI 시스템의 보안과 코딩 과제를 해결하기 위해 설계된 Bosque API(BAPI) 생태계를 소개합니다.
LLM을 활용한 프로그램 버그 분석 시 발생하는 근거의 불확실성을 해결하기 위해, LLM의 추론과 형식 분석을 분리한 시스템 'Evident'를 제안합니다. Evident는 LLM이 분석 하네스를 구축하면 백엔드 분석기가 도달 가능성을 검증하는 방식으로 작동하여 오탐을 효과적으로 제거합니다.
생성형 AI를 활용하여 요구사항 정의부터 유지보수까지 소프트웨어 개발 전 과정에 AI를 통합하는 실용적인 조직 프레임워크를 제안합니다. 단순 코드 완성을 넘어 에이전트 기반의 통제된 개발 프로세스로 전환하기 위한 기술적, 조직적 메커니즘을 다룹니다.
에이전트 AI 개발자들이 자율성과 도구 사용 등 에이전트 특성에서 발생하는 리스크를 어떻게 인식하고 관리하는지 분석한 연구입니다. 개발자들은 사회적 리스크보다 제품 및 비즈니스 리스크를 우선시하며, 역량과 리스크 제어 사이의 긴장 관계를 겪고 있습니다.
Assurance Case에 정량적 신뢰도 평가를 적용할 때 발생하는 의사결정 복잡도와 노력의 확장성을 분석하는 모델을 제안합니다. BBN, DST, Certus 등 기존 방법론을 비교하여 논거 크기에 따른 효율성을 검증했습니다.
SDVDiag는 소프트웨어 정의 차량(SDV)의 장애 원인을 분석하기 위한 멀티모달 인과 관계 발견 파이프라인을 제안합니다. 로그와 메트릭 데이터를 공유 임베딩 공간으로 융합하여 온라인 환경에서 실시간으로 근본 원인을 추적합니다.
Snyk VulnBench JS 1.0을 통해 에이전트형 LLM의 보안 취약점 탐지 반복 가능성을 실험했습니다. 연구 결과, LLM의 추가 탐지 결과는 불균일한 반면, Claude와 같은 모델이 기존 SAST 도구와 일치하는 결과는 높은 안정성을 보였습니다.
본 연구는 Octagons 추상 도메인에서 가짜 제약 조건을 제거하기 위한 새로운 알고리즘을 제안합니다. 6,930개의 불변량을 비교 분석하여 Octagons의 표현력이 불변량 정밀도에 미치는 영향을 평가하고, 최소 비교를 통해 도메인 간의 관계를 재정립했습니다.
프런티어 코딩 에이전트가 다양한 프로그래밍 언어에서 체스 엔진을 생성할 수 있는지 연구한 사례입니다. 에이전트는 17개 언어에서 작동 가능한 엔진을 생성하며 다국어 능력을 입증했으나, 언어의 특성에 따라 성능과 비용, 구현 방식에 차이가 있음을 확인했습니다.
스프레드시트 환경에서 사용자의 다음 동작을 예측하기 위한 새로운 벤치마크와 프레임워크를 제안합니다. LLM 정제 기술을 통해 12K개의 동작 시퀀스를 구축하고, 온라인 평가 방식을 통해 다양한 예측 모델의 성능을 분석합니다.
수동 테스트 케이스의 품질 저하를 유발하는 '테스트 스멜'을 탐지하기 위해 Gemini 3 Pro Preview의 성능을 실증적으로 연구했습니다. 기존 소형 언어 모델(SLM)보다 뛰어난 탐지 성능과 실행 가능한 설명을 제공함을 확인했습니다.
양자 회로의 오류 메커니즘을 표현하는 검출기 오류 모델(DEM)을 위한 등식 이론과 범주론적 의미론을 제안합니다. DEM 항에 대한 효율적인 재작성 시스템을 통해 준선형 시간 내에 구조적 동치성을 결정할 수 있는 정적 결정 절차를 제공합니다.
자동 인슐린 주입 시스템(AID)의 소프트웨어 업데이트 시 발생할 수 있는 위험을 방지하기 위한 안전성 평가 프레임워크를 제안합니다. 버그 분류와 임상적 동등성 평가를 결합하여 알고리즘 수정이 환자의 혈당 조절에 미치는 영향을 체계적으로 검증합니다.
LLM이 생성한 코드 내 환각 패키지 임포트를 탐지하기 위해 베이지안 보정 레이어를 적용한 slopsquat 탐지기를 제안합니다. PyPI 메타데이터를 활용하여 기존 이진 탐지기가 놓치는 의심스러운 패키지를 식별하고, 위험 인식 프리미티브를 통해 CI 게이트에서 활용 가능한 확률적 탐지 성능을 제공합니다.
LLM 기반 코딩 에이전트가 코드 저장소의 시각적 구조를 활용할 때의 효용성을 연구한 논문입니다. 텍스트와 시각적 그래프를 결합한 하이브리드 방식이 토큰 비용을 줄이면서도 이슈 해결 정확도를 유지하거나 향상시킴을 입증했습니다.
코딩 에이전트의 저장소 탐색 효율을 높이기 위해 탐색 전용 서브 에이전트인 FastContext를 제안합니다. 특화된 탐색 모델을 통해 토큰 소비를 최대 60% 절감하고 해결률을 향상시켰습니다.
LLM을 활용하여 학생들의 Java 프로그래밍 오류를 시뮬레이션하는 연구를 소개합니다. 다양한 프롬프팅 전략을 통해 생성된 합성 오류가 실제 학생의 실수와 기능적으로 구별되지 않음을 입증했습니다.