Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Sakura는 자연어 설명을 기반으로 복잡한 테스트 케이스를 생성하는 최초의 에이전트 기반 프레임워크입니다. 멀티 에이전트 시스템을 통해 정적 분석과 코드 합성을 수행하며, 기존 도구 대비 높은 컴파일 가능성과 테스트 커버리지를 달성했습니다.
개별적으로는 안전한 LLM 에이전트 기술들이 조합될 때 발생하는 '조합적 위험'을 측정하는 SkillReact 프레임워크를 제안합니다. 연구 결과, 기술별 스캐닝으로는 탐지할 수 없는 약 14,000개의 실제 위험 사례가 존재함을 확인했습니다.
실제 Python 저장소의 속성 기반 테스트(PBT)를 Lean 4 명세로 자동 번역하여 AI 모델과 에이전트의 형식 소프트웨어 검증 능력을 평가하는 FVSpec 벤치마크를 제안합니다. 3-에이전트 LLM 파이프라인을 통해 복잡한 논리적 속성을 번역하고 증명 생성을 위한 베이스라인을 제공합니다.
본 연구는 프로그래밍 작업에서 LLM의 정확도와 반복 실행 시의 안정성 사이의 관계를 분석합니다. 단일 실행 정확도가 실제 배포 환경에서 요구되는 재시도 없는 커버리지를 과장할 수 있음을 지적하며, 새로운 평가 프로토콜을 제안합니다.
다중 이해관계자 플랫폼(MSP)에서 발생하는 이해관계 간 갈등을 해결하기 위해 거버넌스 원칙과 소프트웨어 아키텍처 결정을 연결하는 새로운 프레임워크를 제안합니다. 암묵적인 거버넌스 결정을 명시적인 설계 선택지로 변환하여 배포 전 논의 가능하게 만드는 것이 핵심입니다.
검증 가능한 보상을 활용한 강화학습(RLVR)을 통해 소규모 언어 모델의 코드 생성 성능을 개선하는 연구입니다. Qwen3-0.6B와 Llama3.2-1B 모델을 대상으로 MBPP 벤치마크에서 실험을 진행하여 보상 설계의 중요성을 입증했습니다.
60개 프로그래밍 언어를 대상으로 LLM의 간결한 코드 생성 능력을 평가하는 CodeGolf Bench를 소개합니다. 기존 벤치마크와 달리 실시간 인간 성능 기준선을 제공하며, 추론 모델이 비추론 모델보다 코드 효율성 최적화에서 우수한 성능을 보임을 입증했습니다.
애자일 소프트웨어 개발 팀 내 신경다양성(Neurodiversity) 포용을 방해하는 조직적 장벽을 탐구한 연구입니다. 웹 콘텐츠 분석과 전문가 인터뷰를 통해 경직된 애자일 관행과 일률적인 접근 방식이 신경다양인 개발자의 참여를 저해함을 밝혀냈습니다.
에이전트 기반 소프트웨어 역공학 시스템을 대상으로 하는 프롬프트 주입 공격의 취약성을 분석한 연구입니다. 디컴파일러 출력물 내 공격 문자열 탐지 전략과 공격 난독화 및 이에 대한 방어 방법을 제안합니다.
STPA 위험 분석 과정에서 발생하는 수동 작업의 한계를 극복하기 위해 제안된 FASR 도구에 관한 연구입니다. 모델 기반 공학 및 형식 기법을 활용하여 불안전한 제어 동작(UCAs)을 자동으로 식별하는 방안을 제시합니다.
본 논문은 강화학습(RLVR)과 검증기 유도 추론을 통해 LLM의 형식 검증 자동화 성능을 개선하는 방법을 연구합니다. Dafny와 Lean을 활용하여 검증 가능한 보상과 구조화된 탐색 스캐폴드를 제안하며, 실험을 통해 검증 통과율을 유의미하게 향상시켰습니다.
자율 코딩 에이전트의 운영 안전성 실패 특성을 분석한 실증적 연구입니다. 6만여 편의 논문과 547개의 실제 GitHub 이슈를 분석하여, 기존 벤치마크가 놓치고 있는 33가지 리스크 유형과 분류 체계를 제시합니다.
전력 시스템 코드 생성 시 발생하는 API 지식 경계 오류를 해결하기 위한 연구를 소개합니다. PowerCodeBench 벤치마크와 경계 인식 개입 기술을 통해 오픈 웨이트 모델의 정확도를 대폭 향상시켰습니다.
CodeBERT와 CNN을 결합하여 코드 내 자격 증명 유출을 탐지하는 3클래스 분류 프레임워크를 제안합니다. 플레이스홀더와 실제 비밀 정보를 구분함으로써 기존 도구의 높은 오탐률 문제를 해결하고 보안 탐지 성능을 크게 향상시켰습니다.
최신 LLM인 GPT-5.5와 Llama-3.3-70B-Instruct가 생성하는 Java 보안 API(JCA, JSSE)의 오용 문제를 재현하고 분석한 연구입니다. 외부 보안 지식을 활용한 개선 효과를 실험하였으며, 모델의 성능과 지식 유형에 따라 보안 코드 생성 능력이 달라짐을 확인했습니다.
산업 자동화 분야의 PLC 공급업체 간 래더 로직 번역 문제를 해결하기 위한 수학적 정식화와 LLM 기반 파이프라인을 제안합니다. Rockwell에서 Siemens로의 자동 번역을 위해 XML 추출, 구조적 정규화, 제약 조건 기반 생성 함수를 포함한 아키텍처를 설계했습니다.
LLM이 통합된 소프트웨어 시스템에서 발생하는 'LLM-in-the-loop' 취약점을 분석하기 위해 최초의 데이터셋인 LLMCVE를 제안합니다. 연구 결과, LLM은 취약점의 근본 원인보다는 타겟이나 전파 벡터로 작용하는 경우가 많으며, 기존 에이전트 기반 수정 도구들이 이러한 취약점을 해결하는 데 한계가 있음을 입증했습니다.
코딩 에이전트가 시맨틱 계약을 위반하면서도 표면적 검사만 통과하는 문제를 지적하며, 새로운 벤치마크인 T2J-Bench를 제안합니다. 이 벤치마크는 인터페이스, 수치적 정확성, 행동적 역학을 통해 코드베이스 변환의 실질적 동등성을 엄격히 검증합니다.
LLM 기반 스마트 컨트랙트 디컴파일 성능을 평가하기 위한 새로운 벤치마크인 SCDBench를 소개합니다. 600개의 실제 Solidity 컨트랙트를 활용하여 형식 완결성부터 의미론적 일관성까지 4단계의 엄격한 평가 체계를 제공합니다.
기존 소프트웨어 제품 라인(SPL) 엔지니어링의 기술 종속성 문제를 해결하기 위해 워크벤치에 구애받지 않는 새로운 프로토콜을 제안합니다. '원자' 단위의 상향식 접근 방식을 통해 다양한 개발 환경에서도 기능 모델 추출과 제품 구성이 가능함을 입증했습니다.