Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
사용자의 불충분한 의도와 다회차 피드백 과정을 반영한 새로운 코드 에이전트 벤치마크인 Asuka-Bench를 소개합니다. 브라우저 렌더링 기반의 폐쇄 루프 시스템을 통해 에이전트의 정교화 능력을 평가하며, 기존 모델 간의 성능 차이를 명확히 드러냅니다.
머신러닝 모델의 예측 성능이 비슷하더라도 설명 방식이 달라지는 Rashomon 효과 문제를 다룹니다. 변형 테스트(Metamorphic testing)를 활용하여 정답 레이블 없이도 사후 설명의 충실도를 평가하는 새로운 프레임워크를 제안합니다.
TLA-Prover는 분산 시스템 검증을 위한 TLA+ 명세 합성을 위해 개발된 200억 파라미터 규모의 모델입니다. SFT와 GRPO를 결합하여 모델이 스스로 오류를 수정하도록 학습하며, TLC 모델 체커를 직접 보상 신호로 활용합니다.
LLM 에이전트의 실패 원인을 진단하고 하네스(harness)를 자동으로 수리하는 프레임워크인 HarnessFix를 제안합니다. 실행 추적을 정규화하여 결함의 원인을 특정 계층으로 귀속시키고, 이를 바탕으로 정밀한 패치를 생성하여 에이전트 성능을 크게 향상시킵니다.
에이전트형 AI가 크라우드소싱 테스트 환경에서 단순한 평가자를 넘어 테스터의 보고 품질을 개선하는 피드백 제공자로서 기능할 수 있음을 실증적으로 연구했습니다. 피험자 연구 결과, 에이전트의 피드백은 보고서 수정과 작업 수행 능력 향상에 기여함을 확인했습니다.
LLM이 생성한 코드의 가독성을 높이기 위해 멀티태스크 표현 공학(Multitask RepE) 프레임워크를 제안하는 연구입니다. 기존의 정확성 중심 연구에서 벗어나, 가독성과 정확성 사이의 트레이드오프를 이론적으로 분석하고 실험적으로 검증합니다.
소프트웨어 모델링 교육에서 문제 도메인의 다양성과 문화적 관점이 학생의 동기 부여 및 포용성에 미치는 영향을 연구했습니다. 설문 결과, 학생들은 사회적 관련성이 높은 도메인을 선호하는 반면 교육자는 학습 관련 도메인을 선호하는 인식 차이를 보였습니다.
다양한 하드웨어 아키텍처(x86_64, Sunway, Kunpeng)에서 LLM의 고성능 컴퓨팅(HPC) 코드 생성 능력을 평가하는 CodegenBench를 소개합니다. 연구 결과, LLM은 범용 아키텍처에는 강하지만 문서가 부족한 특화 아키텍처에서는 성능이 크게 저하됨을 확인했습니다.
오픈 가중치 LLM의 도메인별 안전 준수율과 투명성 격차를 분석한 연구입니다. 실험 결과, 모델의 안전 행동이 도메인 맥락에 따라 극도로 불균형하며, 기술적 프레이밍을 통한 우회 가능성이 확인되었습니다.
마이크로서비스 아키텍처(MSA)의 저하를 탐지하기 위해 시계열 커뮤니티 탐지 기법을 활용한 연구입니다. train-ticket 벤치마크를 통해 서비스 의존성 네트워크의 진화를 분석하고, 부적절한 서비스 분할 및 안티 패턴을 식별하는 방법을 제안합니다.
기업용 AI 에이전트 배포 전 검증을 위해 온톨로지 기반의 시뮬레이션 및 신뢰 인증 프레임워크를 제안합니다. 규제, 도메인 제약, 안전 속성을 포함한 시나리오 생성 파이프라인을 통해 에이전트의 운영 범위를 공식화하고 검증합니다.
이기종 에이전트 시스템에서 일관된 거버넌스를 유지하기 위한 '증명 기반 에이전트 동작(PCAA)' 모델을 제안합니다. 런타임에 종속되지 않는 동작 인증서를 통해 에이전트의 승인 및 실행 과정을 표준화하고 검증하는 체계를 다룹니다.
LLM이 코드를 생성할 때 작업 명세 외의 미세한 문맥적 단서가 알고리즘 선택에 큰 영향을 미친다는 연구 결과입니다. 실험을 통해 특정 단서가 알고리즘 분포를 체계적으로 변화시킴을 확인했으며, 이를 완화하기 위해 직접적인 알고리즘 명명 방식을 제안합니다.
산불 탐지용 DNN 시스템의 신뢰성을 높이기 위한 veriFIRE 프로젝트의 연구를 소개합니다. 항공 플랫폼의 일관성 속성을 검증하기 위해 애플리케이션 요구사항을 신경망 검증기용 쿼리로 인코딩하는 방법론을 제시합니다.
심층 신경망(DNN)의 취약점을 식별하기 위해 잠재 공간을 활용하는 블랙박스 테스트 프레임워크 'Latte'를 제안합니다. VQ-VAE를 통해 의미론적 유사성을 유지하면서도 결함 노출과 다양성을 극대화하는 테스트 케이스 생성이 가능합니다.
심층 신경망의 파라미터를 직접 조작하는 다양한 공격에 대응하기 위한 일반화된 방어 체계인 ParDef를 제안합니다. ParDef는 키 기반 재매개변수화, QC-LDPC 양자화, 적응형 강건 추론을 통합하여 모델 성능 저하를 최소화하면서 공격 성공률을 낮춥니다.
신경망의 신뢰성을 평가하기 위해 베이지안 최적화와 살리언시 기법을 결합한 새로운 테스트 프레임워크 BayesWarp를 제안합니다. 이 방식은 데이터의 의미론적 근접성을 유지하면서도 효율적으로 모델의 실패 사례를 찾아내어 테스트 효과를 높입니다.
본 논문은 프로세스 마이닝 결과물을 URN 기반의 유스케이스 맵(UCM)으로 변환하는 PM4Py-UCM 라이브러리를 제안합니다. 이를 통해 마이닝된 프로세스를 요구사항 공학(RE) 활동에 직접 활용할 수 있는 파이프라인과 계층적 분해 전략을 제시합니다.
LLM 챗봇이 의료, 금융 등 특정 조직의 복합적인 정책을 준수하는지 평가하는 연구를 소개합니다. 기존 벤치마크가 놓치고 있는 복합 정책 위반 문제를 해결하기 위해 자동화 도구인 COPAL을 제안합니다.
본 연구는 양자 내성 암호(PQC)를 소프트웨어 시스템에 통합할 때 발생하는 기술적, 인간적, 조직적 과제를 분석한 SoK 논문입니다. 기존의 기술 중심 연구에서 벗어나 HOT(Human, Organisation, Technology) 프레임워크를 통해 사회 기술적 관점의 통합적 접근을 제안합니다.