Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM의 코드 생성 품질을 평가하기 위한 벤치마크 프레임워크인 DevQualityEval을 소개합니다. Claude 3.7 Sonnet, OpenAI o1 등 주요 모델의 코드 생성 성능을 비교 분석하며, 개발자가 모델의 실질적인 유용성을 검증할 수 있는 지표를 제공합니다.
NeurIPS 2024 Spotlight에 채택된 Flex-MoE는 데이터 누락 상황에서도 임의의 멀티모달 조합을 유연하게 처리할 수 있는 새로운 Mixture-of-Experts 프레임워크입니다. 누락된 양상을 처리하는 'missing modality bank'와 희소 MoE 구조를 통해 데이터 결손에 대한 강건성을 확보했습니다.

Med-MoE는 의료용 멀티모달 작업을 위해 설계된 경량화된 Mixture-of-Experts 프레임워크입니다. 도메인 특화 전문가를 활용하여 파라미터 수를 30-50% 줄이면서도 최첨단 성능을 유지합니다.
Llama 모델의 컨텍스트 길이를 확장하기 위한 다양한 RoPE 인코딩 스킴과 실험 결과를 공유합니다. 선형 스케일링, 푸리에 기저 수정, xPos 방식 등을 적용하여 최대 16k 이상의 컨텍스트 길이를 확보하는 연구를 수행했습니다.
Mixtral-8x7B MoE 모델의 중국어 대화 능력을 향상시키기 위해 Aurora 모델을 구축했습니다. 세 가지 중국어 지시 이행 데이터셋을 활용한 미세 조정을 통해 제로샷 성능을 강화했으며, 벤치마크 테스트를 통해 그 효과를 검증했습니다.
AI가 생성한 코드의 보안 감사를 자동화하기 위해 이벤트 소싱 기반의 ESAA-Security 아키텍처를 제안합니다. 결정론적 파이프라인과 플레이북을 통해 에이전트의 환각 현상을 방지하고 검증 가능한 감사 추적을 제공합니다.
MSR 2026 Mining Challenge를 위해 공개된 이 저장소는 자율 코딩 에이전트가 소프트웨어 공학(SE 3.0)을 어떻게 변화시키고 있는지 연구한 논문의 재현 패키지입니다. AIDev 데이터셋을 통해 OpenAI Codex, Devin, GitHub Copilot, Cursor, Claude Code 등 주요 코딩 에이전트의 활동 데이터를 분석하고 제공합니다.
이 포스트는 Function Calling, 도구 사용, 추론, 코딩, 컴퓨터 상호작용 등 네 가지 주요 카테고리로 분류된 50개 이상의 최신 AI 에이전트 벤치마크를 정리한 컴펜디움입니다. BFCL, APIBank 등 다양한 실제 시나리오를 기반으로 LLM의 에이전트적 능력을 평가하는 벤치마크들의 상세 정보와 링크를 제공합니다.
ResearchClawBench는 AI 에이전트가 로우 데이터 분석부터 보고서 작성까지 독립적인 과학적 연구를 수행할 수 있는지 측정하는 새로운 벤치마크입니다. 실제 출판된 논문을 바탕으로 40개의 과학적 과제를 제공하며, 에이전트의 결과물을 인간의 연구 결과와 비교하여 엄격하게 평가합니다.