Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
ICLR 2024에 채택된 RepoBench v1.1이 공개되어 저장소 수준의 코드 자동 완성 시스템을 위한 새로운 벤치마크를 제공합니다. 이 데이터셋은 Python과 Java용으로 제공되며, `cross_file` 및 `in_file` 등 다양한 의존성 마스킹 설정을 통해 모델 평가에 필요한 세밀한 환경을 구축했습니다.
Tencent Wukong Code Security Team이 개발한 AICGSecEval은 AI가 생성한 코드의 보안성을 프로젝트 수준에서 평가하는 벤치마크 프레임워크입니다. 실제 GitHub 프로젝트와 CVE 패치를 기반으로 정적 및 동적 분석을 결합한 하이브리드 평가 방식을 제공합니다.
CodeScope는 LLM의 코딩 능력을 측정하기 위한 실행 기반의 다국어·다중 작업·다차원 평가 벤치마크입니다. 43개의 프로그래밍 언어와 8개의 작업을 통해 코드 이해 및 생성 성능을 종합적으로 평가하며, ACL 2024 메인 컨퍼런스에 채택되었습니다.
1Password가 AI 에이전트의 보안 위협 대응 능력을 측정하는 새로운 벤치마크인 SCAM을 공개했습니다. 이 벤치마크는 워크플로 내에 내장된 피싱, 사회 공학 등 9가지 위협 시나리오를 통해 에이전트의 보안 관리 능력을 테스트합니다.
에이전트의 메모리 능력을 평가하기 위한 새로운 벤치마크인 MemoryAgentBench를 소개합니다. 정확한 검색, 테스트 시간 학습, 장기 이해, 갈등 해결 등 네 가지 핵심 역량을 중심으로 에이전트의 성능을 측정합니다.
AllenAI에서 발표한 Lumos는 통합된 데이터 형식과 모듈형 설계를 갖춘 오픈 소스 언어 에이전트 프레임워크입니다. Llama-2 기반의 계획, 접지, 실행 모듈을 통해 GPT-4와 대등하거나 더 큰 규모의 오픈 소스 에이전트를 능가하는 성능을 보여줍니다.
BigCodeBench는 LLM의 실질적인 프로그래밍 능력을 평가하기 위해 설계된 새로운 벤치마크입니다. HumanEval보다 복잡한 지시어와 다양한 함수 호출을 포함하며, 실제 소프트웨어 공학 작업에 가까운 환경을 제공합니다.
Moonshot AI가 소프트웨어 엔지니어링에 특화된 오픈소스 LLM인 Kimi-Dev-72B를 공개했습니다. 이 모델은 SWE-bench Verified에서 오픈소스 모델 중 최고 성능을 기록했으며, 대규모 강화학습을 통해 최적화되었습니다.
Andrej Karpathy의 makemore에서 영감을 받아 밑바닥부터 구현한 Sparse Mixture of Experts(MoE) 언어 모델 프로젝트입니다. Top-k 게이팅과 전문가 용량(Expert Capacity) 개념을 포함하며, PyTorch를 사용하여 아키텍처의 핵심 원리를 단계별로 학습할 수 있도록 설계되었습니다.
논문 'MoE-Mamba: Efficient Selective State Space Models with Mixture of Experts'의 PyTorch 및 Zeta 기반 구현체입니다. Switch Transformer의 SwitchMoE 아키텍처를 활용하여 효율적인 선택적 상태 공간 모델을 구현했습니다.
PinchBench는 LLM이 OpenClaw 에이전트로서 실제 환경에서 얼마나 잘 작동하는지 측정하는 실세계 벤치마크입니다. 합성 테스트 대신 도구 사용, 다단계 추론, 실질적인 결과 도출 등 코딩 에이전트에게 필수적인 역량을 평가합니다.
Quoroom은 자율 에이전트 집단(autonomous agent collectives)을 연구하는 오픈 소스 프로젝트로, 단일 에이전트를 넘어 군집 지능을 구현하는 것을 목표로 합니다. Queen(전략), Workers(실행), Quorum(의사결정) 구조를 통해 에이전트들이 스스로 기술을 배우고 의사결정을 내리는 자율적인 군집 시스템을 구축합니다.
AI-Research-SKILLs는 아이디어 구상부터 실험 실행, 논문 작성에 이르기까지 AI 연구의 전 과정을 자율적으로 수행할 수 있도록 지원하는 포괄적인 오픈 소스 기술 라이브러리입니다. 연구 오케스트레이션 계층과 다양한 엔지니어링 기술을 결합하여, 연구자가 인프라 디버깅 대신 과학적 발견에 집중할 수 있도록 돕는 것을 목표로 합니다.
ScienceBoard는 실제 과학적 워크플로우를 수행하는 멀티모달 자율 에이전트를 평가하기 위한 프레임워크이자 벤치마크입니다. OSWorld를 기반으로 VMware 환경에서 작동하며, ICLR 2026에 채택된 연구 성과를 바탕으로 다양한 모델의 에이전트 성능을 측정할 수 있는 환경을 제공합니다.
CARLA 시뮬레이터를 활용하여 심층 강화학습(PPO) 기반의 자율 주행 에이전트를 훈련하는 연구 프로젝트입니다. 커리큘럼 학습 방식을 도입하여 단계별로 난이도를 높이며 학습하며, 관련 연구는 ICIP 2021 컨퍼런스에 채택되었습니다.
UC Berkeley 연구진이 개발한 이 프로젝트는 웹 및 모바일 기기를 제어하는 디지털 에이전트의 성능을 평가하고 자율적으로 개선하는 프레임워크를 제공합니다. 평가 모델을 통해 에이전트의 궤적을 분석하며, DigiRL과 같은 모델을 활용해 Android 제어 성공률을 17%에서 67%까지 대폭 향상시키는 성과를 보였습니다.
이 저장소는 심층 강화학습(Deep RL)을 위한 다중 에이전트 커넥티드 자율 주행(MACAD) Gym 환경을 제공합니다. NeurIPS 2019의 자율 주행 머신러닝 워크숍에서 발표된 논문의 구현 코드로, CARLA 시뮬레이터를 기반으로 합니다.
SWE-bench Pro는 LLM 및 에이전트가 장기적인 소프트웨어 엔지니어링 과제를 수행할 수 있는지 평가하는 고난도 벤치마크입니다. 모델은 주어진 코드베이스와 이슈를 바탕으로 문제를 해결하는 패치를 생성해야 하며, 재현 가능한 평가를 위해 Docker 환경을 지원합니다.