Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Bittensor 서브넷의 HaloGuard 1.0이 오픈 웨이트 AI 안전성 분야에서 SOTA를 달성했습니다. Qwen3.5 기반의 이 모델은 7개의 벤치마크에서 대규모 모델들을 능가하며 뛰어난 프롬프트 안전성 탐지 성능을 입증했습니다.

Fable-5가 전문 프리랜서의 원격 근무 프로젝트를 평가하는 Remote Labor Index(RLI)에서 16.10%를 기록하며 공개 리더보드 1위에 올랐습니다. 이는 복잡한 실무 과제를 수행하는 AI의 성능이 기하급수적으로 발전하고 있음을 보여줍니다.
지식 노동 중심의 기존 AI 평가 체계에서 벗어나, 전기 기사나 정비사 등 블루칼라 직종의 숙련도를 측정하기 위한 멀티모달 벤치마크 구축 소식을 다룹니다.

LLM이 통신 집약적인 실제 워크로드를 위한 빠른 CUDA 커널을 작성할 수 있는지 평가하는 오픈 소스 벤치마크인 ParallelKernelBench를 소개합니다. Together AI의 Frontier Performance 팀이 개발한 이 벤치마크는 코딩 모델의 성능을 측정하는 중요한 지표가 됩니다.

Gemini API와 AI Studio에 새로운 생성형 미디어 모델인 Nano Banana 2 Lite와 Gemini Omni Flash가 출시되었습니다. Nano Banana 2 Lite는 빠른 속도와 저렴한 비용을, Omni Flash는 비디오 편집 분야에서 최첨단 성능을 제공합니다.
에이전트가 복잡한 생물학적 데이터를 탐색하고 분석 경로를 결정하는 능력을 측정하기 위한 연구용 벤치마크인 GeneBench-Pro를 소개합니다. 실제 계산 연구에 필요한 판단력을 평가하는 데 중점을 둡니다.
Anthropic의 Claude Sonnet 5를 Box AI Complex Work Eval 벤치마크로 테스트한 결과, 복잡한 기업 문서 작업에서 Sonnet 4.6을 상회하는 성능을 보였습니다. 특히 금융 실사, 비용 분석, 매출 분석 등 다단계 추론이 필요한 도메인에서 뛰어난 정확도를 입증했습니다.

중국 Meituan이 1.6조 파라미터 규모의 AI 모델인 LongCat 2.0을 출시했습니다. 이 모델은 NVIDIA 칩 대신 중국 국산 칩 5만 개를 사용하여 학습되었으며, 주요 글로벌 모델들과 경쟁할 만한 성능을 보여줍니다.

생체 모방형 아키텍처인 Neuraxon 2.0이 ARC-AGI 3 벤치마크에서 유망한 성적을 거두었습니다. LLM이나 VLM을 사용하지 않고 오직 자체 아키텍처와 CPU만을 활용하여 기존 프런티어 모델들을 상회하는 효율성을 보여주었습니다.
LegalCiteBench는 법률 AI의 정확한 인용 능력을 평가하기 위해 ICML 2026에 채택된 새로운 벤치마크입니다. 테스트 결과 대부분의 모델이 인용 검색에서 매우 낮은 점수를 기록하며 높은 오답 유도율을 보였습니다.

Elon Musk가 Grok 4.5의 프라이빗 베타 시작을 발표했습니다. 1.5조 개의 파라미터를 가진 V9 모델을 기반으로 하며, Anthropic의 Claude Opus와 대등하거나 능가하는 성능을 목표로 합니다.
중국 Z. AI가 OpenAI와 Anthropic의 폐쇄형 모델에 필적하는 오픈 소스 모델 GLM 5.2를 출시했습니다. 이 모델은 지식 증류(distillation) 기술을 통해 높은 성능을 확보했으며, 자체 강화학습이 가능한 수준에 도달하여 기술 격차를 빠르게 좁히고 있습니다.
AI가 자율적으로 수행할 수 있는 소프트웨어 엔지니어링 작업의 범위를 측정하기 위해 MirrorCode 벤치마크를 구축했습니다. 이 벤치마크는 AI가 며칠 동안 장기적으로 코딩할 수 있는 능력을 평가하며, 최상위 모델들은 인간 엔지니어가 몇 주간 걸릴 작업을 완료하는 성과를 보였습니다.
Trishool AI가 Anthropic의 Constitutional AI 방식을 제품화하며, Alibaba Qwen의 가드 모델보다 훨씬 작은 0.8B 규모의 SOTA급 가드 모델을 개발 중임을 밝혔습니다. Bittensor 채굴자들의 탈옥 시도를 통해 모델의 견고함을 강화하는 연구를 진행하고 있습니다.
AI 모델의 성능, 안전성, 일반화 능력을 측정하기 위해 주목해야 할 주요 연구소와 빌더들을 소개합니다. 프런티어 모델의 위험성 테스트부터 에이전트의 보안 및 엔터프라이즈 환경을 위한 평가 도구까지 다양한 사례를 다룹니다.
OpenAI의 새로운 모델인 GPT-5.5-Cyber가 소프트웨어 취약점 재현 능력을 평가하는 CyberGym 벤치마크에서 Mythos 5를 능가하는 성적을 거두었습니다.
Oxford와 Cambridge 연구진이 외계 행성의 대기 데이터를 분석하여 생명체 존재 가능성을 탐색하기 위한 새로운 벤치마크 데이터셋인 ThousandWorlds를 공개했습니다. 이 데이터셋은 다양한 기후 모델과 시뮬레이션을 포함하여 외계 행성의 대기 변수를 에뮬레이션합니다.
AI 모델의 소셜 미디어 바이럴 능력을 측정하는 최초의 벤치마크인 ViralBench를 소개합니다. GPT, Opus, Kimi 등의 모델이 인간의 개입 없이 TikTok 콘텐츠를 생성하고 조회수를 확보하는 과정을 실험합니다.

Sakana 논문을 통해 복잡한 업무 수행을 위한 모델 오케스트레이션의 필요성을 분석합니다. 단일 모델 사용 대신 에이전트 호출, 검증, 경로 최적화를 수행하는 API 방식의 효율성과 벤치마크 성능을 다룹니다.
GLM 5.2는 기존 오픈 모델들과 달리 Anthropic의 Opus 4.6과 대등한 성능을 보여주는 혁신적인 공개 오픈 모델입니다. 높은 하드웨어 비용이 수반되지만, 기업들에게 기존 폐쇄형 모델을 대체할 수 있는 강력한 파괴적 혁신을 제공합니다.