Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

8GB VRAM 환경에서 Ternary-Bonsai-27B(2-bit) 모델의 성능을 Terminal-Bench 2.0을 통해 테스트한 결과입니다. 2-bit 양자화 모델은 GPU 메모리 효율은 높으나, 기존 Qwen 모델 대비 정확도가 낮고 1-bit 모델은 에이전트 루프에서 불안정한 모습을 보였습니다.
Qwen3.6-35B와 Kimi-K3 2.8T 모델의 코딩 및 물리 시뮬레이션 벤치마크 결과를 비교 분석합니다. 에이전트 구조와 미세 조정을 통해 소규모 모델이 대규모 인프라 모델과 경쟁할 수 있는 가능성을 제시합니다.

Loopie는 20B 파라미터(2B 활성)를 가진 루프형 Transformer 모델입니다. 외부 도구 없이도 2025 IMO 및 IPhO에서 금메달 수준의 성적을 달성하며 강력한 성능을 입증했습니다.

Cura 1T는 인간의 검증을 포함한 재귀적 자기 개선 루프를 통해 모델을 고도화합니다. 이를 통해 6개의 주요 의료 벤치마크 중 5개에서 기존 프런티어 모델들을 능가하는 성능을 보여주었습니다.
인간이 생성한 멀티모달 리소스를 활용하여 실행 가능한 에이전트 기술을 증류하는 RESOURCE2SKILL 방법론을 소개합니다. 멀티모달 데이터를 통해 에이전트의 능력을 효율적으로 학습시키는 연구를 다룹니다.

AI 에이전트의 장기 작업 수행 능력을 평가하기 위한 새로운 벤치마크가 소개되었습니다. 터미널 환경에서 수백 단계의 복잡한 작업을 수행하며, 숨겨진 검증기를 통해 에이전트의 성과와 정직성을 측정합니다.

Soprano는 1GB 미만의 메모리만 사용하여 CPU에서 20배, GPU에서 2000배 빠른 실시간 생성이 가능한 초경량 온디바이스 TTS 모델입니다.

AI 결과물의 신뢰성을 확보하기 위해 모델명 외에도 가중치, 프롬프트, 데이터셋 등의 연결성을 추적하는 Machine Genome 프로젝트를 소개합니다. 이 OSS는 블록체인 없이도 데이터의 계보(lineage)를 그래프 형태로 관리하여 검증 가능한 단위로 기록합니다.
OpenAI의 실시간 음성 모델 GPT-Live 출시, Microsoft의 자체 MAI 모델 도입을 통한 AI 스택 수직 계열화, 그리고 Anthropic의 Claude 내부 작업 공간(J-space) 발견에 관한 소식을 다룹니다.
모국어 복원 프로그램을 위해 실시간 정책 제약 조건 하에서 작동하는 설명 가능한 인과 강화학습(ECRL) 프레임워크를 제안합니다. 인과적 희소성, 실시간 적응성, 설명 가능성을 핵심 요소로 하여 사회적 가치를 위한 AI 적용 방안을 다룹니다.
샤오미가 10만 시간 이상의 실제 조작 데이터를 학습한 로봇 모델을 Hugging Face에 공개했습니다. 데이터와 모델 규모를 키울수록 성능이 향상되는 스케일링 법칙을 입증하며 RoboCasa365 벤치마크에서 최고 기록을 경신했습니다.
홍콩의 3개 명문 대학교(HKU, CUHK, CityU)가 공동으로 구축한 오픈 학술 도서 플랫폼을 소개합니다. 역사, 철학, 법률 등 다양한 분야의 학술 자료를 별도 등록 없이 무료로 이용할 수 있습니다.
Alaya World가 오픈소스로 공개되며, 생성 모델의 장기적 안정성을 위한 'Error Bank' 메커니즘을 선보였습니다. 이는 오류를 제거하는 대신 오류를 학습 데이터로 재사용하여 모델이 스스로 복구할 수 있게 만드는 혁신적인 접근 방식입니다.
Anthropic의 Claude 모델이 87년 동안 미해결 상태였던 수학적 난제인 '자코비 추측(Jacobian Conjecture)'에 대한 반례를 독립적으로 찾아냈습니다. 이는 AI가 단순 계산 보조를 넘어 수학적 발견자(discoverer)로서 역할을 수행할 수 있음을 보여주는 기념비적인 사례입니다.

SWE-bench, Terminal-Bench, SWE-Atlas 등 주요 코딩 에이전트 벤치마크의 차이점과 특성을 분석합니다. 각 벤치마크가 측정하는 작업 범위와 환경, 성공 신호가 다르므로 목적에 맞는 선택이 중요함을 강조합니다.

리플레이 버퍼 없이 동적 작업 유사도 라우팅을 통해 파괴적 망각을 방지하는 지속 학습(Continual Learning) 프레임워크 Coincidex를 소개합니다. 문맥 기반의 유사도 계층을 활용하여 메모리 오버헤드를 줄이는 새로운 아키텍처적 접근법과 그 한계를 다룹니다.
벤치마크 오염(Benchmark Contamination)이 모델의 실제 능력을 어떻게 왜곡하는지 분석합니다. 훈련 데이터에 포함된 테스트 문제로 인해 발생하는 '회상(Recall)' 현상이 리더보드 점수를 부풀리는 문제를 지적하며, 이를 해결하기 위한 '신선함의 공리'를 제시합니다.

Alibaba가 25,000개의 가짜 계정을 통해 Claude에 2,880만 건의 요청을 보내 모델 능력을 복제하려 했다는 Anthropic의 폭로를 다룹니다. 모델 추출(Model Distillation)의 개념과 이를 둘러싼 기술적·윤리적 논쟁을 분석합니다.
OpenAI의 실시간 음성 모델 GPT-Live 발표, Microsoft의 자체 AI 모델 전환, Anthropic의 Claude 내부 작업 공간(J-space) 발견, 그리고 Hugging Face의 AI 에이전트 보안 사고 등 주요 AI 기술 동향을 다룹니다.
Moonshot AI가 2.8조 파라미터 규모의 신형 멀티모달 모델 'Kimi K3'를 발표했습니다. 자사 발표와 독립 지표 간의 성능 차이가 존재하며, 모델 가중치(weights) 공개 일정과 시장의 주가 변동성 등 다양한 쟁점이 논의되고 있습니다.