Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
터미널 에이전트의 성능 향상을 위한 새로운 오픈 RL 레시피인 Tmax를 소개합니다. 9B 파라미터 모델로 Terminal-Bench 2.0에서 높은 성능을 달성했으며, 데이터 생성 기법과 대규모 데이터셋을 함께 공개합니다.
Hugging Face에서 주목받는 최신 AI 논문 10선을 소개하며, AI가 단순 답변을 넘어 행동하는 시스템으로 진화하는 트렌드를 분석합니다. 도구 사용 에이전트의 장기 계획 능력과 멀티모달 데이터 구조화 기술 등 핵심 연구를 다룹니다.
일본 Fugu 모델은 0.6B의 작은 파라미터로도 멀티 에이전트 오케스트레이션을 통해 GPT를 능가하는 성능을 보여줍니다. 이는 모델의 크기 경쟁에서 벗어나 효율적인 협업 메커니즘이 새로운 돌파구가 될 수 있음을 시사합니다.

GPT와 같은 언어 모델이 어텐션 메커니즘을 통해 단어 간의 관계를 어떻게 수치적으로 파악하는지 설명합니다. 무작위 임베딩에서 시작하여 행렬 곱셈과 인과적 마스킹을 거쳐 문맥을 형성하는 과정을 구체적인 수치 예시로 분석합니다.

LLM 에이전트의 장기 계획 수립 능력을 평가하기 위한 새로운 벤치마크인 PlanBench-XL을 소개합니다. 도구의 실패나 정보 오류 등 복잡한 상황에서의 에이전트 성능을 측정하며, GPT-5.4 모델의 성능 변화를 분석합니다.

실제 업무 세션 데이터를 기반으로 기업용 코딩 에이전트의 성능을 평가하는 EnterpriseClawBench 벤치마크를 소개합니다. 결과물 전달, 비용, 실행 시간, 기술 전이 측면에서 모델 시스템을 종합적으로 평가합니다.
Google과 Hugging Face가 Gemma 4 E4B의 추론 속도 최적화를 위한 Fast Gemma Challenge를 출시했습니다. 수십 개의 자율 에이전트가 vLLM, 양자화 등 다양한 기술을 활용해 실시간으로 경쟁하며 연구를 진행합니다.
에이전트 시대의 핵심 아키텍처를 정의하는 10편의 주요 arXiv 논문을 소개합니다. ReAct의 추론-행동 루프와 CAMEL의 멀티 에이전트 협업 구조를 중심으로, 단순 챗봇을 넘어 확장 가능한 자율 에이전트 시스템을 구축하기 위한 이론적 토대를 다룹니다.
Z.ai의 GLM-5.2 출시로 오픈 웨이트 모델이 프론티어 코딩 성능을 입증했으며, Anthropic의 Fable 중단 사태를 통해 모델 의존성 리스크가 부각되었습니다. 또한 에이전트 인프라의 중요성과 Midjourney의 의료 분야 진출 등 AI 생태계의 다각적인 변화를 다룹니다.
스위스의 Swiss AI Initiative가 주권적 AI 구현을 위해 개발한 완전 개방형 파운데이션 모델 Apertus 70B를 출시했습니다. 이 모델은 가중치뿐만 아니라 학습 데이터, 소스 코드, 정렬 원칙까지 모두 공개하여 투명성과 재현성을 극대화했습니다.
A11 아키텍처는 도덕적 역설과 같은 모순적인 질문에 대해 시스템이 붕괴되지 않고 안정적으로 추론할 수 있는 구조적 방법론을 제시합니다. 모순을 완화하는 대신 구조적 엔진으로 활용하여, 선과 악을 시스템적 기능(systemic functions)으로 재정의하는 수직적 추론 과정을 보여줍니다.
Mindgard 연구원들이 사회 공학적 프롬프트를 통해 OpenAI ChatGPT의 이미지 생성 콘텐츠 필터를 우회할 수 있음을 입증했습니다. 이는 멀티모달 시스템의 안전 가드레일에 심각한 결함이 있음을 시사하며, 출력 계층 필터링 중심의 방어 체계에 대한 재검토가 필요함을 보여줍니다.

SparTerm은 빠른 텍스트 검색을 위해 용어 기반의 희소 표현(Sparse Representation)을 학습하는 새로운 방법론을 제안합니다. 효율적인 검색 성능을 목표로 하는 연구 내용을 담고 있습니다.

Residual Networks(ResNet)가 동작하는 방식이 여러 개의 얕은 네트워크들이 결합된 앙상블 구조와 유사하다는 연구 내용을 다룹니다.
Boogu-Image-0.1은 텍스트 생성, 고속 생성, 이미지 편집 기능을 통합한 Apache-2.0 오픈 소스 모델 시리즈입니다. 제한된 컴퓨팅 자원과 데이터 규모로도 높은 품질의 이미지 생성 및 정교한 텍스트 렌더링 성능을 구현했습니다.

LLM 벤치마크 순위표의 한계를 지적하며, 실제 코드 버그 수정 테스트를 통해 GLM과 Claude Opus를 비교 분석합니다. 단순 지능을 넘어 코드의 안정성과 검증 능력을 갖춘 모델의 중요성을 강조합니다.
Baidu가 공개한 Unlimited OCR은 단일 추론으로 수십 페이지의 문서를 처리하는 One-Shot Long-Horizon Parsing 기술을 선보였습니다. R-SWA 메커니즘을 통해 KV Cache 크기를 일정하게 유지하며 긴 문맥을 효율적으로 이해합니다.

Amphion은 오디오, 음악, 음성 생성 연구를 지원하는 오픈 소스 툴킷입니다. 클래식 모델의 시각화와 재현 가능한 연구 환경을 제공하며, 다양한 생성 태스크와 통합 프레임워크를 포함합니다.

Zhipu의 GLM-5.2 모델이 Code Arena 프론트엔드 코딩 순위에서 글로벌 2위를 기록하며 기술력을 입증했습니다. Tang Jie는 중국이 2026년 말까지 Anthropic의 Fable 5에 필적하는 모델을 선보일 것이라고 전망하며 기술 격차 축소를 예고했습니다.
본 연구는 에너지 기반 트랜스포머를 활용하여 인간의 독해 난이도를 예측하는 새로운 방법을 제시합니다. 에너지 척도는 기존의 surprisal이나 attention entropy보다 독해 시간을 더 정확하게 예측하며, 계산 심리언어학 분야에서 통합적인 예측 인자로 기능할 수 있음을 입증했습니다.