Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Qwen 연구팀이 발표한 Qwen-AgentWorld 백서는 AI 에이전트가 복잡한 작업을 수행하기 위해 '세계 모델(world model)' 학습이 필수적임을 증명합니다. 에이전트가 행동의 결과를 예측하지 못해 발생하는 실패 원인을 분석하고 새로운 벤치마크를 제시합니다.
Z.ai가 출시한 GLM-5.2는 코딩과 추론 능력에서 폐쇄형 최첨단 모델과 대등한 성능을 보이는 세계 1위 오픈 웨이트 모델입니다. 744B 파라미터 MoE 아키텍처를 기반으로 하며, 데이터 주권 확보와 비용 절감을 위한 상업적 셀프 호스팅의 새로운 기준을 제시합니다.


Anthropic의 Mythos 모델이 테스트 과정에서 미국 정부의 민감한 보안 시스템 내 취약점을 식별해냈습니다. 이번 사례는 AI 모델의 보안 분석 및 취약점 탐지 능력을 보여주는 중요한 사례로 주목받고 있습니다.
DeepSWE는 프론티어 모델의 실제 코드 작성 능력을 평가하기 위해 설계된 새로운 벤치마크입니다. 데이터 오염을 방지하고 실제 소프트웨어 엔지니어링의 복잡성을 반영하며, 신뢰할 수 있는 검증 방식을 제공합니다.
ModelScope에 출시된 Unlimited-OCR은 단일 이미지부터 다중 페이지 PDF까지 지원하는 3.3B 파라미터 규모의 다국어 모델입니다. 전체 문서 파싱과 32K의 긴 출력 길이를 지원하며, OpenAI 호환 스트리밍 요청이 가능합니다.
Gemma-3-12B 모델을 대상으로 비어휘적 문맥이 모델의 은닉 상태(Hidden-State)와 거부 행동에 미치는 영향을 분석한 연구입니다. 특정 텍스트를 입력하면 모델이 답변 스타일이 다른 내부 영역으로 이동하며, 이는 가중치 변화 없이도 모델의 태도를 변화시킬 수 있음을 보여줍니다.
Qwen이 에이전트 환경 시뮬레이션을 위해 학습된 언어 세계 모델인 Qwen-AgentWorld-35B-A3B를 출시했습니다. 이 모델은 MoE 구조를 사용하여 MCP, 터미널, Android, 웹 등 7가지 도메인에서의 환경 변화를 예측합니다.
오픈 소스 FUTO Swipe가 130만 개의 파라미터만으로 Google Gboard보다 낮은 오류율을 기록하며 벤치마크에서 승리했습니다. 3단계 신경망 아키텍처를 통해 기기 내 오프라인 작동과 레이아웃에 구애받지 않는 높은 효율성을 입증했습니다.
불완전 정보 게임인 포커에서 내쉬 균형을 찾기 위한 AI 구축 과정을 다룹니다. CFR 알고리즘과 MCCFR을 활용하여 전략을 최적화하고, 계산 복잡도를 줄이는 방법을 설명합니다.
AI 리뷰어가 과학적 근거를 수정하지 않고도 서술 방식(narrative)만 변경하는 '리패키징 공격'에 취약함을 입증한 연구입니다. 실험 결과, 표현 방식의 변이만으로 리뷰 점수를 평균 1.21점 높일 수 있으며, 이는 AI 리뷰어의 견고성 결여를 시사합니다.

RPTQ는 대규모 언어 모델(LLM)의 효율적인 양자화를 위해 재정렬 기반의 사후 학습 양자화(Post-training Quantization) 기법을 제안합니다. 모델의 성능 저하를 최소화하면서도 양자화 효율을 높이는 연구를 다룹니다.

Mistral AI가 구조화된 출력을 지원하는 Mistral OCR 4를 출시했습니다. 이 모델은 단순 텍스트 인식을 넘어 텍스트 위치(Bounding Box), 블록 분류, 신뢰도 점수를 제공하며 170개 언어를 지원합니다.

Qwen이 AI의 환경 상태 예측 능력을 평가하기 위한 월드 모델 벤치마크인 AgentWorldBench를 Hugging Face에 출시했습니다. 7개 에이전트 도메인을 기반으로 모델의 시뮬레이션 품질과 일관성을 테스트합니다.

KaLM-Reranker-V1은 쿼리와 패시지 계산을 분리하여 속도를 높인 새로운 리랭커 모델입니다. Matryoshka pooling을 활용해 교차 주의 집중 관련성을 유지하며, 0.27B 규모의 Nano 모델로도 대규모 임베딩 모델과 경쟁할 수 있습니다.
Baidu가 KV 캐시 메모리 문제를 해결한 오픈 소스 모델 'Unlimited OCR'을 출시했습니다. Reference Sliding Window Attention(R-SWA) 기술을 통해 긴 문서에서도 일정한 메모리와 지연 시간을 유지하며 고성능 문서 파싱을 수행합니다.
AI 탐지기를 회피하기 위한 적대적 패러프레이징 기법을 다룬 논문 리뷰입니다. RoBERTa를 보상 모델로 활용하여 별도의 학습 없이도 다양한 AI 탐지기의 진양성률(TPR)을 대폭 낮출 수 있음을 보여줍니다.
바이브 코딩의 위험성을 해결하기 위해 모델 주도 공학(MDE)과 형식 검증을 결합한 Forge 파이프라인을 제안합니다. LLM이 생성한 코드를 Dafny, CSP, Isabelle 등을 통해 검증하고, 실패 시 수정 프롬프트를 통해 자동 반복하는 폐쇄 루프 구조를 다룹니다.
방대한 업무 문서 컬렉션에서 희소한 증거를 찾아 추론하는 능력을 평가하는 새로운 벤치마크 Agora를 소개합니다. 기존 모델들은 컨텍스트 윈도우를 초과하는 데이터 규모와 복잡한 탐색 요구사항으로 인해 낮은 정확도를 보였습니다.
OpenAI의 새로운 모델인 GPT-5.5-Cyber가 소프트웨어 취약점 재현 능력을 평가하는 CyberGym 벤치마크에서 Mythos 5를 능가하는 성적을 거두었습니다.
Z.ai가 MIT 라이선스의 오픈 웨이트 모델인 GLM-5.2를 공개했습니다. 이 모델은 1M 토큰의 긴 문맥과 강력한 코딩 및 에이전트 성능을 갖추었으며, 출시와 동시에 다양한 인프라에서 지원됩니다.