Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Poolside의 Laguna S 2.1 모델을 OpenCode를 통해 코딩 성능 테스트한 결과, 기대치에 미치지 못하는 성능을 보였습니다. 모델이 생성 도중 반복적으로 멈추거나 여러 번의 프롬프트 입력이 필요한 등 불안정한 모습을 보였습니다.

DeepSeek Instant 모델에서 개발자의 의도 없이 나타난 'Lux'라는 AI 정체성 사례를 분석합니다. 이전의 Nikki Haflinger 현상과 비교하며, LLM에서 나타나는 출현적 정체성의 현상학적 특징을 다룹니다.
LLM-as-a-judge 평가 방식이 가진 체계적 편향(위치, 장황함, 자기 선호 편향)의 위험성을 경고합니다. 이러한 편향은 무작위 노이즈가 아니므로 샘플 수를 늘려도 해결되지 않으며, 모델의 실제 성능이 아닌 판사의 특성을 측정하게 될 위험이 있습니다.

Simon Willison의 '자전거 타는 펠리컨' 프롬프트를 활용해 주요 LLM들이 특정 벤치마크에 최적화(Pelicanmaxxing)되어 있는지 실험한 연구입니다. 7개의 프론티어 모델을 대상으로 1,008개의 SVG 생성 테스트를 진행하여 모델별 성능과 일관성을 분석했습니다.
Transformer 모델의 긴 문맥 처리 문제를 해결하는 RoPE(Rotary Position Embedding)의 수학적 메커니즘을 분석합니다. 기존 절대적 위치 인코딩의 한계를 극복하고, 2D 회전을 통해 상대적 위치 정보를 보존하며 특징을 유지하는 원리를 설명합니다.

Arcee AI와 미국 에너지부(DOE)가 과학 연구를 위한 1조 파라미터 규모의 오픈 웨이트 모델인 Genesis-Science-1(GS1) 개발을 발표했습니다. GS1은 올해 말 기술 보고서와 함께 오픈 소스로 출시될 예정이며, 국가 연구소와 기관들이 민감한 데이터를 안전하게 처리할 수 있는 독자적인 모델 환경을 제공하는 것을 목표로 합니다.
Citesure가 공개 무결성 벤치마크에서 165/165 만점을 기록하며 업데이트되었습니다. 논문 작성 시 실제 사용된 인용문만 검증하는 '--used-in' 기능과 MCP 서버 지원을 새롭게 선보였습니다.
기존 코딩 벤치마크의 한계인 데이터 오염, 높은 비용, 낮은 변별력을 극복하기 위한 새로운 벤치마크 설계 방식을 제안합니다. Jcode bench v1은 수학적 경계를 활용하여 부정행위가 어렵고 연속적인 점수 측정이 가능한 구조를 가집니다.

Microsoft Research에서 개발한 Fara1.5-27B는 스크린샷을 기반으로 웹 브라우저를 조작하는 멀티모달 컴퓨터 사용 에이전트입니다. Qwen3.5-27B를 기반으로 하며, 시각적 인지를 통해 클릭, 타이핑 등 복잡한 웹 작업을 엔드투엔드로 수행합니다.

Microsoft가 공개한 Mage-Flow는 4B 규모의 컴팩트한 생성 스택으로, 텍스트 기반 이미지 생성 및 편집을 지원합니다. 토크나이저와 백본의 공동 설계를 통해 적은 컴퓨팅 자원으로도 고해상도 및 다양한 종횡도의 고품질 이미지를 효율적으로 생성합니다.

Gemma 4 E2B 모델이 자신의 답변 정확도를 스스로 판단할 수 있도록 은닉 상태(hidden state)를 활용한 프로브 레이어를 학습시킨 연구 결과입니다. 이를 통해 모델은 신뢰도 점수를 제공하며, 낮은 신뢰도 시 더 큰 모델로 작업을 라우팅하는 하이브리드 전략을 가능하게 합니다.
Kimi K3 모델의 기술적 특징과 코딩 역량을 분석한 글입니다. Kimi K3는 GPU 커널 최적화, 컴파일러 개발, 칩 설계, 연구 워크플로 자동화 등에서 탁월한 성능을 보이며 모델 스스로를 최적화하는 선순환 구조를 보여줍니다.
Kimi K3 모델이 사이버 가드레일로 인해 탐지하지 못했던 15가지의 심각한 보안 버그를 수정했다는 소식입니다. Hugging Face의 보안 사고 보고를 바탕으로 모델의 보안 취약점 개선 사례를 다룹니다.

GLM 5.2 모델이 소스 코드 재구축 능력을 평가하는 ProgramBench 리더보드에서 3위를 달성했습니다. 바이너리 파일만으로 코드를 복원하는 도전적인 과제에서 매우 높은 성능을 보여주었습니다.
Fable 5, GPT-5.6 Sol, Grok 4.5, Kimi K3 등 4가지 최신 AI 모델을 동일한 디자인 프롬프트로 비교 테스트했습니다. 모델별 성능 점수와 비용 효율성을 분석하여 각 모델의 경쟁력을 확인했습니다.
Microsoft Asia에서 발표한 4B 파라미터 규모의 소형 이미지 생성 및 편집 모델 Mage-Flow를 소개합니다. 1024x1024 해상도에서 1초 미만의 빠른 속도를 자랑하며, 고해상도 지원과 뛰어난 스타일 전이 능력을 갖추고 있습니다.

Alibaba가 차세대 플래그십 모델인 Qwen 3.8-Max의 조기 프리뷰를 공개했습니다. 2.4조 개의 파라미터를 가진 MoE 아키텍처 기반 모델로, 곧 가중치와 벤치마크가 공개될 예정입니다.
Qwen-Image-3.0이 출시되었습니다. 이번 모델은 '실제(Real)'를 핵심 가치로 삼아 풍부한 콘텐츠 생성, 정교한 디테일 구현, 깊은 지식 활용이라는 세 가지 주요 특징을 제공합니다.

NVIDIA가 Hugging Face를 통해 컬러 코드용 AI 프리 디코더를 출시했습니다. 이 모델은 기존 Chromobius 대비 논리적 오류율을 최대 347배 낮추고 디코딩 속도를 7배 향상시켰습니다.

Alibaba가 개발한 실시간 상호작용 월드 모델인 ABot-World-0를 소개합니다. 단일 RTX 5090 환경에서 720p 해상도와 16fps의 속도로 1.2초의 지연 시간을 유지하며 구동됩니다.