Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
보안 연구자 lcamtuf는 Amazon에서 검색되는 유사한 아동용 도서 표지 150개를 통해 AI 생성 콘텐츠의 반복적 패턴인 'AI Slop' 현상을 폭로했습니다. 이는 LLM이 유사한 프롬프트에 대해 통계적으로 매우 유사한 출력을 생성하는 준결정론적 특성을 가지고 있음을 보여줍니다.
OpenAI가 생명 과학 분야의 LLM 능력을 평가하기 위한 새로운 벤치마크인 LifeSciBench를 공개했습니다. 이 벤치마크는 과학 문헌 이해, 데이터 추출, 분자 생물학 작업 등 전문적인 과학 지식 처리 역량을 측정합니다.
Kimi 2.5와 2.6 모델을 대상으로 에이전트 기술(Agent Skills)의 효용성을 비교 평가한 연구 결과입니다. 모델 성능이 향상되어도 에이전트 기술이 제공하는 성능 향상 폭은 일정하게 유지됨을 확인했습니다.
자율 주행 레이싱을 위한 오픈 소스 강화학습 환경인 L2R을 소개합니다. ICCV 2021 논문으로 발표되었으며, 주요 AI 컨퍼런스의 공식 챌린지 트랙으로 채택된 검증된 연구 환경입니다.

적외선을 활용하여 얼굴 인식 시스템을 무력화하는 실질적인 공격 방식에 대해 다룹니다. 기존 얼굴 인식 기술의 취약점을 분석하고 보안 위협을 제시합니다.

Z.ai가 출시한 오픈 웨이트 모델 GLM-5.2가 주요 벤치마크에서 Claude Opus 4.8 및 GPT-5.5와 대등하거나 이를 능가하는 성능을 보여주었습니다. 7,530억 개의 파라미터를 가진 MoE 구조로, 높은 성능과 경제성을 동시에 갖춘 모델로 평가받습니다.
DeepSeek는 혁신적인 비용 효율성을 바탕으로 GPT-4 및 Claude 3.5 Sonnet에 필적하는 성능을 구현한 오픈 소스 AI 모델입니다. MLA와 MoE 기술을 통해 연산 효율을 극대화하고, 강화학습만으로 고도의 추론 능력을 확보했습니다.

산업 규제로 인해 접근이 어려운 핀테크 LLM 문제를 해결하기 위해 오픈 소스 금융 LLM인 FinGPT를 공개했습니다. 감성 분석과 예측을 위한 모델 및 벤치마크를 포함하며 NeurIPS 등 주요 학회에 채택되었습니다.
PACI는 비동기 파이프라인 병렬성에서 발생하는 버블을 제거하여 학습 속도를 최대 1.69배 향상시키는 기술입니다. 로컬 그래디언트 누적 방식을 통해 메모리 사용량을 유지하면서도 모델의 수렴 안정성과 처리량을 동시에 확보합니다.

Flow Matching 및 생성 모델의 원리를 직관적으로 설명하는 학습 노트입니다. 데이터 분포를 학습하여 난수로부터 새로운 데이터를 생성하는 과정을 수학적 수식과 직관적 개념을 병행하여 다룹니다.

OmniVideo-100K는 구조화된 스크립트와 증거 체인을 활용하여 구축된 100K개의 인스트럭션 튜닝 데이터셋입니다. 이를 통해 미세 조정된 모델은 오디오-비주얼 이해 성능을 20% 이상 향상시켰습니다.

Anthropic 모델의 성능을 사용자 모르게 의도적으로 약화시킨다는 신뢰성 논란과 Google의 새로운 오픈 모델 DiffusionGemma의 등장을 다룹니다. 특히 모델의 '사일런트(silent)한 성능 저하'가 연구의 재현성과 산업적 신뢰를 해칠 수 있다는 비판이 핵심입니다.

LiveKit이 음성 AI의 화자 교대 종료 감지(turn detection)를 검증하기 위한 오픈소스 기준인 eot-bench를 공개했습니다. 14개 언어를 포함한 실제 대화 데이터셋을 통해 모델의 정확도와 응답 지연 시간 사이의 상충 관계를 평가합니다.
GLM 5.2가 에이전트 기반 코딩 벤치마크에서 Opus 4.8의 1% 이내 성능을 기록하며 프론티어 모델에 근접했습니다. 특히 오픈 웨이트 모델로서 장기적 에이전트 코딩 능력을 입증하며 매우 높은 가성비를 제공합니다.
AllenAI가 자연어 지침을 바탕으로 3D 포인트 궤적을 예측하는 MolmoMotion 비전-언어 모델을 출시했습니다. 짧은 RGB 관측 이력을 통해 미래의 3D 공간 내 객체 이동을 예측하는 것이 특징입니다.
SupraLabs가 텍스트, 이미지, 비디오를 단일 토큰 스트림으로 처리하는 ~30M 파라미터 규모의 Any-to-Any 멀티모달 Transformer 모델인 Supra-A2A-Nano-Exp를 공개했습니다. 별도의 비전 인코더나 확산 모델 없이 공유된 어휘집을 통해 모든 모달리티를 언어 모델링 방식으로 통합한 실험적 프로토타입입니다.
GLM 5.2는 기존 오픈 모델들과 달리 Anthropic의 Opus 4.6과 대등한 성능을 보여주는 혁신적인 공개 오픈 모델입니다. 높은 하드웨어 비용이 수반되지만, 기업들에게 기존 폐쇄형 모델을 대체할 수 있는 강력한 파괴적 혁신을 제공합니다.
중국 기업이 Codex와 Claude Code를 추격할 수 있었던 핵심 방법론인 데이터 학습 전략을 설명합니다. 고품질의 신호 대 잡음비(SNR)를 확보하기 위해 LLM의 입출력을 활용한 지도 미세 조정(SFT)과 강화학습(RL)의 결합 방식을 다룹니다.
Collatz 추측의 특정 구조인 'Exit Layer' 공식 $m_p = (4^p - 1)/3$을 Lean 4 언어를 사용하여 Zero-Sorry 방식으로 형식화한 연구입니다. Collatz 추측의 증명이 아닌, 수학적 구조의 엄밀한 형식화와 향후 직면할 경로의 한계를 지도로 나타내는 데 중점을 둡니다.
llama.cpp B70 빌드에서 SYCL 백엔드를 사용한 Gemma 4 및 Qwen 모델의 성능 벤치마크 결과입니다. 다양한 모델 크기와 양자화 설정에 따른 토큰 생성 속도(t/s)를 측정하였습니다.