Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
오디오 거대 언어 모델(Audio LLMs)이 텍스트 프롬프트의 문맥을 실제로 활용하는지 평가하기 위한 새로운 벤치마크인 IndicContextEval을 제안합니다. 8개 인도 언어와 23개 전문 도메인을 대상으로 모델의 문맥적 접지 능력을 다각도로 분석합니다.
우르두어 필기 텍스트 인식(UHTR) 연구를 위해 역사적 문서 기반의 'Urdu Katib' 데이터셋을 제안합니다. CRNN 기반 모델들을 평가한 결과, CNN-BGRU-CTC 모델이 가장 낮은 오류율을 기록하며 우수한 성능을 보였습니다.
RTX 6000 Blackwell 환경에서 DiffusionGemma와 Gemma 4의 추론 속도를 비교한 벤치마크 결과입니다. DiffusionGemma가 Gemma 4 대비 약 6.73배 빠른 토큰 생성 속도를 보여주며 아키텍처의 효율성을 입증했습니다.
Z.ai가 GPT-5.5를 능가하는 성능을 가진 7,530억 파라미터 규모의 오픈 웨이트 모델 GLM-5.2를 출시했습니다. 이 모델은 코딩 벤치마크에서 압도적인 성적을 거두었으며, GPT-5.5 대비 약 1/6 수준의 매우 저렴한 API 비용을 제공합니다.
GLM-5.2가 Artificial Analysis의 오픈 가중치 모델 순위에서 1위를 차지하며 성능 우위를 입증했습니다. GPT-5.5 대비 추론 효율은 낮으나, Opus 4.8 수준의 품질을 훨씬 저렴한 비용으로 제공하며 Anthropic의 시장 해자를 위협하고 있습니다.
초소형 신경망 TTS 모델인 Inflect-Nano-v1이 출시되었습니다. 5M 미만의 파라미터로 저사양 환경에서도 실행 가능하며, 임베디드 장치나 로컬 음성 에이전트를 위한 효율적인 베이스라인을 제공합니다.
Machine Learning 박사 학위 소지자를 위한 Research Scientist 직무 취업 및 인터뷰 가이드입니다. DeepMind, Meta 등 글로벌 기업의 오퍼를 받은 실전 경험을 바탕으로 인터뷰 확보 전략, 기술 준비, 보상 체계 등을 상세히 다룹니다.


GLM-5.2는 Artificial Analysis Intelligence Index에서 선두를 차지한 강력한 오픈 웨이트 텍스트 전용 LLM입니다. 높은 성능을 보여주지만, 타 모델 대비 출력 토큰 소비량이 많고 특정 SVG 생성 작업에서 성능 차이가 나타나는 특징이 있습니다.
소피 제르맹(Sophie Germain) 소수에 대한 네 가지 장벽 측 경험적 관찰 결과를 보고하는 연구 초안입니다. Bellman-Ford LP-불가능성 프레임워크를 사용하여 Hardy-Littlewood 예측값과의 수렴성 및 간격 분포를 분석했습니다.

Rerender A Video는 텍스트 가이드를 활용하여 비디오를 비디오로 변환하는 Zero-Shot 기술을 소개합니다. 별도의 추가 학습 없이 텍스트 명령만으로 영상의 스타일이나 내용을 정교하게 변경할 수 있습니다.

Stanford Medicine 연구진이 생쥐 모델을 대상으로 제1형 당뇨병을 영구적으로 완치하는 데 성공했습니다. 저선량 방사선과 표적 항체를 이용한 '면역 체계 재설정' 방식을 통해 자가면역 공격을 중단시키고 이식된 세포를 보호하는 하이브리드 면역 체계를 구축했습니다.

LLM의 정렬(Alignment) 과정이 생성되는 이야기의 다양성을 어떻게 훼손하는지 분석합니다. 연구 결과, 특정 이름(Elias)과 설정(등대)이 모든 챗봇에서 과도하게 반복되는 현상을 통해 안전성 학습이 창의성을 제한함을 지적합니다.
2026년 6월 발표된 8개의 연구를 통해 LLM-as-Judge 방식의 심각한 신뢰성 문제를 분석합니다. 반복 실행 시 결과가 동전 던지기 수준으로 불일치하며, 추론 예산이나 브랜드 편향에 따라 평가 결과가 왜곡될 수 있음을 경고합니다.
산불 대피 경로 최적화를 위해 물리 법칙을 내장한 물리 증강 확산 모델(Physics-Augmented Diffusion Models)을 제안합니다. 저전력 에지 장치 및 드론에서 실행 가능한 효율적인 대피 물류 네트워크 설계를 목표로 합니다.
DeepMind가 발표한 DiffusionGemma는 기존 방식보다 4배 빠른 텍스트 생성을 구현한 새로운 확산 모델 프레임워크입니다. 적응형 확산 스케줄과 계층적 구조를 통해 생성 효율성과 품질을 동시에 개선했습니다.
Google Gemini 3.5 Flash High와 Zai_org GLM 5.2 모델의 코딩 벤치마크 결과를 비교 분석합니다. 수학적 정확도, 수치적 안정성, 시각화 및 코드 아키텍처 측면에서 GLM 5.2가 더 우수한 엔지니어링 코어를 보여주며 승리했습니다.
Ai LTX-2.3 IC-LoRA 모델의 업데이트 소식을 전합니다. 이 모델은 낮에 촬영된 비디오의 구도, 프레임, 카메라 및 피사체의 움직임을 프레임 단위로 정밀하게 유지하며 밤 버전으로 변환하는 기능을 제공합니다.

Tencent와 CUHK 연구진이 Godot 엔진 기반의 게임 제작 태스크를 평가하는 벤치마크인 GameCraft-Bench를 발표했습니다. 최첨단 코딩 에이전트들도 41.46%의 낮은 성능을 보여, 완전한 게임 생성 기술의 한계를 확인했습니다.

Ai2가 비디오와 언어 지시문을 통해 3D 포인트 궤적을 예측하는 4B 규모의 비전-언어 모델인 MolmoMotion을 Hugging Face에 출시했습니다. 이 모델은 객체의 시간적 공간 움직임을 예측하는 데 특화되어 있습니다.
Z.ai가 공개한 오픈 웨이트 모델 GLM-5.2는 IndexShare 메커니즘을 통해 1M 토큰의 장문맥을 효율적으로 처리합니다. SWE-bench Pro 등 코딩 벤치마크에서 GPT-5.5를 상회하는 성능을 보이며, 프론티어 모델에 육박하는 오픈 웨이트 모델로 평가받습니다.