Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

에이전트 벤치마크의 한계를 극복하기 위해 도구 시퀀스 기반의 TASTE를 제안합니다. 또한 ByteDance가 다수 화자의 음향적 일관성을 유지하는 음성 합성 모델 SwanVoice를 출시했습니다.

ByteDance가 독백과 다중 화자 대화 합성이 가능한 SwanVoice를 출시했습니다. 이 모델은 flow-matching DiT를 활용해 대화 전반의 음향적 일관성을 유지하며, Tencent는 오디오-LLM 통합을 위한 Universal Audio Tokenizer를 공개했습니다.

ByteDance Seed는 통합 멀티모달 모델의 VAE 병목 현상을 해결하기 위해 '표현 강제(Representation Forcing)' 기술을 제안합니다. 이 기술은 디코더가 픽셀 이전에 시각적 표현을 예측하게 하여 생성과 이해의 품질 격차를 해소합니다.

Tencent가 Hugging Face를 통해 Universal Audio Tokenizer를 공개했습니다. 이 모델은 오디오 인지와 언어적 정렬을 결합한 컴팩트한 단일 코드북 모델로, Audio-LLM의 원활한 통합을 지원합니다.

Trust-Region Behavior Blending 기법을 통해 On-policy Distillation Warmup 문제를 해결하는 연구를 소개합니다. KL 신뢰 영역 내에서 학생 모델의 롤아웃을 교사 정책과 혼합하여 수학적 추론 성능을 극대화합니다. 또한 Tencent의 새로운 Universal Audio Tokenizer 출시 소식도 포함되어 있습니다.

Microsoft가 AI 어시스턴트의 장기 기억 능력을 평가하기 위한 RHELM 벤치마크를 Hugging Face에 공개했습니다. 이 벤치마크는 멀티홉 추론과 환각 탐지 능력을 테스트하며, Tencent는 오디오-LLM 통합을 위한 Universal Audio Tokenizer를 발표했습니다.

GrepSeek은 임베딩이나 인덱스 없이 셸 파이프라인을 작성하여 원시 텍스트를 검색하는 9B 오픈 가중치 모델입니다. 14GB 코퍼스 환경에서 7개의 오픈 도메인 QA 벤치마크 최고 성능을 달성했습니다.

ByteDance가 Hugging Face를 통해 새로운 비디오 생성 및 편집 모델인 Bernini를 공개했습니다. 텍스트, 이미지, 참조 자료를 활용하여 고품질 비디오를 생성할 수 있으며, 기존의 폐쇄형 모델들과 경쟁할 수 있는 성능을 갖추었습니다.

LongTraceRL은 검색 에이전트의 궤적과 엔티티 수준의 보상을 활용하여 LLM의 128K 컨텍스트 추론 능력을 향상시키는 연구입니다. 4B, 8B, 30B 규모의 모델과 학습 데이터가 함께 공개되었습니다.

COLLEAGUE.SKILL은 채팅 로그를 분석하여 특정 인물의 사고방식과 목소리를 담은 휴대 가능한 AI 에이전트 기술 패키지로 변환하는 기술입니다. GitHub에서 활발히 공유되며, 개인의 역량을 디지털 에이전트 형태로 추출할 수 있게 합니다.

시각-언어 모델(VLM)이 수직 위치를 거리와 혼동하는 공간적 편향을 지적하는 연구를 소개합니다. 또한 Amazon과 OSU가 출시한 오픈 심층 연구 에이전트 제품군인 QUEST를 함께 다룹니다.

5월 마지막 주 주목해야 할 주요 AI 연구 논문들을 소개합니다. 다중 에이전트 모델링, 로봇 비전-언어-액션(VLA), 에이전트 보안 및 강화학습 등 다양한 최신 연구 동향을 다룹니다.

Tencent Hunyuan과 Tsinghua University가 물리적 접지를 학습하는 VLM인 GEM을 발표했습니다. GEM은 사전 학습 중 깊이 지도를 예측하여 체화된 지능을 구현하며, ThriftAttention 기술을 통해 FP4 속도로 높은 품질의 어텐션 연산을 수행합니다.

Amazon과 OSU가 2B에서 35B 규모의 완전 개방형 딥 리서치 에이전트 제품군인 QUEST를 출시했습니다. 합성 태스크와 검증 가능한 루브릭 트리를 활용해 학습되었으며, 모든 모델과 데이터셋이 Hugging Face에 공개되었습니다.

MemTrace는 LLM 메모리 파이프라인을 실행 가능한 그래프로 변환하여 메모리 진화 과정을 추적하는 기술입니다. 오류의 근본 원인을 자동으로 찾아내고 스스로 수정하여 성능을 최대 7.62% 향상시킵니다.

PerMemBench는 LLM 에이전트가 모든 사용자에게 동일한 메모리 규칙을 적용하는 문제를 해결하기 위해 개인화된 메모리 정책과 세션 수준 게이팅을 도입합니다. 이를 통해 에이전트가 사용자의 필요를 학습하고 더 많은 유용한 정보를 유지할 수 있음을 증명합니다.

ThriftAttention은 쿼리-키 블록의 5%만 FP16으로 계산하는 선택적 혼합 정밀도 어텐션 기법입니다. FP4의 속도를 유지하면서도 FP16에 근접한 품질을 구현하며, 131k 이상의 긴 컨텍스트를 효율적으로 처리합니다.
NVIDIA가 Hugging Face를 통해 FoxConn 공장의 NV 보드에서 추출한 PCB 이상 탐지 데이터셋을 공개했습니다. 이 데이터셋은 AnomalyGen 및 Qwen-Image-Edit의 파인튜닝과 합성 결함 생성 연구를 목적으로 합니다.
NVIDIA가 Hugging Face에 PCB 결함 생성을 위한 Spark AnomalyGen을 출시했습니다. OpenUSD 기반의 3D 장면을 활용하여 현실적인 구조적 결함을 합성하며, 소량의 데이터로도 시각 검사 모델 학습을 지원합니다.

NVIDIA가 디코딩과 초해상도를 단일 생성 패스로 통합한 PiD 모델을 공개했습니다. 기존 파이프라인보다 6배 빠르며 소비자용 GPU에서 1초 미만으로 실행되어 효율적인 이미지 생성이 가능합니다.