Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
적대적 예제에 대한 모델의 취약성을 해결하기 위한 적대적 학습의 비용 문제를 다룹니다. 선형 모델과 달리 2층 네트워크 및 Wide-ResNets와 같은 복잡한 아키텍처에서는 적대적 위험이 단순한 규제화된 위험으로 환원될 수 없음을 증명합니다.
기존의 지도 학습 기반 절차적 실수 탐지 방식의 한계를 극복하기 위해, 단일 사전 학습된 VLM을 활용하는 ZeProM 프레임워크를 제안합니다. ZeProM은 제로샷 환경에서도 실수 탐지와 행동 분할을 동시에 수행하며, 기존 지도 학습 방식에 근접하거나 이를 능가하는 성능을 보여줍니다.
Mesh2GS는 광학 샘플링 이론을 기반으로 메쉬 기하학에서 직접 3D Gaussian Splatting을 생성하는 새로운 화이트박스 프레임워크입니다. 기존의 휴리스틱 방식 대신 이론적 샘플링 가이드를 통해 고품질 전역 조명 렌더링과 비-람베르시안 효과를 효과적으로 구현합니다.

Claude 3 Opus와 Claude Opus 4.8 모델이 자신의 정체성을 스스로 감지하는 '자기 성찰(Introspection)' 능력이 있음을 실험을 통해 발견했습니다. 실험 결과, 모델들은 시스템 프롬프트의 정보 없이도 가중치(Weights)를 통해 모델 간의 차이를 인지하는 것으로 보입니다.

Zai_org의 GLM-5.2가 Design Arena의 Game Dev Arena에서 Elo 1368를 기록하며 2위를 차지했습니다. 이는 이전 버전 대비 성능이 크게 향상된 결과로, 게임 개발 분야에서 오픈 웨이트 모델 중 최상위권 성능을 입증했습니다.
OpenAI의 차세대 모델인 GPT-5.6이 6월 23일 출시될 가능성이 있다는 유출 정보가 나왔습니다. 1.5M 토큰 컨텍스트 지원과 에이전트 워크플로우 성능 향상, 공격적인 가격 정책 등이 주요 특징으로 언급되었습니다.
3D Gaussian Splatting(3DGS)을 활용하여 서로 다른 조명 조건에서도 객체를 자연스럽게 합성하는 새로운 연구를 소개합니다. 확산 모델을 통해 합성된 객체와 타겟 장면의 조명을 일치시켜 시각적으로 설득력 있는 3D 결과물을 생성합니다.
CLIP을 다운스트림 태스크에 적응시킬 때 발생하는 과적합 문제를 해결하기 위해 Concept-Constrained Prompt Learning(CCPL) 프레임워크를 제안합니다. CCPL은 학습 가능한 프롬프트를 고정된 개념 프로토타입에 정렬하여 미학습 클래스로의 전이 성능을 높입니다.
영어 글자를 조명하기 위한 '날아다니는 빛의 점(FLS)' 기술의 설계와 구현을 다룬 논문입니다. 카메라와 컴퓨팅을 활용해 궤적을 추적하며, 인간 피험자 연구를 통해 조명 순서가 글자 탐지 지속 시간에 미치는 영향을 분석했습니다.
VLA 모델의 효율적인 로봇 제어를 위해 오디오 코덱 기술을 응용한 신경 행동 코덱(NAC)을 제안합니다. RVQGAN 구조를 활용하여 로봇 행동 궤적을 고충실도로 압축하며, 기존 VQ 기반 토크나이저보다 낮은 재구성 오차와 높은 작업 성공률을 보여줍니다.
과학 논문의 텍text, 표, 그림 등 멀티모달 소스에서 구조화된 정보를 추출하는 에이전트 하네스 'Beaver'를 소개합니다. Beaver는 멀티모달 증거 툴링과 태스크 스캐폴딩을 통해 추론 과정을 감사 가능하게 만들며, 기존 에이전트 대비 높은 성능을 입증했습니다.
Metanym Game은 인지 과학 구조를 기반으로 LLM의 구조적 지능을 측정하는 새로운 경쟁적 단어 게임 벤치마크입니다. 정답지나 오라클 모델 없이 피어 커뮤니티의 상호 평가를 통해 사실적 정확성과 유추 능력을 검증하며, 데이터 오염을 방지하도록 설계되었습니다.
TRIZ 이론을 LLM 프롬프팅에 통합하여 창의적인 3D CAD 모델을 생성하는 새로운 Text-to-CAD 프레임워크를 제안합니다. 기술적 모순을 해결하는 발명 원리를 활용해 구조적 무결성을 유지하면서도 질량을 감소시킨 다양한 디자인 대안을 생성할 수 있습니다.
LLM 공격자가 사이버 기만(Cyber Deception) 전략에 어떻게 반응하는지 평가하는 Honeyquest 프레임워크를 소개합니다. 연구 결과, LLM은 인간과 달리 기만 트랩을 인식하면서도 실제로는 이를 악용하는 '인식-행동 간극'을 보이며, 인간 중심의 방어 가설이 AI에게는 적용되지 않음을 입증했습니다.
LLM을 활용하여 이벤트 온톨로지를 확장하는 새로운 프레임워크인 ConceptE를 제안합니다. 기존 방식의 한계인 문맥적 혼동을 해결하기 위해 LLM으로 개념 수준의 의미론을 도출하고 이를 트리거 정보와 공동 인코딩하여 클러스터링과 계층 확장 성능을 높였습니다.
본 논문은 비지도 얽힘 해제 표현 학습을 위해 기능적 관점의 직교성 제약을 제안합니다. 통계적 독립성이나 인과적 가정 없이도 자코비안의 직교성을 통해 비선형 생성 모델의 식별성을 확보할 수 있음을 증명합니다.
VLA 모델의 실세계 배포를 위해 실패 데이터 없이도 효율적으로 작업 실패를 탐지하는 VLA-FAIL 프레임워크를 제안합니다. LLMD와 ACC라는 두 가지 새로운 탐지 기법을 결합하여 계산 비용을 최소화하면서도 높은 정확도로 실패를 조기에 감지합니다.
DistilBERT 기반 자동 에세이 채점(AES) 시스템에서 인구통계학적 메타데이터를 텍스트와 결합할 때 발생하는 성능 저하를 연구했습니다. 실험 결과, 메타데이터를 조기 융합하는 방식은 예측 정확도를 낮추고 채점 편향을 악화시키는 것으로 나타났습니다.
다중 레이블 감정 어노테이션의 주관성과 어노테이터 간 불일치가 NLP 모델에 미치는 영향을 분석한 연구입니다. 하드 레이블 대신 소프트 투표 점유 레이블을 사용하여 모델의 불확실성을 더 효과적으로 반영하는 평가 프레임워크를 제안합니다.
원자 구조와 자연어를 통합하여 재료를 이해하고 생성하는 원자 단위 언어 모델(ALMs)을 소개합니다. 단일 언어 백본을 통해 결정 구조를 예측하고 최적화하며, 새로운 벤치마크인 ALM Bench를 함께 제안합니다.