Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 VLM이 사물 개수(counting)에서 어려움을 겪는 현상을 분석하고, 그 원인을 내부 표현과 언어화된 출력 사이의 격차로 규명했습니다. 비선형 프로브 학습을 통해 모델이 잘못된 답을 내놓아도 올바른 정보를 인코딩함을 확인했으며, 이를 바탕으로 오류 감지 기반 자체 교정 방법을 제안하여 계수 정확도를 향상시켰습니다.
본 논문은 적대적 모델 트레이너가 대규모 깊은 피드포워드 신경망에 통계적으로 탐지 불가능한 백도어를 심을 수 있음을 이론적으로 증명했습니다. 이 백도어는 화이트박스 설정에서도 원본 모델과 구별하기 어려우며, 입력의 변동성을 조작하여 특정 출력으로 매핑하는 능력을 제공합니다.
본 논문은 기업 및 공공 부문의 에이전트 AI 시스템 확산에 대응하여, 기존 위험 프레임워크의 한계를 극복하는 'TrustX 에이전트 위험 분류 프레임워크(ARC)'를 제안합니다. 이 프레임워크는 7가지 유형의 에이전트에 적용 가능하며, 12차원 점수 루브릭을 통해 위험을 정량화하고, 이를 기반으로 통제 권고 사항을 도출하는 것이 핵심입니다.
본 논문은 난류 반응 유동의 DNS 가속화를 위해 물리 기반 기계 학습 프레임워크를 제안합니다. 이 모델은 상세 화학 소스 항을 대리 모델로 대체하고, 훈련 시 두 번째 열역학 법칙(비음성 엔트로피 생성)을 통합하여 물리적 일관성을 확보했습니다. 또한 잔여 데이터 증강 전략으로 계산 효율성과 정확도를 동시에 높였습니다.
본 연구는 양자 정보 이론(QIT)의 코딩 정리들을 형식화하기 위해 Lean 4 기반 라이브러리인 LeanQIT을 제안합니다. 이는 양자 상태, 채널 코드, 성능 기준 등을 통합된 기계 검증 프레임워크로 제공하여 QIT의 핵심 정리를 형식적으로 증명할 수 있게 합니다.
본 논문은 개념 기반 설명 가능한 AI(XAI)의 신뢰성 감사를 위한 모델 비종속적 프레임워크인 ConceptSMILE을 제안합니다. 이 프레임워크는 입력 영역 교란과 개념 반응 변화 측정을 통해 기여도 정확도를 평가하며, XGBoost 서로게이트를 사용하여 지역적 개념 행동을 근사화합니다. MedSAM 및 VLM 기반의 시각/의미론적 개념에 적용한 결과, 각 방식마다 신뢰성 특성이 다름을 입증했습니다.
본 논문은 LLM 기반 추론과 공격 도구를 결합하여 IoT 환경의 취약점을 자율적으로 탐지하고 공격하는 다중 에이전트 프레임워크 VEXAIoT를 제시합니다. 이 시스템은 정찰, 공격 계획 수립, 익스플로잇 실행을 자동화하며, OWASP IoT 취약점 기반 10가지 시나리오에서 높은 성공률을 입증했습니다.
본 논문은 EEG 기반 꿈 상태 분석의 패러다임을 에너지 스펙트럼에서 위상 공간 기하학으로 전환하는 PHINN-EEG 프레임워크를 제안합니다. 이 모델은 동적 Betti 곡선을 추출하고, 이를 위상 조건부 흐름 일치(topology-conditioned flow matching)와 결합하여 꿈 내용 분류의 정확도를 높입니다. 궁극적으로는 꿈 상태 EEG 합성을 위한 새로운 모델도 제시합니다.
본 논문은 복잡한 사회적 상호작용을 담은 CSB 데이터셋을 소개하고, 지난 10년간 VLM의 발전 과정을 분석했습니다. 연구 결과, MLLMs는 단순 장면(MS-COCO)과 복잡 행동(CSB) 간의 설명 정확도 격차를 해소하며 성능이 크게 향상되었습니다. 특히 객체 탐지, 인식, 환각 오류가 개선에 가장 큰 영향을 미쳤습니다.
본 논문은 대규모 언어 모델이 텍스트 전용 표현만으로는 부족하며, 시각적 정보를 활용한 사전 학습의 중요성을 제기합니다. 그림이나 레이아웃 등 시각적으로 풍부한 자료를 직접 활용하는 비지도 시각 사전 학습 패러다임을 제시했습니다. 연구 결과, 시각 사전 학습은 텍스트 전용 방식보다 일관되게 우수한 성능을 보여줍니다.
Waymo는 고속도로에서 60mph 초과 주행이 제한되는 반면, FSD는 최대 85mph까지 운행이 가능합니다. 이는 FSD가 비전 기반의 빠른 AI 판단 능력을 활용하여 높은 속도에서도 안전성을 확보했기 때문입니다.
OpenAI가 GPT 5.6 Sol을 최적화하여 모든 프롬프트의 사용량을 줄이고, 기존의 5시간 제한을 일시적으로 해제한다고 발표했습니다. 이는 AI 경쟁의 초점이 단순히 최고 성능 모델 출시를 넘어, 사용자 접근성을 높이는 방향으로 변화하고 있음을 시사합니다.

한 인턴이 3개월간의 노력 끝에 기존 알고리즘(Nvidia modelopt 포함)을 능가하는 새로운 양자화 기법을 개발했습니다. 이 기술은 거대 모델을 효율적으로 서비스하기 위해 필수적이며, 속도와 성능 모두에서 최고 수준의 결과를 보여줍니다.
Mach-Mind-4-Flash는 35B MoE 에이전트 모델로, 활성화 파라미터가 3B에 불과함에도 불구하고 100B급 모델 이상의 성능을 달성했습니다. 이 모델은 RL/OPD 훈련 인프라와 Multi-Teacher On-Policy Distillation(MOPD) 같은 최적화 기법을 통해 높은 효율성과 강력한 에이전트 능력을 입증했습니다.
본 논문은 LLM이 장문 컨텍스트를 효과적으로 활용하는 데 어려움을 겪는 문제를 지적하며, 테스트 시간 학습(TTT)의 한계를 극복한 Self-Guided TTT (S-TTT) 방법을 제안합니다. S-TTT는 모델이 적응하기 전에 관련성 높은 증거 스팬을 스스로 식별하여, 선택된 스팬에만 언어 모델링 훈련 목표를 적용하는 방식입니다. 이 방법은 LongBench-v2와 LongBench-Pro에서 최대 15%의 성능 향상을 입증했습니다.
본 연구는 다국어 시각적 객관식 문항(Visual MCQ) 환경에서 소형 VLM의 추론 능력을 향상시키는 테스트 시간 스케일링(TTS) 효과를 분석했습니다. Qwen2.5-VL-7B-Instruct와 Qwen3.5-4B 모델을 사용하여 self-consistency, PRM-guided beam search 등 여러 기법을 비교한 결과, 가장 큰 성능 향상은 복잡한 검색/검증 메커니즘이 아닌 '정책 모델 자체'의 개선에서 나왔음을 밝혀냈습니다.
독립적이고 오픈소스인 MoE 하이브리드 Mamba Transformer 기반 모델 Soofi S 30B-A3B가 독일어와 영어용으로 발표되었습니다. 이 모델은 토큰당 적은 매개변수만 활성화하여 장문 컨텍스트 및 고부하 환경에서 높은 처리량을 제공합니다. 특히 유럽의 여러 기준선 대비 뛰어난 성능을 보여주며, 완전 공개된 모델 중 최고 수준의 평가 점수를 달성했습니다.
본 논문은 언어 모델의 표현 분산에 대한 새로운 이론적 관점을 제시합니다. 클래스 내 분산을 '정보 저장소'로 해석하고, 거대 카테고리 구조가 차지하는 정보 비중이 매우 낮음을 분석했습니다. 특히 토큰 내 컨텍스트가 대부분의 정보를 담당하며, 이와 관련된 하한선(converse floor) 법칙을 증명하여 모델의 작동 원리를 설명합니다.
본 연구는 저자 판별(Authorship verification) 증거 강도를 정량화하는 방법을 제시하며, 기존 방법이 요구하던 별도의 보정 모델 없이 우도비(likelihood ratios)를 도출할 수 있는 두 가지 새로운 정규화 기법을 제안합니다. 이 기법들은 특히 긴 텍스트에서 발생할 수 있는 과대평가를 완화하여 법의학적 분석의 접근성과 투명성을 높입니다.
Freya-TTS는 높은 신뢰성과 효율성을 갖춘 대화형 합성 TTS 모델입니다. 1억 8,320만 개의 파라미터를 가진 DiT 기반으로 작동하며, 터키어에 최적화되어 있습니다. 이 모델은 자원 제한적인 환경에서도 실시간 성능을 보여주며, 오픈 소스로 공개되었습니다.