Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
웃음은 인간 소통의 핵심 요소이지만, 오디오에서 이를 정확하게 탐지하고 세분화하는 것은 어려운 과제입니다. 기존 기계 학습 방법들은 수동 주석에 의존하며 영어 중심의 데이터셋이 많다는 한계를 가집니다. 본 논문에서는 웃음 세분화 문제를 에너지 기반 시퀀스의 이상 탐지로 재정의한 무감독 다국어 방법을 제안합니다. 이 방법은 BYOL-A 인코더로 학습된 오디오 표현에 Isolation Forest를 적용하여, 비영어권 환경에서도 우수한 성능을 입증했습니다.
Anthropic의 SpaceX/Colossus 거래와 같은 최근 동향들은 컴퓨팅 자원이 이제 제품 품질과 사용자 경험에 직접적으로 반영되고 있음을 보여줍니다. 기업들은 단순한 채팅봇을 넘어, 오케스트레이션, 메모리, 확장성 등 실제 런타임 성능이 필요한 '관리형 에이전트'를 요구하고 있습니다. 또한, 실시간 음성 AI와 워크플로우 통합에 초점을 맞춘 AI 솔루션들이 주류가 되면서, AI는 단순한 데모를 넘어 핵심적인 비즈니스 연결 조직으로 자리매김하고 있습니다.
앤트로픽(Anthropic)이 스페이스X(SpaceX)와 파트너십을 체결하며 AI 인프라 분야에 큰 변화를 예고했습니다. 이 협력의 결과로 Claude Code 제한이 두 배로 증가하고, Opus API 제한이 상향 조정되었으며, 피크 시간대 지연 현상이 크게 감소하는 등 서비스 개선이 이루어졌습니다. 특히 스페이스X를 통해 약 300MW에 달하는 대규모 추가 컴퓨팅 용량이 확보되어 AI 모델의 성능과 접근성이 한층 강화될 것으로 기대됩니다.
LLaMA.cpp에 Multi-Token Prediction (MTP) 기능을 구현하여 대규모 언어 모델(LLM)의 추론 속도를 향상시켰습니다. 이 개선 사항을 Gemma 4 assistant 모델에 적용한 결과, MacBook Pro M5Max 환경에서 드래프트 토큰 처리 속도가 약 40% 빨라지는 성능 향상을 확인했습니다.
본 논문은 오르토고널 가중치 초기화가 된 유한 너비 비선형 신경망의 안정성을 이론적으로 분석합니다. 저자들은 네트워크 통계에 대한 명시적인 레이어별 재귀 관계를 도출하고, 기존 i.i.d.-초기화 모델에 적용되던 Feynman 다이어그램을 확장하여 $1/ ext{width}$ 항까지 일반화했습니다. 이를 통해 오르토고널 초기화가 깊은 네트워크에서 안정성을 유지하는 이유를 수학적으로 설명하며, 이 이론적 결과를 수치 해석 및 몬테카를로 시뮬레이션으로 검증합니다.
본 논문은 그래프 표현 학습(GRL)의 안전성 문제를 다루며, 기존 연구가 주로 깨끗한 전이와 적응에 초점을 맞춘 한계를 지적합니다. 이를 해결하기 위해 GRL-Safety라는 다차원 안전성 평가 벤치마크를 제안했습니다. 이 벤치마크는 25개 데이터셋과 12가지 대표적인 GRL 방법을 사용하여 교란 내성, OOD 일반화, 공정성 등 5가지 안전 축을 포괄적으로 평가합니다.
본 논문은 강화학습(RL)을 활용하여 물리적 제약 조건을 고려한 로봇 모션 재목표(Retargeting) 프레임워크를 제안합니다. 기존 방법들이 겪던 미끄러짐이나 역학적 불가능성 같은 물리적 오류 문제를 해결하기 위해, 추적 정책 학습과 동시에 참조 모션을 로봇의 형태론에 적응시키는 이중 레벨 최적화(bilevel optimization) 방식을 사용했습니다. 이 프레임워크는 수동 튜닝 없이도 다양한 형태론에서 특징적인 운동을 보존하며 물리적으로 타당한 고품질 모션을 생성할 수 있음을 시뮬레이션 및 하드웨어 검증을 통해 입증했습니다.
LiVeAction은 웨어러블 또는 원격 감지 장치와 같이 대역폭 및 전력 제약이 있는 환경을 위해 설계된 경량화되고 다재다능하며 비대칭적인 신경 코덱입니다. 기존의 표준 코덱이나 생성 신경 코덱들은 특정 모달리티에 국한되거나 자원 소모가 커서 실용성이 떨어지는 한계가 있었습니다. LiVeAction은 FFT 유사 구조를 도입하여 인코더 복잡도를 줄이고, 적대적/지각 손실을 분산 기반 레이트 페널티로 대체하여 다양한 신호 모달리티에 적용 가능하면서도 우수한 성능과 낮은 전력 소모라는 두 마리 토끼를 잡았습니다.
UniPrefill은 대형 언어 모델(LLMs)의 긴 컨텍스트 처리 추론 효율성을 개선하기 위해 제안된 전역적인 Prefill 가속 프레임워크입니다. 기존 연구들이 희소 어텐션에만 집중되어 있어 다양한 아키텍처나 연속적 배치 환경에서 성능 저하를 겪고 통합이 어려웠던 문제를 해결합니다. UniPrefill은 모든 모델 아키텍처에 적용 가능하며, vLLM과 같은 현대 추론 엔진의 스케줄링 전략을 확장하여 Prefill-Decode 동시 처리 및 텐서 병렬 처리를 지원함으로써 Time-To-First-Token (TTFT)에서 최대 2.1배의 속도 향상을 달성합니다.
본 논문은 현대 LLM의 설계 선택 중 하나인 '토큰 인덱스 폐기' 문제에 주목하며, 이것이 희귀 토큰 과소 학습과 컨텍스트 붕괴라는 두 가지 구조적 실패를 초래한다고 지적합니다. 이를 해결하기 위해 TIDE(Token Identity Embedding)라는 새로운 아키텍처를 제안합니다. TIDE는 표준 트랜스포머에 '임베딩 메모리'를 추가하여, 토큰 인덱스를 컨텍스트와 독립적인 의미 벡터로 변환하고 이 정보를 모든 레이어에 주입함으로써 모델의 표현력을 강화합니다.
SEQUOR는 실제 대화에서 추출된 제약 조건으로 구성된 자동 멀티-턴 벤치마크입니다. 이 벤치마크는 모델이 장기간의 복잡한 대화 흐름 속에서도 사용자의 지시를 얼마나 일관성 있게 따르는지 평가합니다. 연구 결과에 따르면, 대화 시간이 길어질수록, 그리고 여러 제약 조건을 동시에 따라야 할 때 지시 준수 정확도가 현저하게 감소하는 경향이 관찰되었습니다.
본 논문은 트랜스포머의 핵심 토큰 혼합 메커니즘인 어텐션이 Nadaraya-Watson 회귀로 해석될 수 있음을 밝히고, 이를 기반으로 새로운 아키텍처 Cubit을 제안합니다. Cubit은 Kernel Ridge Regression (KRR) 의 폐쇄형 해를 활용하여 기존의 어텐션 계산 방식을 수정하고, 커널 유사성 및 역행렬을 통한 정규화를 결합했습니다. 실험 결과에 따르면, Cubit은 특히 시퀀스 길이가 길어질수록 트랜스포머 대비 더 강력한 장거리 시퀀스 모델링 능력을 보여줍니다.
본 논문은 극단적인 시퀀스 길이에서 인과 트랜스포머를 훈련할 때 발생하는 스케일된 점곱 주의(SDPA)의 시간 및 메모리 제약을 해결하기 위해 'Lighthouse Attention'이라는 새로운 계층적 주의 알고리즘을 제안합니다. 이 방법은 적응적 압축, 대칭 압축 전략을 통해 병렬성을 높이고, 쿼리, 키, 밸류를 동시에 풀링하여 효율성을 극대화했습니다. 또한, 대부분의 시간 동안 Lighthouse Attention으로 사전 훈련하고 짧은 과정으로 전체 주의 모델을 복원하는 2단계 훈련 접근법을 제시하여 성능과 속도를 모두 개선했습니다.
본 논문은 대규모 언어 모델(LLM)의 비효율적인 사전 학습 문제를 해결하기 위해 '토큰 중첩(Token Superposition, TST)'이라는 간단한 플러그인 방법을 제안합니다. TST는 기존의 병렬성, 옵티마이저 등 핵심 구성 요소를 변경하지 않으면서도 FLOPs당 데이터 처리량을 크게 향상시키는 것이 특징입니다. 이 방법은 연속된 토큰들을 하나의 '가방(bag)'으로 결합하여 훈련하고, 표준 훈련으로 복구하는 두 단계로 이루어지며, 실제 실험에서 최대 2.5배의 사전 학습 시간 단축 효과를 입증했습니다.
본 논문은 원격 인지 재활 세션의 대량 상호작용 데이터로부터 자동화된 임상 보고서를 생성하는 두 가지 접근법(규칙 기반 템플릿 시스템과 LLM 기반 접근법)을 비교합니다. 연구는 이 두 시스템이 임상 신뢰성, 일관성, 그리고 언어적 유창성 측면에서 어떤 트레이드오프를 보이는지 평가했습니다. 결과적으로, 템플릿 기반 시스템은 구조화된 보고서 작성에 강점을 보였으나, LLM은 더 간결하고 자연스러운 출력을 생성하는 것으로 나타났습니다.
FFDC(Future-Flow Decision Controller)는 World Action Models(WAM)이 미래 현실과의 일관성을 기반으로 예측된 행동을 실행할지 또는 조기에 재계획할지를 적응적으로 결정하게 해주는 경량 검증기입니다. 이 프레임워크는 고정된 청크 단위 실행 방식의 한계를 극복하고, 장기적인 효율성을 유지하면서 로봇 작업의 견고성(robustness)을 향상시킵니다. 그 결과, WAM의 순방향 패스 횟수를 크게 줄이고 실행 시간을 단축하며, 실제 로봇 및 비디오 생성 태스크에서 높은 성공률 개선을 보여줍니다.
HERMES++는 3D 장면 이해와 미래 기하학 예측을 단일 프레임워크로 통합한 통합 주행 세계 모델입니다. 이 모델은 두 가지 핵심 작업 모두에서 기존의 전문적인 접근 방식들보다 뛰어난 성능을 보여줍니다. 사용자는 프로젝트 페이지, 코드 저장소, 그리고 논문 링크를 통해 상세 정보를 얻을 수 있습니다.
FFDC(Flexible Fine-grained Dynamic Chunking)는 기존의 고정된 청크 실행 방식과 달리 적응형 액션 청킹을 가능하게 하여 장기적인 효율성을 유지하면서 견고성을 향상시킵니다. 이 기술은 WAM(World Action Model)의 순방향 패스 횟수를 69% 줄이고, RoboTwin 환경에서 실행 시간을 34% 단축하는 동시에 성공률을 35% 증가시키는 성능 개선을 보여줍니다.
본 기술 기사는 Qwen3.5 9B 모델을 MLX 프레임워크와 4비트 양자화(quantization)를 사용하여 구동했을 때의 성능 테스트 결과를 보여줍니다. 이 테스트는 다양한 Apple Silicon 칩셋(M5 Pro, M5 Max, M3 Ultra)에서 4096 토큰 컨텍스트 길이를 기준으로 측정되었으며, 각 하드웨어 사양에 따라 초당 생성되는 토큰 수(tok/sec)가 크게 달라지는 것을 확인할 수 있습니다.
사용자가 AI 및 자동화 에이전트 홈랩(HomeLab)의 하드웨어를 대폭 업그레이드했습니다. 기존 Mac Studio와 같은 시스템을 제거하고, 대신 Nvidia RTX Pro 6000 (96GB VRAM)과 AMD EPYC 7702 프로세서 등 고성능 워크스테이션급 부품으로 교체하여 AI 컴퓨팅 능력을 강화했습니다.