Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 LLM이 긴 컨텍스트에 걸쳐 분산된 정보를 효과적으로 활용하는 데 어려움을 겪는 문제(어텐션 희석)를 해결하기 위해 FocuSFT라는 새로운 이중 레벨 최적화 프레임워크를 제안합니다. FocuSFT는 내부 루프에서 관련 콘텐츠에 주의를 집중시키는 매개변수 메모리를 형성하고, 외부 루프에서 이를 조건으로 SFT를 수행하여 모델의 장문 컨텍스트 능력을 향상시킵니다. 이 방법은 다양한 벤치마크에서 높은 정확도 개선을 보여주었습니다.
겉보기에는 모두 동일한 Type-C 케이블이지만 실제 성능은 천차만별이라 사용자들이 혼란을 겪기 쉽습니다. 이 글에서는 오픈소스 도구인 WhatCable을 소개하며, 이 도구가 시스템 포트 정보를 읽어 케이블의 실제 속도, 충전 전력, 연결 장치 등의 기능을 사용자 친화적인 언어로 쉽게 알려준다고 설명합니다. 특히 충전 진단 기능은 병목 지점을 정확히 파악하는 데 매우 유용하여, Mac 사용자들이 필수적으로 알아야 할 도구로 추천하고 있습니다.
Merlin은 대규모 데이터셋에서 발생하는 고질적인 중복성 문제를 해결하기 위해 설계된 로컬 우선의 컨텍스트 최적화 엔진입니다. 이 시스템은 SIMD 친화적인 해시 세트와 xxHash3-64를 결합하여 텍스트 구절과 데이터 청크에 대해 빠르고 바이트 단위로 정확한 중복 제거를 수행합니다. 특히 RAG(검색 증강 생성)와 같은 LLM 생태계에서 입력 데이터를 크게 줄이면서도 정보의 충실도를 유지할 수 있어, 대규모 언어 모델 추론 효율성을 획기적으로 개선하는 데 기여합니다.
TPU 8t는 이전 세대 TPU 대비 여러 면에서 상당한 발전을 이루었습니다. 주요 개선 사항으로는 SparseCore의 도입, VPU와 MXU의 중첩 및 균형 잡힌 스케일링이 가능해졌으며, 네이티브 4비트 FP4 지원을 통해 효율성이 높아졌습니다. 또한, Virgo 네트워크 토폴로지 채택과 향상된 스토리지를 통해 데이터 처리 능력과 확장성이 크게 증가했습니다.
본 논문은 대규모 언어 모델(LLM)의 출력에서 욕설이나 개인 식별 정보(PII)와 같은 원치 않는 콘텐츠를 효과적으로 제어하는 새로운 디코딩 전략인 NCO를 제안합니다. 기존 방식들이 가진 높은 계산 비용과 복잡한 다중 제약 조건 처리의 어려움을 해결하기 위해, NCO는 여러 하드 및 정규 표현식 제약을 온라인으로 효율적으로 매칭하고 추적하여 상태 폭발 없이 오버헤드를 줄입니다. NCO는 빔 서치나 소프트 마스킹 같은 표준 LLM 추론 기법과 완벽하게 호환되며, PII 및 욕설 필터링 등 실제 응용 분야에서 그 효과를 입증했습니다.
본 연구는 대규모 언어 모델(LLMs)의 사전 훈련 데이터에 내재된 노이즈가 모델 성능을 저하시키는 문제를 다루며, 이를 해결하기 위해 합성 데이터를 기반으로 하는 경량의 전(Pre)-사전 훈련(PPT) 단계를 제안합니다. 다양한 손상 설정에서 PPT를 거친 모델은 후속 사전 훈련 단계에서 노이즈 데이터에 대한 강건성을 일관되게 향상시키는 것으로 나타났습니다. 특히, 이 방법은 적은 양의 합성 데이터를 사용하여 자연어 텍스트의 토큰 사용량을 크게 줄이면서도 높은 성능을 유지할 수 있음을 입증했습니다.
본 연구는 MERLIN 복부 CT 벤치마크를 활용하여 'CT-IDP(CT Image-Derived Phenotypes)'라는 정량 표현형 프레임워크를 개발하고, 이를 Duke-Abdomen 및 AMOS 데이터셋에서 외부 평가했습니다. 이 프레임워크는 TotalSegmentator를 이용한 다기관 분할을 기반으로 형태 측정학적, 감쇠, 맥락적 소견 등 900개 이상의 장기/구획 수준 설명자를 추출합니다. 개발된 모델은 희소 로지스틱 회귀와 elastic-net 정규화를 사용하여 질병 분류에 적용되었으며, 기존의 비전 트랜스포머 기반 기준선 대비 우수한 성능(AUC 및 AP)을 입증했습니다.
본 연구는 LLM이 응답을 생성하는 동시에 사용자 음성을 듣고 반응해야 하는 전이중(Full-duplex) 음성 대화 시스템의 아키텍처 문제를 다룹니다. 기존 LLMs가 실시간으로 들어오는 스트리밍 입력을 처리하기 어렵다는 한계를 극복하기 위해, 연구진은 두 가지 주요 라우팅 전략인 채널 융합과 교차 어텐션 라우팅을 비교했습니다. 이 연구는 전이중 대화에서 사용자 입력의 효과적인 통합 방식을 제시하며, 의미론적 통합과 문맥 강건성 사이의 설계 트레이드오프에 대한 실질적인 지침을 제공합니다.
Vision-Language-Action (VLA) 모델은 다중 모드 입력 기반의 엔드투엔드 의사결정 정책을 제공하여 범용 로봇 제어에 활용됩니다. VLA 모델의 공유 및 적응이 증가함에 따라, 안전한 배포와 소유권 보호가 중요해졌습니다. 본 논문에서는 VLA를 위해 특별히 설계된 백도어 기반 소유권 검증 프레임워크인 GuardVLA를 제시하며, 이는 비밀 메시지를 주입하여 모델에 은밀하고 무해한 워터마크를 삽입합니다.
SemEval-2026 Task 8의 우승팀인 RaguTeam이 GPT-4o-mini를 기반으로 인스턴스당 7개의 다양한 LLM을 조합하는 '심사위원 주도 앙상블(Judge-led Ensemble)' 방식을 사용하여 대회에서 최고 성과를 거두었습니다. 이들의 접근 방식은 단순히 크기가 큰 초대형 모델들(120B급)의 성능을 능가했습니다. 또한, RaguTeam은 대규모 모델들과 경쟁할 수 있는 고성능 7B 전문 모델인 Meno-Lite-0.1도 공개하여 연구 커뮤니티에 기여했습니다.
테슬라 옵티머스 V3 양산 라인이 프리몬트에서 가동을 시작하며 로봇 공학 분야의 중요한 이정표를 세웠습니다. 기사는 물리 세계 자동화의 핵심 경쟁력이 GPU 성능 자체보다는 액추에이터와 센서 통합 능력에 있음을 지적합니다. 또한, AI 반도체 경쟁의 초점이 단순 연산 성능에서 데이터 이동 효율성으로 변화하고 있으며, 이는 메모리-프로세서 간 데이터 전송 과정이 에너지 및 시간 소모의 주요 원인이기 때문입니다.
본 논문은 중세 오키탄어, 카탈루냐어, 프랑스어 등 세 가지 중세 로망스 언어에 대한 품사(POS) 태깅의 어려움을 다루며, 전통적인 규칙 기반/통계적 태거와 최신 LLM을 비교 평가합니다. 연구는 제로샷, 퓨샷 프롬프팅, 파인튜닝, 교차 언어 전이 학습 등 다양한 환경에서 실험한 결과, LLM 기반 접근 방식이 우수한 성능을 보였음을 입증했습니다. 특히 자원이 부족한 방언에 대한 교차 언어 전이 학습과 표적화된 이중 언어 훈련의 효과가 강조되며, 이는 역사적 NLP 연구를 위한 실질적인 지침을 제공합니다.
본 논문은 CNN 훈련에서 레이어별로 다른 정규화 강도가 필요하다는 점에 착안하여, 과적합-과소적합 지표(OUI)를 활용한 적응형 가중치 감쇠 스케줄러인 OUIDecay를 제안합니다. OUIDecay는 각 레이어의 활성화 패턴을 온라인으로 모니터링하고, 이 정보를 기반으로 네트워크 내 다른 레이어들과 상대적으로 가중치 감쇠를 주기적으로 재조정합니다. 이는 검증 데이터 없이도 구조적 동작에 기반한 효과적인 적응형 정규화 방법이며, 다양한 CNN 아키텍처에서 기존 방식 대비 우수한 성능을 입증했습니다.
본 논문은 기존 신호등 제어 시스템의 비효율성 문제를 해결하기 위해 심층 강화학습(DRL) 기반의 새로운 에이전트를 제안합니다. 이 에이전트는 차량과 보행자 교통 모두를 고려하여 공정성을 명시적으로 통합함으로써, 실시간 수요 변화에 따라 흐름을 동적으로 균형 있게 조정할 수 있습니다. 실험 결과는 이 시스템이 교통 혼잡을 효과적으로 줄이는 동시에 모든 도로 이용자에게 공평한 서비스를 제공함을 입증하며, 스마트 시티의 지능형 교통 관리에 기여합니다.
LTX Video Mac은 Apple Silicon을 위해 설계된 네이티브 AI 비디오 생성 애플리케이션입니다. 이 앱은 SwiftUI 인터페이스와 MLX 프레임워크를 활용하여 텍스트 설명만으로 동기화된 오디오가 포함된 고품질 비디오 클립을 완전히 로컬 환경에서 생성합니다. 사용자는 다양한 스타일의 배경 음악 레이어링, 이미지-투-비디오 변환, 그리고 Gemma 기반의 프롬프트 향상 기능 등을 활용하여 전문적인 AI 비디오 콘텐츠를 쉽게 제작할 수 있습니다.
본 기사는 우크라이나어 다중 도메인 문서 이해를 목표로 하는 UNLP 공유 과제에 참여하여 개발된 검색 증강 생성(RAG) 파이프라인을 소개합니다. 이 시스템은 컨텍스트 청킹, 질문 인식 밀집 검색, 그리고 질문과 답변 옵션을 모두 고려하는 재순위 지정 단계를 포함합니다. 특히, Qwen3-Embedding-8B와 미세 조정된 Qwen3-Reranker-8B를 사용하여 검색 및 순위를 개선하고, 이를 통해 높은 답변 정확도(최대 0.9674)와 리더보드 점수(비공개 0.9598)를 달성했습니다.
Mojo 1.0 베타 버전 출시로 인해, 파이썬과 같은 친숙한 문법을 유지하면서도 C++ 수준의 고성능을 구현하는 언어 생태계가 본격화되고 있습니다. Mojo는 사용자에게 익숙한 인터페이스를 제공하지만, 실제로는 CPU와 GPU 등 하드웨어 레벨까지 직접 접근하여 최적화된 성능을 제공하는 것이 특징입니다.
최근 3D Gaussian Splatting과 같은 혁신적인 기술의 등장은 부동산 산업의 전통적 구조를 근본적으로 변화시키고 있습니다. 이 기술은 단 하나의 전화기만으로 집 전체를 몇 초 만에 스캔하여 고품질 디지털 데이터로 변환할 수 있게 함으로써, 기존에는 필요했던 값비싼 장비나 전문 인력 없이도 현실 공간을 디지털화하는 것이 가능해졌습니다. 이는 부동산 중개 및 검사 과정의 비용 구조와 효율성을 혁신적으로 개선할 잠재력을 가지고 있습니다.
중국 개발자들이 로컬 환경에서 24시간 자율적으로 작동하는 오픈소스 AI 에이전트를 공개했습니다. 이 에이전트는 코딩, 영상 제작 등 다양한 작업을 클라우드 의존성 없이 오직 사용자 컴퓨터의 자원만으로 수행할 수 있습니다. 이는 API 비용 걱정 없이 무한 동력으로 높은 생산성을 제공함으로써 기존 에이전트 시장의 판도를 바꿀 잠재력을 가지고 있습니다.
본 저장소는 GPT와 같은 대규모 언어 모델(LLM)을 처음부터 끝까지 직접 개발하고 학습시키는 과정을 담고 있는 공식 코드 저장소입니다. 이 코드는 『Build a Large Language Model (From Scratch)』이라는 책의 내용을 구현하며, 사용자가 LLM의 내부 작동 원리를 깊이 이해할 수 있도록 돕습니다. 단순히 이론만 배우는 것이 아니라, 데이터 처리부터 어텐션 메커니즘 구현, GPT 모델 구축, 사전 학습 및 미세 조정(Finetuning)에 이르는 전 과정을 코드로 직접 경험하게 할 수 있습니다.