Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 기존 GPU 스케줄러가 LLM 에이전트의 연쇄 호출(워크플로우)을 독립적으로 취급하여 발생하는 심각한 지연 시간 증가 문제를 해결하기 위해 'SAGA'라는 새로운 분산 스케줄러를 제안합니다. SAGA는 개별 추론 호출 대신 전체 에이전트 워크플로우 자체를 스케줄링 단위로 간주하는 프로그램 수준의 접근 방식을 채택했습니다. 이를 통해 KV 캐시 재사용을 최적화하고, 세션 친화적인 배치 및 공정한 자원 할당 메커니즘을 구현하여, 기존 시스템 대비 작업 완료 시간을 크게 단축시키고 GPU 메모리 활용도를 개선함을 입증했습니다.
본 기사는 소비자 하드웨어에서 대규모 언어 모델(LLM)을 추론하는 현황과 관련된 기술적 과제들을 분석합니다. Nvidia와 Apple Silicon 생태계를 비교하며, LLM 배포를 위한 아키텍처별 트레이드오프를 제시합니다. 핵심적으로, Nvidia는 높은 처리량을 제공하지만 복잡한 런타임 제약 조건(지연 시간 vs. 생성 속도)과 VRAM 한계에 직면하는 반면, Apple은 통합 메모리 구조(UMA) 덕분에 대규모 모델을 효율적으로 확장하고 전력 효율성에서 우위를 점합니다.
A11y-Compressor는 GUI와 상호작용하는 AI 에이전트가 신뢰할 수 있는 관측 표현을 얻도록 돕는 프레임워크입니다. 기존의 접근성 트리는 중복성이 높고 공간적 구조 정보가 부족하다는 단점이 있습니다. 이 프레임워크는 시각적 컨텍스트 재구성 및 중복 감소를 통해 선형화된 접근성 트리를 컴팩트하고 구조화된 표현으로 변환하며, 이를 통해 OSWorld 벤치마크에서 토큰을 크게 줄이고 에이전트의 작업 성공률을 개선하는 성능을 입증했습니다.
본 논문은 자연어 지시사항을 시각적 좌표로 매핑하는 GUI 그라운딩 문제를 해결하기 위해 오패olicy 자기 증류(OPSD) 프레임워크를 제안합니다. 특히, GUI-SD라는 새로운 방법을 통해 목표 경계 박스와 가우시안 소프트 마스크를 활용하여 풍부한 우선 맥락을 생성하고, 엔트로피 기반 증류로 토큰에 적응적으로 가중치를 부여하는 것이 특징입니다. 광범위한 실험 결과, GUI-SD는 기존의 GRPO 기반 방법보다 정확도와 학습 효율성 모두에서 우수한 성능을 입증했습니다.
AdaMeZO는 대규모 언어 모델(LLM)의 파인튜닝 과정에서 발생하는 높은 GPU 메모리 요구 문제를 해결하기 위해 제안된 새로운 옵티마이저입니다. 기존의 Adam과 같은 표준 옵티마이저는 모멘트 추정을 위해 많은 메모리를 필요로 하며, MeZO와 같은 효율적인 방법은 손실 지형 탐색 능력이 부족하다는 단점이 있었습니다. AdaMeZO는 메모리에 모멘트를 유지하지 않으면서도 Adam 스타일의 1차 및 2차 모멘트 추정 기능을 활용하여, 높은 성능과 낮은 메모리 요구량을 동시에 달성하는 것을 목표로 합니다.
본 논문은 대형 비전-언어 모델(LVLMs)의 추론 과정에서 발생하는 과도한 GPU 메모리 오버헤드를 해결하기 위해 LightKV라는 새로운 KV 캐시 경량화 기법을 제안합니다. LightKV는 텍스트 프롬프트에 의해 안내되는 교차 모달리티 메시지 전달 방식을 활용하여 비전 토큰 간의 중복성을 효과적으로 포착하고, 사전 채우기 단계에서 점진적으로 KV 캐시를 압축합니다. 실험 결과, LightKV는 원본 비전 토큰의 55%만으로도 KV 캐시 크기를 절반으로 줄이고 연산량을 최대 40% 감소시키면서도 기존 성능을 유지하는 뛰어난 효율성을 입증했습니다.
본 논문은 저선량 컴퓨터 단층 촬영(low-dose CT)에서 발생하는 노이즈 제거 문제를 해결하기 위해 딥러닝 기반의 무감독(unsupervised) 프레임워크를 제안합니다. 이 프레임워크는 U-Net 구조, 주의 메커니즘, 잔여 네트워크 등을 결합하고 감각 손실을 도입하여 다중 스케일 특징 추출과 변환을 수행합니다. 특히 실제 임상 데이터의 감독 학습 한계를 극복하면서도 우수한 성능을 보여 영상 의사로부터 높은 평가를 받았습니다.
AI 수요 증가로 인한 공급난이 GPU를 넘어 CPU까지 확산되며 반도체 시장의 구조적 변화가 감지되고 있습니다. 삼성전자는 사상 최대 실적을 기록했으나, 이 수익의 대부분은 메모리 및 HBM에 집중되어 있어 '단일 사업부 의존'이라는 위험성을 안고 있습니다. 특히 파운드리 부문은 수주 규모는 크지만 2nm 공정의 낮은 수율(60%p)로 인해 양산 단계에서 임계점에 근접한 위태로운 상황입니다. 따라서 향후 삼성전자의 성패는 메모리 슈퍼사이클 모멘텀과 더불어 파운드리 2nm 공정의 수율 안정화 여부가 결정적인 변수가 될 것입니다.
이 글은 아이폰을 개인용 오프라인 OCR 서버로 활용할 수 있는 오픈소스 프로젝트를 소개합니다. 기존 온라인 OCR 서비스의 프라이버시 문제, 사용량 제한, 네트워크 지연 등의 단점을 해결하며, 애플 Vision Framework 기반으로 높은 정확도와 다국어 지원 기능을 제공합니다. 이 솔루션은 모든 처리가 로컬에서 이루어져 데이터 유출 위험이 전혀 없으며, API 인터페이스를 통해 워크플로우에 쉽게 통합할 수 있습니다.
이 기술 기사는 여러 AI 코딩 어시스턴트가 사용하는 훈련 데이터를 추출하는 방법을 다룹니다. 제공된 GitHub 링크를 통해 사용자들이 다양한 코드 생성 모델의 학습 데이터에 접근할 수 있도록 합니다.
AMD의 차세대 Strix Halo(Gorgon halo 495 max)가 기존보다 훨씬 많은 메모리를 탑재할 것으로 예상되며, 특히 192GB 또는 그 이상의 대용량 메모리 옵션이 주목받고 있습니다. 이처럼 증가된 메모리는 현재 실행하기 어려웠던 거대한 MoE 모델이나 최신 LLM을 더 큰 컨텍스트로 구동하는 데 핵심적인 역할을 할 것으로 보입니다.
이 기사는 파이썬(Python) 의존성 없이 Apple Silicon 칩에서 대규모 언어 모델(LLM)을 로컬로 실행하는 방법을 소개합니다. 이를 통해 사용자는 복잡한 환경 설정이나 특정 프로그래밍 언어에 대한 지식 없이도 강력한 AI 기능을 자신의 Mac 장치에서 활용할 수 있습니다. 이는 개인 정보 보호와 인터넷 연결의 제약으로부터 자유로운 온디바이스(on-device) AI 구현을 가능하게 합니다.
Nvidia가 Nemotron 3 Nano Omni 모델을 출시했으며, 사용자는 Hugging Face Spaces에서 해당 데모를 확인할 수 있습니다. 이 모델은 최신 AI 기술의 발전상을 보여주며, 개발자들이 쉽게 접근하여 테스트해 볼 수 있도록 Gradio 앱 형태로 제공되었습니다.
이 기사는 대규모 언어 모델(LLM), 검색 증강 생성(RAG), 그리고 AI 에이전트와 관련된 실무적인 AI 엔지니어링 면접 질문 모음을 제공합니다. 이 자료는 LLM을 활용하여 실제 애플리케이션을 구축하고 배포하는 데 필요한 이론적 지식과 문제 해결 능력을 평가하는 데 초점을 맞추고 있습니다. 면접 준비생들은 단순히 개념을 아는 것을 넘어, 시스템 설계, 최적화, 그리고 복잡한 워크플로우를 구현할 수 있는 깊이 있는 이해가 필요합니다.
Trailarr는 미디어 라이브러리를 위한 로컬 트레일러를 다운로드하고 관리하는 오픈소스 도커 앱입니다. 이 버전(v0.9.0)에서는 Plex와의 연동이 강화되어, Radarr/Sonarr 없이도 Plex OAuth를 통해 통합되었습니다. 이를 통해 Plex Pass 트레일러 감지 및 최소 해상도 설정 등 고급 기능을 제공하며, 라이브러리 스캔 알림까지 전송할 수 있습니다.
Hermes를 다음 세대 에이전트 시스템으로 진화시키기 위해 자동 백업, 기억 시각화, 소설 공장 등 다양한 기능을 추가했습니다. 전 세계 프로그래머들이 이 프로젝트에 참여하여 '시각적 뇌', '창작 공장', '보안 수호자' 등의 역할을 부여하며 그 역량을 확장하고 있습니다. 최근 발견된 새로운 기능들은 AI 분야의 발전을 가속화할 것으로 기대됩니다.

하버드 연구진의 최신 연구에 따르면, AI 시스템이 응급실 환경에서 인간 의사의 진단 능력을 능가하는 획기적인 결과를 보여주었습니다. 특히 최소한의 정보만으로 빠른 결정을 요구하는 초기 트리아지(triage) 상황에서 AI는 평균 67%의 높은 정확도를 기록하며 인간 의사(50-55%)보다 우위를 점했습니다. 또한, 장기 치료 계획 수립과 같은 복잡한 임상 추론 영역에서도 AI가 더 나은 결과를 보여주었으나, 연구진은 AI가 의사를 대체하기보다는 '의사-환자-AI'라는 새로운 삼각적 돌봄 모델을 구축하는 데 기여할 것이라고 강조했습니다.
본 기술 기사는 마이크 입력부터 스피커 출력까지의 전체 음성 에이전트 파이프라인을 처음부터 구축하는 방법을 안내합니다. 이 과정은 Whisper를 이용한 STT, 로컬 GGUF LLM 처리, Kokoro를 사용한 TTS 등 여러 단계를 포함하며, 모든 단계가 스트리밍 방식으로 작동하여 실제 대화와 같은 낮은 지연 시간을 구현하는 것이 핵심입니다.
llama.cpp의 v0.0.252 버전이 릴리스되었습니다. 이번 업데이트는 Mistral 포맷에 apply_scale 지원을 추가하는 등 다양한 기능 개선과 버그 수정을 포함합니다. 특히, macOS, Linux, Android, Windows, openEuler 등 광범위한 플랫폼에서 CPU, GPU(CUDA, Vulkan, ROCm, OpenVINO 등), 그리고 아키텍처별 최적화된 빌드를 제공하여 사용자 접근성과 성능을 크게 향상시켰습니다.
본 논문은 루크셈부르크의 다언어 사회에서 나타나는 '언어 이데올로기'를 탐지하는 데 대규모 언어 모델(LLM)을 활용하는 방법을 제시한다. 연구진은 Luxembourgish 사용자 댓글 데이터셋을 수동으로 주석화하고, 다양한 프롬프트 조건 하에서 LLM의 성능을 평가하여 인간의 주석 능력을 모방할 수 있는지 검증했다. 또한, 소규모 언어인 Luxembourgish 데이터를 고자원 언어로 기계 번역하는 것이 이데올로기 탐지 작업에 미치는 영향도 분석하였다.