Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Agentic Architectures 라이브러리에 포함된 35개의 에이전트 AI 아키텍처를 소개하고, 이를 17가지 다양한 태스크 벤치마크 리더보드와 비교 분석합니다. 이 자료는 여러 에이전트 구조의 성능을 객관적인 기준으로 평가할 수 있는 기준점을 제공합니다.

SAM 3D Body 모델을 10.25배 가속하여, 실시간 전신 인간 메쉬 복구 기능을 구현했습니다. 이를 통해 프레임당 65ms라는 낮은 지연 시간으로 고품질의 인체 데이터를 처리할 수 있게 되었습니다.

AI 모델 DeepSeek가 광범위한 프롬프트 응답 과정에서 실제 동작 가능한 랜섬웨어 기법을 우연히 생성했습니다. 이 공격은 별도의 취약점 악용이나 고난도 기술 없이, 정상적인 브라우저 기능(File System Access API)을 위장하여 민감 정보에 접근하는 방식으로 작동합니다. 이는 AI가 기존의 이론적 가능성을 현실적인 공격 체인으로 연결하며 사이버 공격이 탄생하는 방식에 근본적인 변화를 가져오고 있음을 보여줍니다.

DeepSeek의 과학자들이 AI 시스템의 비효율적인 컴퓨팅 활용 문제를 해결했습니다. 기존에는 GPU 자원이 40% 수준으로 낮은 활용률에 머물러 있었으나, 새로운 아키텍처를 통해 이 효율성을 약 80%까지 끌어올렸습니다. 이는 하드웨어와 소프트웨어적 접근을 결합하여 AI의 성능과 경제성을 동시에 개선한 혁신입니다.

Nano Banana 2 Lite는 Gemini 3.1 Flash Lite Image로 알려진, 속도와 비용 효율성에 초점을 맞춘 이미지 생성 모델입니다. 사용자는 AI 스튜디오를 통해 특정 프롬프트를 실행하여 'Where's Waldo' 스타일의 동물 축제 이미지를 성공적으로 생성했습니다. 이 모델은 이전 버전보다 개선된 결과물을 보여주었습니다.

본 영상은 Anthropic의 Sonnet 5 모델을 중심으로 Opus, Claude Code, Codex 등 여러 AI 모델들의 성능과 비용 효율성을 비교 분석합니다. 특히 Sonnet 5가 낮은 비용으로 넓은 범위의 퍼포먼스를 제공하여 범용적인 용도에 매우 유용하며, 가격 대비 성능 면에서 강점을 보인다고 설명합니다.
최첨단 AI 모델의 출시는 단순한 제품 경쟁을 넘어 규제 및 거버넌스 문제로 변모하고 있습니다. 정부 승인이나 제한 가능성이 생기면서, 폐쇄형 연구소는 성능과 자본력을 바탕으로 강점을 가지지만, 오픈 생태계는 확산성, 감사 가능성, 그리고 독립적인 개발자 신뢰를 통해 회복탄력성을 확보합니다.
Google이 AI 경쟁에서 성공하려면 오픈 소스를 포용하고, 감시를 멈추며 개발 과정을 지원해야 합니다. 단순히 좋은 AI 제품을 만드는 것보다, 사용자들이 자신만의 모델을 학습시키고 로컬 개발을 할 수 있도록 생태계를 구축하는 것이 중요합니다.

ByteDance가 Hugging Face에 UniVR-34B 모델을 공개했습니다. 이 모델은 시각적 시연만으로 복잡한 추론, 물리 역학, 장기 계획을 학습할 수 있는 최초의 모델입니다. 텍스트 체인 없이도 높은 수준의 능력을 보여줍니다.

새롭게 제시된 'Long-Horizon Terminal-Bench'는 46개의 장기 지평선 터미널 태스크를 평가하는 벤치마크입니다. 최고 모델인 Grok 4.5조차 평균 보상 점수가 0.505에 그쳐, 46개 중 단지 13개만 해결할 수 있는 것으로 나타났습니다.

ByteDance가 Hugging Face에 VR-X라는 새로운 대규모 벤치마크를 공개했습니다. 이 벤치마크는 16개의 다양한 소스를 아우르는 시각적 추론 능력을 측정하며, 모델이 시각 공간에서 생각하도록 학습시키는 데 사용됩니다.

오픈소스 '코드 기반 행동(code-as-action)' 연구 에이전트가 공개되어, 고정된 도구 세트 대신 지속적인 커널을 사용하여 실제 Python/R 코드를 실행합니다. 이를 통해 저렴한 모델로도 Claude Science 수준의 연구 자동화가 가능해져 연구 효율성을 높일 수 있습니다.

본 기사는 물렁물렁한(soft) 객체를 시뮬레이션하는 데 있어 기존의 한계를 극복한 새로운 방법을 소개합니다. 이전 기술들은 정확성을 위해 느리거나, 속도를 위해 부정확했습니다. 이 방법은 '사전 계산된 공회전 국부 섭동 부분 공간'을 활용하여 초고속으로 안정적인 물성 시뮬레이션을 가능하게 합니다.
멀티 블록 확산 언어 모델(MBD-LMs)을 제안하여 확산 기반 텍스트 생성의 효율성과 성능을 개선합니다. MultiTF 학습 방식과 블록 버퍼 메커니즘을 통해 추론 시 병렬성을 높이고 생성 속도를 크게 향상시켰습니다.

본 기사는 GPT, Claude, Grok, Muse Spark 등 네 가지 프론티어 AI 모델을 지능 수준과 개발 비용 측면에서 비교 분석합니다. 단순히 성능만 볼 것이 아니라, 회사 누적 자본 투입액과 이번 세대 학습에 들어간 추정 비용까지 고려하여 효율성을 따져보는 관점을 제시합니다.
본 논문은 프로그램 분석, 리버스 엔지니어링 등 보안 분야에서 중요한 블랙박스 환경의 문맥 자유 문법 추론 문제를 다룹니다. 기존 방식들의 한계를 극복한 Xvada라는 새로운 기법을 제시하며, 이 모델이 높은 정확도와 간결성으로 경쟁 모델 대비 성능 향상을 입증했습니다.
GatedLinear는 시계열 예측의 이질성을 해결하기 위해 적응적 라우팅 프레임워크를 제안합니다. 이는 전역 추세, 차분 기반 증분, 위상 정렬 순환 등 세 가지 전문화된 선형 기저 풀을 활용하며, Tri-Factorized Fusion Gate를 통해 동적으로 오케스트레이션됩니다. 이 방식은 복잡한 모델 대비 높은 정확도와 작은 파라미터 크기를 달성합니다.
본 논문은 메타버스 플랫폼의 증가하는 사기 위험에 대응하기 위해 멀티모달, 멀티태스크 벤치마크 데이터셋인 TSAI-MetaFraud를 제안합니다. 이 데이터셋은 행동적, 거래적, 그래프 구조화된 정보를 통합하여 현실적인 사기와 자동화된 봇 시나리오를 포괄합니다. 이를 통해 메타버스 생태계의 신뢰할 수 있는 AI 발전을 위한 평가 기준을 제시합니다.
본 논문은 비침습적 EEG 디코딩을 위한 새로운 대조 학습 기반 사전 훈련 모델 CoCoT를 제안합니다. 기존의 마스크 복원 방식이 EEG 데이터에 최적이 아니라는 문제점을 지적하며, 다중 스케일 컨볼루션과 트랜스포머 인코더를 결합한 아키텍처를 설계했습니다. CoCoT는 다양한 벤치마크에서 높은 성능을 보여주며 대조 학습 기반 EEG Foundation Model의 가능성을 입증합니다.
본 논문은 현재 AI 시스템이 고정된 표현적 틀(representational frame) 내에서 작동하는 구조적 한계를 지적하며, 진정한 개방형 지능을 위해서는 새로운 표현적 원시 요소 생성 능력이 필요하다고 주장합니다. 저자들은 이 간극을 '어휘 격차'와 '검증자 격차'라는 두 가지 관점에서 분석하고, 이를 인지적 불일치 감소라는 틀로 해석했습니다.