Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

OpenAI가 GPT-5.6 시리즈를 공식 출시했으나, 현재는 미국 정부의 요청에 따라 제한된 프리뷰 형태로만 제공됩니다. 성능 중심의 Sol, 가성비의 Terra, 고처리량의 Luna로 구성되어 있습니다.

희소 오토인코더(SAE)를 통한 모델 해석 가능성이 실제로는 모델의 취약성을 가릴 수 있다는 연구 결과를 다룹니다. 특정 특징을 제어하려는 시도가 모델의 경로 재설정으로 인해 무력화될 수 있음을 경고합니다.

분산 데이터플로우 환경에서 효율적인 상태 관리를 위한 경량 비동기 스냅샷 기술을 다룹니다. 시스템의 오버헤드를 최소화하면서 데이터 일관성을 유지하는 방법을 제안합니다.

월드 모델, 비디오 생성, 시각-언어-행동 정책(VLA)을 하나의 체계로 통합하여 분석한 서베이 논문입니다. 예측된 미래를 실제 행동으로 연결하는 100개 이상의 방법론을 구조화된 분류 체계로 제시합니다.

olmOCR 2는 수식과 표가 포함된 복잡한 PDF 문서를 Markdown 형식으로 정확하게 변환하는 기술입니다. 문서 구조를 유지하며 텍스트와 데이터를 추출하는 데 특화되어 있습니다.

Trex는 마이크로 트레이스(Micro-Traces)를 활용하여 바이너리로부터 실행 의미론(Execution Semantics)을 학습하는 새로운 연구 방법론을 제시합니다.
AI가 자율적으로 수행할 수 있는 소프트웨어 엔지니어링 작업의 범위를 측정하기 위해 MirrorCode 벤치마크를 구축했습니다. 이 벤치마크는 AI가 며칠 동안 장기적으로 코딩할 수 있는 능력을 평가하며, 최상위 모델들은 인간 엔지니어가 몇 주간 걸릴 작업을 완료하는 성과를 보였습니다.
Trishool AI가 Anthropic의 Constitutional AI 방식을 제품화하며, Alibaba Qwen의 가드 모델보다 훨씬 작은 0.8B 규모의 SOTA급 가드 모델을 개발 중임을 밝혔습니다. Bittensor 채굴자들의 탈옥 시도를 통해 모델의 견고함을 강화하는 연구를 진행하고 있습니다.
GPT-5.5의 환각 현상 증가, Cloudflare의 AI 에이전트용 임시 계정 도입, Anthropic의 Claude 신원 확인 등 AI 산업의 주요 동향을 요약합니다. 또한 AI 코딩의 검증 비용 문제와 신뢰할 수 있는 에이전트 시스템 구축을 위한 프레임워크를 다룹니다.
Z.ai의 오픈 웨이트 모델 GLM-5.2와 Anthropic의 Claude Opus를 성능, 비용, 기능 측면에서 비교 분석합니다. 벤치마크와 실제 WebGL 게임 제작 테스트를 통해 각 모델의 강점과 한계를 다룹니다.
AI가 수학적 정리를 증명하고 검증하는 'Big Mathematics' 시대의 도래와 그에 따른 수학자의 역할 변화를 다룹니다. Terence Tao는 AI를 인간의 능력을 증폭시키는 협력 도구로 정의하며, 기술적 진보와 수학적 이해의 본질 사이의 철학적 논쟁을 조명합니다.

오픈 웨이트 LLM과 폐쇄형 소스 LLM 사이의 성능 격차를 분석한 연구 결과입니다. 단일 벤치마크에서는 격차가 해소될 것으로 예측되나, 18개의 다양한 데이터셋을 종합 분석한 결과 모델의 성능 향상 양상은 측정 방식에 따라 상이하게 나타납니다.
NLP와 CV의 근간이 되는 Transformer 아키텍처의 공통점과 차이점을 분석합니다. 두 분야 모두 Self-Attention 메커니즘을 공유하지만, 데이터의 특성에 따라 스케일링 방식과 패러다임이 어떻게 달라지는지 설명합니다.
Transformer부터 DeepSeek-R1에 이르기까지 LLM의 발전을 다루는 주요 논문, 프레임워크, 도구들을 정리한 큐레이션 목록입니다. 학습 프레임워크, 추론 도구, 평가 리소스 및 교육 자료를 포괄적으로 제공합니다.

OPID는 에이전트가 자신의 사후 과잉 확신(hindsight)을 통해 학습하는 새로운 방법을 제안합니다. 계층적 기술을 완료된 궤적으로부터 직접 증류하여 추론 시 외부 메모리 없이도 높은 효율을 보여줍니다.
LLM의 추론 능력을 활용하여 네트워크 취약점에 실시간으로 적응하고 스스로 확산하는 '적응형 컴퓨터 웜'에 관한 연구입니다. 오픈 웨이트 모델을 사용하여 중앙 집중식 AI 안전 제어를 우회하며, 감염된 기기의 자원을 기생적으로 활용해 자율적인 공격을 수행합니다.
도심 항공 모빌리티(UAM)의 경로 계획을 위해 물리 법칙을 결합한 물리 증강 확산 모델(PADM)을 제안합니다. 이 모델은 확산 모델의 확률적 생성 능력과 물리 정보 신경망(PINNs)의 엄격한 제약 조건을 결합하여, 저전력 엣지 디바이스에서도 물리적으로 타당한 궤적을 생성합니다.

1B 규모의 소형 언어 모델이 연산 최적화된 테스트 시간 스케일링을 통해 405B 대형 모델의 성능을 능가할 수 있는지에 대한 연구를 다룹니다.

OpenAI가 GPT-5.6 시리즈인 Sol, Terra, Luna 3종 모델을 발표했습니다. 플래그십인 Sol은 에이전트 성능과 사이버 보안에서 압도적인 SoTA를 기록했으며, 용도에 따른 모델 라인업을 구축했습니다.
OpenAI가 Sol, Terra, Luna로 구성된 GPT-5.6 모델 시리즈를 발표하며 새로운 벤치마크 MirrorCode를 공개했습니다. 정부의 모델 승인 절차 도입과 Anthropic의 채용 전략 변화, OpenAI의 IPO 연기 검토 등 AI 산업의 규제 및 비즈니스 변화가 함께 다뤄졌습니다.