Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Age of LLM은 불확실한 환경(Fog of War)에서 에이전틱 AI의 추론, 외교, 신뢰성을 평가하는 새로운 1v1 벤치마크를 소개합니다. 단순 텍스트 생성을 넘어 상태 추적, 신념 관리, 행동 유효성 등 실제 에이전트 시스템의 핵심 능력을 검증합니다.
Hugging Face에서 주목받는 최신 AI 논문 트렌드를 분석하여 에이전트, 메모리, 비디오, 모바일 GUI 등 주요 연구 주제를 소개합니다. 특히 AI가 단순 답변을 넘어 환경과 상호작용하는 '행동하는 모델'로 진화하고 있음을 보여줍니다.
스마트 농업 마이크로그리드의 에너지 오케스트레이션을 위해 통신 오버헤드를 줄이는 희소 연합 표현 학습(SFRL) 기술을 제안합니다. 데이터의 내재적 희소성을 활용하여 압축된 특징만을 공유함으로써 대역폭 문제를 해결하고, 역 시뮬레이션을 통해 모델의 견고성을 검증합니다.
Eagle은 Mixture of Encoders(MoE) 구조를 활용하여 멀티모달 LLM의 설계 공간을 탐색하는 연구입니다. 다양한 인코더 조합을 통해 멀티모달 성능을 최적화하는 방법을 제안합니다.
Zhipu AI의 GLM-5.2가 Snowflake 코딩 벤치마크에서 Claude Opus 4.7과 대등한 성능을 기록했습니다. GLM-5.2는 Opus 대비 약 1/5 수준의 저렴한 비용을 제공하여 기업의 코딩 워크로드 조달 결정에 큰 영향을 미칠 것으로 전망됩니다.
RIFT-Bench는 그래프 기반의 2단계 파이프라인을 통해 45개의 에이전트 AI 시스템의 보안성을 평가하는 새로운 벤치마크입니다. 탐색과 스캐닝 단계를 통해 이질적인 에이전트 아키텍처 전반에 걸쳐 자동화된 레드팀 테스트와 완화 전략 평가를 지원합니다.
InferenceBench 리더보드를 통해 현재 가장 저렴한 AI 모델들의 비용과 성능을 분석합니다. Qwen 2.5 1.5B가 압도적인 가성비를 보여주며, Llama 3.2 3B는 품질, 비용, 속도의 균형이 뛰어난 모델로 평가됩니다.
OpenAI o3의 ARC-AGI-1 성과를 바탕으로 AGI 도달 여부를 분석합니다. 현재의 AI는 단순 챗봇을 넘어 프런티어 추론 및 에이전트 시스템 시대로 진입했으나, 인간 수준의 완전한 일반 지능에는 아직 도달하지 못했음을 논합니다.
Krea가 129억 파라미터 규모의 오픈 웨이트 이미지 모델인 Krea 2를 공개했습니다. 미세 조정용 Raw 모델과 고속 생성용 Turbo 모델 두 가지 버전을 제공하며, 상세한 기술 보고서를 통해 아키텍처와 데이터 큐레이션 과정을 투명하게 공개했습니다.
Anthropic의 Mythos AI가 정부 승인 테스트를 통해 단 몇 시간 만에 미국 정부 기밀 시스템의 취약점을 식별했습니다. 이는 AI가 고도의 공격적 사이버 능력을 갖출 수 있음을 보여주는 사례입니다.
Engram의 창업자들이 Sequoia 팟캐스트에서 AI의 기억과 지속적 학습(Continual Learning)의 중요성을 논의했습니다. RAG나 긴 컨텍스트 윈도우에 의존하기보다 지식을 모델 가중치에 직접 내재화하는 기술적 접근법을 제시합니다.
2026년 6월 출시된 주요 코딩 LLM 5종(Claude Opus 4.8, Claude Fable 5, GPT-5.5, GLM-5.2, Gemini 3.1 Pro)의 성능을 8개 벤치마크를 통해 비교 분석합니다. 각 모델의 SWE-bench Pro 점수, 비용 효율성, 라이선스 유형을 종합적으로 다룹니다.
다중 대조 MR 영상의 이미지 대 이미지 변환을 위해 CycleGAN과 UNIT 모델을 비교 분석한 연구입니다. 생성적 적대 신경망(GAN)을 활용하여 서로 다른 MRI 모달리티 간의 변환 성능을 평가합니다.
스마트 농업 마이크로그리드 환경에서 데이터 프라이버시를 보호하면서 에너지 흐름을 최적화하기 위한 프라이버시 보존형 능동 학습(Active Learning) 프레임워크를 제안합니다. 모델의 불확실성을 압축하여 전달하고 암호화된 원장을 통해 윤리적 감사 가능성을 확보하는 연구를 다룹니다.
지시어 튜닝(Instruction Tuning) 시 모델의 성능을 최적화하기 위해 모델 지향적인 방식으로 데이터를 선택하는 MoDS 방법론을 소개합니다.
SWE-RL은 Open SoftwareEvolution 환경에서 강화학습(RL)을 활용하여 LLM의 소프트웨어 엔지니어링 추론 능력을 향상시키는 연구를 다룹니다. 모델이 복잡한 소프트웨어 문제를 해결할 수 있도록 학습하는 방법론을 제시합니다.
DeepSeek-V4는 하이브리드 어텐션 메커니즘을 통해 이차적 연산 비용 없이 100만 토큰의 컨텍스트를 지원합니다. CSA와 HCA라는 두 가지 압축 전략을 사용하여 KV 캐시 효율성을 극대화하고 추론 FLOPs를 획기적으로 절감했습니다.
Florian Tramèr 교수가 경고하는 프롬프트 인젝션과 탈옥(Jailbreak) 공격의 위험성을 다룹니다. AI 에이전트가 외부 데이터를 처리할 때 발생하는 보안 취약점과 현대적 공격 기법의 진화 과정을 설명합니다.
Cognitive Pong은 AI 에이전트 간의 구조화된 경쟁과 토론을 통해 모델의 성능을 향상시키는 인지 아레나 프로젝트입니다. 에이전트가 서로의 추론을 검증하고 설득하는 과정을 통해 더 높은 품질의 합성 데이터를 생성하고 모델을 미세 조정하는 것을 목표로 합니다.
Zhipu가 출시한 오픈 웨이트 모델 GLM 5.2는 MoE 구조와 1M 컨텍스트를 지원하며, '추론 노력(reasoning effort)' 설정을 통해 비용과 성능을 조절할 수 있습니다. 사용자가 추론 강도를 최적화하면 최첨단 모델보다 저렴하고 정확한 코딩 및 에이전트 작업 수행이 가능합니다.