Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
SIA는 모델 에이전트가 태스크 특화 에이전트의 harness와 가중치를 모두 업데이트하며 성능을 자율적으로 향상시키는 자기 개선 프레임워크입니다. Meta, Target, Feedback 에이전트 간의 제어 흐름을 통해 LawBench, GPU 커널 최적화 등 다양한 분야에서 획기적인 성능 향상을 입증했습니다.
DiscoGrad는 분기(branching)와 무작위성이 포함된 C++ 프로그램에서 매끄러운 기울기를 계산할 수 있도록 자동 미분을 지원하는 연구용 프로토타입 도구입니다. 외부 섭동을 통한 평활화 기법을 사용하여 기존 자동 미분의 한계를 극복하고 최적화 성능을 높입니다.
NAACL 2024에 채택된 PlanRAG는 LLM이 의사 결정자로서 먼저 계획을 세운 뒤 검색을 수행하는 'Plan-then-Retrieval' 방식을 제안합니다. 관계형 및 그래프 데이터베이스 환경에서 기존 RAG 방식보다 향상된 성능을 목표로 합니다.
에이전트 학습 및 평가를 지원하는 Agents 2.0 프레임워크를 출시했습니다. 신경망의 역전파 원리를 언어 에이전트 파이프라인에 적용하여 기호 학습(Symbolic Learning)을 구현합니다.
MultiHop-RAG는 RAG 파이프라인에서 문서 간 검색 및 추론 능력을 평가하기 위한 새로운 QA 데이터셋입니다. 2,556개의 쿼리를 포함하며, 메타데이터를 활용해 실제 서비스의 복잡한 시나리오를 반영합니다.
OpenAI가 발표한 새로운 모델 GPT 5.2의 성능과 벤치마크 결과에 대해 분석합니다. 특히 GPQA 벤치마크에서 전문가 수준의 성능을 기록하며 SOTA를 달성했다는 점과 그 측정 방식의 특이점을 다룹니다.
2025년 AI 트렌드인 추론 모델(Reasoning models)의 발전과 그에 따른 벤치마크 성능 향상, 그리고 스케일링 법칙의 현재 위치를 분석합니다. 모델이 더 오래 생각함으로써 정확도는 높아지지만 출력의 다양성은 감소할 수 있는 패러다임의 변화를 다룹니다.
Google의 Gemini 3 Flash 출시와 함께 Gemini 모델의 비약적인 성능 향상을 분석합니다. Gemini 3 Flash는 이전 세대의 Pro 모델을 능가하는 수학, 코딩, 추론 능력을 보여주며 Proto-AGI로 향하는 기술적 진보를 시사합니다.
BigCodeBench는 LLM의 실질적인 프로그래밍 능력을 평가하기 위해 설계된 새로운 벤치마크입니다. HumanEval보다 복잡한 지시어와 다양한 함수 호출을 포함하며, 실제 소프트웨어 공학 작업에 가까운 환경을 제공합니다.
Anthropic의 Claude Opus 4.6과 OpenAI의 GPT 5.2가 동시에 출시되며 치열한 경쟁이 시작되었습니다. 두 모델의 벤치마크 성능과 AI 연구 자동화 가능성에 대한 Anthropic 내부의 상반된 견해를 심층 분석합니다.
SCAIL-2는 중간 포즈 표현 없이 드라이빙 비디오를 통해 캐릭터를 애니메이션화하는 오픈 소스 모델입니다. 통합 모션 전송 인터페이스를 통해 캐릭터 교체 및 다중 캐릭터 시나리오를 지원하며, 동물 드라이빙과 같은 창발적 능력을 보여줍니다.
Gemini 3.1 Pro 출시와 함께 기존 벤치마크 점수와 실제 체감 성능 사이의 괴리가 발생하는 '바이브(Vibe)' 시대의 도래를 분석합니다. 사후 학습(Post-training)의 중요성이 커지면서 특정 도메인에 특화된 모델 성능이 일반 벤치마크와 다르게 나타날 수 있음을 설명합니다.
3Blue1Brown의 영상을 통해 '털이 난 공 정리(The Hairy Ball Theorem)'의 개념과 수학적 증명을 다룹니다. 이 정리가 게임 개발 시 비행기 모델의 회전 방향을 결정하는 등 실질적인 기하학적 문제에 어떻게 적용되는지 설명합니다.
OpenAI의 새로운 모델 GPT 5.4 출시와 그 성능에 대한 분석을 다룹니다. GDP Val 벤치마크를 통해 화이트칼라 직업군에서의 성능을 검증했으나, 모델의 치명적 오류와 벤치마크의 한계점도 함께 지적합니다.
M.C. 에셔의 작품 '프린트 갤러리'에 담긴 기하학적 역설과 자기 완결적 루프를 수학적으로 분석하고 시각화합니다. 에셔의 예술적 직관이 수학적 개념과 어떻게 맞닿아 있는지 탐구하며, 확산 모델(diffusion model)이 해결하지 못하는 모호성의 영역을 다룹니다.
OpenAI와 Anthropic의 차기 AI 모델 출시 전망과 이에 따른 컴퓨팅 자원 확보 전략을 다룹니다. 또한, 인간과 AI의 지능 격차를 보여주는 새로운 벤치마크 Arc-AGI-3의 결과와 Anthropic의 정부 계약 재개 가능성을 분석합니다.
Claude 4.6 Opus가 Linux 커널의 list.h 코드를 거의 완벽하게 재현할 수 있음을 실험을 통해 증명했습니다. 이는 모델 학습 과정에서 GPL 라이선스 코드가 단순 변형을 넘어 원본을 그대로 포함하고 있을 가능성을 시사합니다.
Google이 Apache 2.0 라이선스를 채택한 완전한 오픈소스 LLM인 Gemma 4를 출시했습니다. Gemma 4는 혁신적인 압축 기술인 Turboquant를 통해 모델 크기를 획기적으로 줄이면서도 높은 지능을 유지하여, 로컬 환경 및 에지 기기에서도 효율적인 구동이 가능합니다.
Anthropic의 최신 모델인 Claude Mythos의 출시 보고서를 분석한 내용입니다. 이 모델은 강력한 성능과 보안 취약점 탐지 능력을 갖추었으나, 그 위험성으로 인해 대중 공개 대신 기업 대상 제한적 출시가 결정되었습니다.
Anthropic이 발표한 Mythos 모델의 강력한 성능과 그에 따른 보안 위협을 분석합니다. 이 모델은 제로데이 취약점을 찾아내는 능력이 탁월하여 사이버 보안 및 국가 안보에 심각한 영향을 미칠 수 있다는 우려를 낳고 있습니다.