Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Anthropic이 에이전트 워크플로에 특화된 새로운 모델 'Fable'(Claude Mythos의 공개 버전)을 출시했습니다. Opus 가격의 2배로 책정되었으며, 강력한 안전 제한을 통해 사이버 보안 오용 위험을 관리하면서도 높은 작업 신뢰성을 제공하는 데 집중합니다.
Flash Attention은 트랜스포머 모델의 어텐션 연산 시 발생하는 메모리 대역폭 병목 현상을 해결하기 위한 기술입니다. HBM 대신 빠른 SRAM을 활용한 타일링(Tiling) 기법을 통해 불필요한 데이터 이동을 최소화하고 연산 속도를 2-4배 향상시킵니다.
Anthropic의 신규 모델 Claude Fable 5와 Mythos 5 출시 소식을 다룹니다. Fable 5는 코딩과 추론 벤치마크에서 최상위 성능을 보이며, Mythos 5는 사이버 보안 특화 폐쇄형 모델로 출시되었습니다.
에이전트의 성공률을 예측하는 새로운 스케일링 법칙인 유효 피드백 연산(EFC)을 소개합니다. 단순 연산량보다 피드백의 품질이 에이전트 성능 향상의 핵심임을 입증하며, 네 가지 품질 축을 통해 이를 정량화합니다.
Kwai의 Keye-VL-2.0 기술 보고서에 관한 내용입니다. 해당 모델의 기술적 상세 사항과 연구 결과를 다루고 있습니다.
중국 AI 스타트업 Stepfun이 초당 416 토큰의 속도를 자랑하는 Step 3.7 Flash를 출시했습니다. 이 모델은 Claude 코딩 능력의 97%를 유지하면서도 비용은 1/9 수준으로 낮춰 효율성을 극대화했습니다.
수학 공식에 대한 깊은 이해를 목적으로 설계된 사전 학습된 모델인 MathBERT를 소개합니다. 수학적 구조와 기호를 효과적으로 처리하기 위한 연구 내용을 담고 있습니다.
LLM의 법률적 추론 능력을 평가하기 위해 IRAC(쟁점, 규칙, 적용, 결론) 구조를 활용한 LLM-as-a-judge 프레임워크를 소개합니다. 단순 결과의 정답 여부를 넘어, 추론 과정의 타당성을 정확성과 분석이라는 두 가지 차원에서 정밀하게 검증하는 방법을 다룹니다.
GUI-VLA 에이전트인 Mano-P의 3단계 학습 파이프라인을 소개합니다. SFT를 통한 기초 역량 확보, Offline RL을 통한 궤적 학습 과정을 통해 엣지 디바이스에서도 효율적으로 동작하는 고성능 모델 구축 방법을 다룹니다.
Anthropic이 Mythos급 성능을 갖춘 Claude Fable 5를 출시했습니다. 이 모델은 안전 분류기가 적용된 대중용 버전인 Fable 5와 특정 전문가를 위한 미필터링 버전인 Mythos 5로 구분되어 제공됩니다.
세그멘테이션 모델의 품질을 예측하기 위해 불확실성 추정(Uncertainty Estimation) 기술을 활용하는 방법을 다룹니다. 모델이 생성한 결과물의 신뢰도를 정량화하여 품질을 평가하는 연구적 접근을 제시합니다.
Claude Opus 4.8이 기술 컨텍스트 벤치마크에서 95%를 기록하며 LLM 리더보드 1위를 차지했습니다. Opus 4.7 및 Cursor의 Composer 2.5 Fast보다 높은 성능을 보였으나, 실행 속도는 가장 느린 것으로 나타났습니다.
LLM에 주입된 '나쁜 기억'이 에이전트의 의사결정에 미치는 영향을 탐구한 실험 연구입니다. 실험 결과, 과거의 실패 기록은 AI의 위험 선호도를 낮추는 경향을 보였으나, 논리 및 수학적 정확도에는 영향을 주지 않았습니다.
Anthropic의 신규 모델 Claude Fable 5의 기술적 아키텍처와 성능을 심층 분석합니다. 장기 지평 에이전트 실행 능력과 멀티 에이전트 오케스트레이션, 그리고 논란이 된 '침묵의 안전장치' 시스템을 다룹니다.
XBOW가 Anthropic의 Mythos Preview 모델을 보안 분야에서 테스트한 결과, 소스 코드 감사 및 역공학 성능이 크게 향상되었습니다. 다만 실시간 검증을 위해서는 외부 오케스트레이션이 필요하며, 높은 비용으로 인해 멀티 모델 접근 방식이 권장됩니다.
RobustART는 아키텍처 설계 및 학습 기법의 강건성을 평가하기 위한 벤치마킹 연구를 다룹니다. 모델의 안정성을 측정하는 새로운 기준을 제시합니다.
Google의 Gemma 4 12B 출시와 Anthropic의 Claude Fable 5 공개 소식을 다룹니다. Gemma 4는 로컬 환경에서 효율적인 멀티모달 추론을 지원하며, Claude Fable 5는 장기적인 자율 작업을 수행하는 에이전트 역량에 집중합니다.
예측 및 이상 탐지 분야에서 대규모 언어 모델(LLM)의 활용을 다룬 체계적 문헌 고찰 논문입니다. LLM이 시계열 데이터 분석 및 이상 징후 포착에 어떻게 적용되는지 연구 동향을 분석합니다.
OpenAI의 추론 모델이 80년 된 수학 난제를 해결하며 AI의 연구 역량을 입증한 가운데, 수학계는 '라이덴 선언'을 통해 AI 연구의 윤리적 기준과 공공성을 촉구하고 있습니다. 이 선언은 AI가 생성한 증명의 검증 문제와 기업 중심의 연구 편향성에 대한 우려를 담고 있습니다.
Anthropic의 신규 모델 Claude Fable 5가 출시되어 SWE-bench에서 압도적인 성능을 기록했습니다. GPT-5.5 및 Opus 4.8과의 벤치마크 성능, 가격, 비용 효율성을 비교 분석하여 사용자의 목적에 맞는 모델 전환 가이드를 제공합니다.