Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

부정 탐지 시스템의 임계값 설계와 인간의 도덕적 판단 사이의 구조적 유사성을 탐구합니다. 환경의 비용 비대칭성에 따라 최적의 판단 기준이 결정되는 원리를 통해 AI 어라이먼트의 본질을 설명합니다.

Claude Fable 5와 Opus 4.8을 대상으로 게임 설계서 리뷰 성능을 비교한 실험 결과입니다. Fable 5는 통계적 오류를 자발적이고 우선적으로 지적한 반면, Opus 4.8은 명시적 질문 후에야 개선 사항으로 언급하는 차이를 보였습니다.

SIA(Self-Improving AI with Harness & Weight Updates) 논문을 통해 모델의 잠재 능력을 인출하는 elicitation과 능력을 직접 획득하는 acquisition의 차이를 분석합니다. 검증기(verifier)의 유무가 자기 개선의 실질적 성패를 결정하는 핵심 요소임을 강조합니다.

Anthropic이 1M 컨텍스트 창을 지원하는 최상위 모델 Claude Fable 5와 Claude Mythos 5를 GA 출시했습니다. 이번 업데이트는 안전 분류기에 의한 거부 응답을 HTTP 200 정상 응답으로 처리하는 새로운 API 설계를 도입한 것이 특징입니다.

Anthropic의 신규 모델 Claude Fable 5의 API 사양과 Opus 4.8 대비 성능 차이를 분석합니다. Fable 5는 장시간 자율적 태스크와 복잡한 코딩 벤치마크에서 압도적 우위를 보이지만, 단발성 작업에서는 차이가 적습니다.

로컬 LLM 선정을 위한 벤치마크 테스트 중 모든 모델이 만점에 가까운 점수를 기록하며 변별력이 상실된 사례를 분석합니다. 벤치마크가 모델 간의 차이를 해상하지 못할 때 발생하는 오류를 지적하며, 유효한 평가를 위한 프로토콜의 중요성을 강조합니다.

Anthropic이 Mythos-class 모델인 Claude Fable 5를 일반 공개했습니다. 이번 출시는 동일한 기반 모델에서 안전장치 유무에 따라 모델을 분리 배포하는 새로운 패턴을 보여주며, 길고 복잡한 태스크 수행 능력이 대폭 강화되었습니다.

샤논의 정보 이론과 콜모고로프의 복잡성 이론을 결합하여, 정적인 데이터를 넘어 동적인 '존재성'을 수학적으로 정의하려는 시도를 다룹니다. 시간 적분과 정보량의 차분을 통해 주관적 인지와 창발성을 설명하는 새로운 수식 모델을 고찰합니다.

Anthropic의 Claude Fable 5 출시와 함께 공개된 'Mythos'의 핵심 설계인 모델 라우팅 메커니즘을 분석합니다. 위험한 질문에 대해 답변을 거절하는 대신 구세대 모델로 라우팅하여 모델의 성능을 유지하면서도 안전성을 확보하는 독특한 접근 방식을 다룹니다.

Anthropic이 Opus 4.8을 상회하는 새로운 모델 Claude Fable 5를 공개했습니다. Fable 5는 고성능 Mythos 5 모델에 세이프가드를 탑재한 일반 공개용 모델로, 자율 에이전트 능력과 시각적 추론 능력이 대폭 강화되었습니다.

Anthropic이 발표한 최상위 티어 모델인 Claude Fable 5의 주요 특징을 정리합니다. Mythos 클래스 모델로서 강력한 보안 성능과 Agentic Coding 능력을 갖추었으며, 요금 체계 및 Amazon Bedrock 지원 사항을 다룹니다.

Anthropic이 신규 Mythos급 모델인 Claude Fable 5를 일반 공개했습니다. 이 모델은 강력한 성능을 유지하면서도 세이프가드 메커니즘을 통해 사이버 보안 및 생물/화학 관련 위험 요청 시 Opus 4.8로 폴백(Fallback)되는 안전 장치를 갖추고 있습니다.

Cross-Embodiment Training은 서로 다른 형태의 로봇 데이터를 통합 학습하여 범용적인 움직임을 획득하는 기술입니다. 신체의 형태가 아닌 '태스크의 의도'와 '어포던스(Affordance)'를 학습함으로써 미지의 환경과 신체로의 전이를 실현합니다.

Google이 온디바이스 멀티모달 에이전트 워크플로를 위해 설계한 Gemma 4 12B를 공개했습니다. 별도의 인코더 없이 단일 디코더 구조를 사용하는 Encoder-free 아키텍처를 통해 레이턴시를 줄이고 효율성을 극대화했습니다.

Anthropic이 코딩 성능과 자율성이 대폭 강화된 Claude Opus 4.8을 출시했습니다. SWE-bench Pro 점수 향상과 더불어 코드 리뷰의 정확도 및 장시간 자율 작업 능력이 개선되었습니다.

rsync 유지보수자가 Claude를 사용하여 코드를 작성한다는 논란에 대해, 버그 밀도(sev/10c) 통계 분석을 통해 실증적으로 검증한 연구 결과입니다. 분석 결과 Claude가 포함된 릴리스의 버그 밀도는 역사적 분포 범위 내에 있어 통계적으로 유의미한 품질 저하를 보이지 않았습니다.

LLM을 심사위원으로 사용할 때 발생하는 '자기 선호(self-preference)' 편향을 분석하고, 이종 벤더 모델을 통한 해결 가능성을 실험한 연구 기록입니다. 동일 계열 모델이 자신의 스타일과 유사한 답변에 관대하게 점수를 주는 현상과 그 기제를 다룹니다.

UMI(Universal Manipulation Interface)는 로봇 없이 핸드헬드 그리퍼와 GoPro를 사용하여 조작 데이터를 수집하고, 이를 다양한 로봇에 전이할 수 있는 프레임워크를 제안합니다. 상대 궤도 행동 표현과 레이턴시 매칭 기술을 통해 데이터 수집의 비용을 낮추고 기종 비의존적인 정책 학습을 가능하게 합니다.

심층 학습과 생성 AI의 복잡한 모델들을 구조, 학습 방법, 태스크라는 세 가지 질문을 통해 체계적으로 분류하는 가이드를 제공합니다. CNN부터 최신 Mamba 모델까지 주요 기술의 계보와 특징을 정리하여 전체적인 기술 지도를 제시합니다.

가상 상관(Spurious Correlation)으로 인해 특정 그룹에서 성능이 저하되는 문제를 해결하기 위한 Just Train Twice(JTT) 논문을 해설합니다. JTT는 그룹 어노테이션 없이 ERM 모델의 실패 사례에 가중치를 두어 재학습함으로써 Group Robustness를 개선하는 단순하고 강력한 방법론을 제시합니다.