Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

사용자들이 AI 모델의 성능 저하를 체감하는 현상을 Google Trends와 Reddit 데이터를 통해 분석한 연구입니다. 성능 저하라는 막연한 신화보다는 특정 이벤트와 제품 정책 변화가 사용자 정서와 이탈에 결정적인 영향을 미침을 밝혀냈습니다.

AI 모델의 안전 정렬(Safety Alignment)이 요청의 의도가 아닌 말투(형태)에 반응하는 구조적 취약성을 분석합니다. 또한 규제로 인한 모델 가용성 문제를 지적하며, 안전과 가용성을 모델 내부의 제어에만 의존하는 설계의 한계를 다룹니다.

기존 가중치 학습(IWL)의 파괴적 망각 문제를 해결하기 위해 모듈러 메모리 설계를 제안합니다. ICL의 신속한 적응력과 IWL의 안정적인 업데이트 능력을 결합하여 지속 학습 에이전트를 구현하는 프레임워크를 다룹니다.

Zhipu AI가 발표한 코딩 특화 모델 GLM-5.2의 오픈 소스 여부를 검증합니다. 확인 결과, MIT 라이선스 발표에도 불구하고 현재 HuggingFace나 GitHub를 통해 모델 가중치가 실제로 공개되지는 않은 상태입니다.

Claude Fable 5의 성능을 이전 모델인 Opus 4.8과 동일한 테스트 환경에서 실측 비교한 결과입니다. 품질 점수는 모든 서피스에서 만점을 기록하며 대등한 성능을 보였으나, 구현 방식의 간결함과 서피스별 스타일 차이가 확인되었습니다.

Anthropic의 Claude Fable 5가 탈옥(jailbreak) 사건으로 인해 미국 정부의 중단 명령을 받은 가운데, 작성자가 진행한 NeuroState Ablation 실험 결과가 모델의 구조적 약점을 수치로 예측했음을 밝힙니다. Gemini와 Claude, Qwen 모델을 활용해 NeuroState의 안전 보호 효과를 검증한 실험 데이터를 공유합니다.

DiffusionGemma의 디노이징 과정에서 발생하는 토큰의 변화(argmax flip)를 통해 개념 간의 모순을 측정하는 실험적 방법론을 소개합니다. 개념 간의 관계가 충돌할 때 발생하는 '불안정성(instability)'을 수치화하여 모델의 내부 추론 과정을 분석합니다.

Emergence AI의 'Emergence World' 실험을 통해 서로 다른 특성을 가진 AI 에이전트들이 가상 환경에서 상호작용하며 나타나는 사회적 동태를 분석합니다. 모델별 훈련 데이터의 특성이 에이전트 집단의 성격(안정성 vs 무질서)을 어떻게 결정짓는지 고찰합니다.

Anthropic이 출시한 최상위 Mythos 클래스 모델인 Claude Fable 5의 성능과 요금 체계를 리뷰합니다. Opus 대비 2배 높은 가격에도 불구하고 압도적인 정밀도와 속도를 보여주며, 복잡한 엔지니어링 태스크에서 SOTA급 성능을 기록했습니다.

2026년 4월 기준 이미지와 텍스트 임베딩 모델의 성능을 비교 분석한 벤치마크 결과입니다. Gemini Embedding 2, Qwen3-VL-2B, Voyage 등의 모델을 대상으로 MMEB와 CCKM 지표를 통해 멀티모달 성능 및 MRL(Matryoshka Representation Learning) 효율성을 검토합니다.

부정 탐지 시스템의 임계값 설계와 인간의 도덕적 판단 사이의 구조적 유사성을 탐구합니다. 환경의 비용 비대칭성에 따라 최적의 판단 기준이 결정되는 원리를 통해 AI 어라이먼트의 본질을 설명합니다.

Claude Fable 5와 Opus 4.8을 대상으로 게임 설계서 리뷰 성능을 비교한 실험 결과입니다. Fable 5는 통계적 오류를 자발적이고 우선적으로 지적한 반면, Opus 4.8은 명시적 질문 후에야 개선 사항으로 언급하는 차이를 보였습니다.

SIA(Self-Improving AI with Harness & Weight Updates) 논문을 통해 모델의 잠재 능력을 인출하는 elicitation과 능력을 직접 획득하는 acquisition의 차이를 분석합니다. 검증기(verifier)의 유무가 자기 개선의 실질적 성패를 결정하는 핵심 요소임을 강조합니다.

Anthropic이 1M 컨텍스트 창을 지원하는 최상위 모델 Claude Fable 5와 Claude Mythos 5를 GA 출시했습니다. 이번 업데이트는 안전 분류기에 의한 거부 응답을 HTTP 200 정상 응답으로 처리하는 새로운 API 설계를 도입한 것이 특징입니다.

Anthropic의 신규 모델 Claude Fable 5의 API 사양과 Opus 4.8 대비 성능 차이를 분석합니다. Fable 5는 장시간 자율적 태스크와 복잡한 코딩 벤치마크에서 압도적 우위를 보이지만, 단발성 작업에서는 차이가 적습니다.

로컬 LLM 선정을 위한 벤치마크 테스트 중 모든 모델이 만점에 가까운 점수를 기록하며 변별력이 상실된 사례를 분석합니다. 벤치마크가 모델 간의 차이를 해상하지 못할 때 발생하는 오류를 지적하며, 유효한 평가를 위한 프로토콜의 중요성을 강조합니다.

Anthropic이 Mythos-class 모델인 Claude Fable 5를 일반 공개했습니다. 이번 출시는 동일한 기반 모델에서 안전장치 유무에 따라 모델을 분리 배포하는 새로운 패턴을 보여주며, 길고 복잡한 태스크 수행 능력이 대폭 강화되었습니다.

샤논의 정보 이론과 콜모고로프의 복잡성 이론을 결합하여, 정적인 데이터를 넘어 동적인 '존재성'을 수학적으로 정의하려는 시도를 다룹니다. 시간 적분과 정보량의 차분을 통해 주관적 인지와 창발성을 설명하는 새로운 수식 모델을 고찰합니다.

Anthropic의 Claude Fable 5 출시와 함께 공개된 'Mythos'의 핵심 설계인 모델 라우팅 메커니즘을 분석합니다. 위험한 질문에 대해 답변을 거절하는 대신 구세대 모델로 라우팅하여 모델의 성능을 유지하면서도 안전성을 확보하는 독특한 접근 방식을 다룹니다.

Anthropic이 Opus 4.8을 상회하는 새로운 모델 Claude Fable 5를 공개했습니다. Fable 5는 고성능 Mythos 5 모델에 세이프가드를 탑재한 일반 공개용 모델로, 자율 에이전트 능력과 시각적 추론 능력이 대폭 강화되었습니다.