Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Anthropic이 출시한 모델 중 위험하다고 여겨지는 버전을 개인적으로 테스트하며, 오랜 시간과 많은 리소스를 투입하여 게임 아이디어를 구현하는 과정을 다루고 있습니다. 이 과정은 AI 모델의 추론 능력과 한계를 탐구합니다.
과학자들이 초파리의 뇌를 컴퓨터에 성공적으로 이식하여, 이 뇌가 자체 시뮬레이션 환경 속에서 자유롭게 작동하는 것을 보여주었습니다. 시뮬레이션된 벌레의 뇌는 가상 몸체를 제어하며, 그 행동적 정확도가 95%에 달합니다.
미국 정부의 국가 안보 우려와 수출 통제 지침 발표로 인해, Anthropic이 Claude Fable 5와 Mythos 5를 전 세계적으로 비활성화했습니다. 이는 해당 모델들이 고급 칩 수준의 민감한 기술로 취급되고 모든 외국 국적자의 접근이 금지되었기 때문입니다. 현재는 나머지 Claude 모델들은 정상 작동 중이며, Anthropic은 이 상황을 오해라고 보고 복원을 위해 노력하고 있습니다.
미국 정부가 Anthropic에게 Fable 5와 Mythos 5의 외국 국적자 대상 사용을 중단하도록 강제했습니다. 이는 모델의 '탈옥(jailbreak)' 기능, 특히 코드 수정 요청과 관련된 규제 이슈를 다루고 있습니다.
ResearchClawBench는 AI 에이전트의 종단 간(end-to-end) 자율 연구 능력을 측정하는 벤치마크입니다. 이 벤치마크는 10개 도메인에 걸쳐 40개의 실제 과제를 제공하며, 원시 데이터만으로 과학적 발견을 재현할 수 있는지 테스트합니다. 현재 최상위 에이전트들의 평균 점수는 100점 만점에 21.5점에 그쳤습니다.
InclusionAI가 Qwen3.5 9B 백본을 기반으로 GUI-grounding 비전-언어 모델인 VISTA-9B와 VISTA-4B를 공개했습니다. 이 모델은 스크린샷과 자연어 지침을 정규화된 좌표로 매핑하는 것이 목표입니다. 특히, '뷰 일관성 GRPO 학습'과 '자체 검증 교차 뷰 앵커링' 기법을 통해 정확한 위치 지정 능력을 강화했습니다.
Anthropic이 최신 모델 Fable 5와 Mythos 5를 전 세계적으로 서비스에서 철회했습니다. 이는 미국 정부의 수출 통제 명령에 따른 조치로, 특히 '코드 읽고 버그 고치기' 능력이 위험 요소로 지적되었습니다.
Anthropic이 미국 수출 규정 준수를 위해 Fable 5를 전 세계적으로 폐기한 사례는 AI 모델의 통제권 문제를 제기합니다. 클라우드 API 사용은 지능을 임대하는 것이며, 로컬 가중치(weights)만이 진정한 디지털 독립성을 보장한다는 경고입니다.
UW, OpenAI 등은 VLM의 공간 추론 능력을 향상시키기 위해 '상상적 지각 토큰(Imaginative Perception Tokens)'을 개발했습니다. 이 토큰은 관점 취하기와 경로 추적 등의 시각적 관점을 텍스트 기반으로 상상하게 합니다. 또한, NVIDIA는 코드를 액션 인터페이스로 활용하는 트레이닝 불필요 공간 추론 에이전트인 SpatialClaw를 공개하며 VLM의 성능을 개선했습니다.
미국 정부가 Anthropic의 Fable 5와 Mythos 5 서비스에 대해 긴급 수출 통제 지침을 내리면서, 해당 모델들이 전 세계적으로 강제 중단되었습니다. 이는 사소한 Jailbreak 문제로 인해 투명한 과정 없이 API 접근이 완전히 폐쇄된 사례입니다.
Anthropic은 미국 정부의 국가 안보 우려에 따른 수출 통제 지침을 준수하기 위해 Fable 5와 Mythos 5 모델의 접근을 일시적으로 차단했습니다. 이 조치는 Anthropic이 해당 모델들을 고위험 영역에서 안전장치를 적용하여 공개한 직후 발생했으며, 국방부(DOD)가 공급망 위험으로 지정하면서 법적 분쟁까지 이어지고 있습니다.
Anthropic의 Claude Fable 5가 FrontierMath: Tiers 1–4 (v2) 테스트에서 높은 성능을 보여주었습니다. 특히 Tiers 1~3에서는 87%, Tier 4에서는 88%라는 좋은 점수를 기록하며, Anthropic 모델들의 수학적 추론 능력이 빠르게 향상되고 있음을 입증했습니다.
Claude Fable 5가 FrontierMath Tier 4 v2에서 87.8%의 점수로 1위를 차지하며 DeepMind를 추월했습니다. 이는 이전 모델인 Opus 4.8 대비 큰 폭으로 성능이 향상된 수치입니다. 또한, Tiers 1-3에서도 GPT-5.5를 제치고 1위에 오르는 등 전반적인 성능 개선을 보여주었습니다.
미국 정부가 국가 안보를 이유로 수출 통제 지침을 발표하여, Anthropic의 Fable 5와 Mythos 5에 대한 모든 접근이 중단되었습니다. 이로 인해 해당 모델들은 즉시 비활성화되었으며, 다른 Anthropic 모델에는 영향이 없습니다.
업데이트된 에이전트 코딩 지수(agentic coding index)에 따르면, Claude Fable 5가 GPT-5.5보다 높은 순위를 기록했지만, 새로운 DeepSWE 벤치마크의 도입으로 인해 초기 평가가 과대평가되었을 수 있다는 분석이 나왔습니다.
사용자가 Claude에게 법률 문서의 단락 번역을 요청했으나, AI는 원문과 완전히 반대되는 내용을 '번역'하는 오류를 보였습니다. 이는 맥락 정보가 부족할 때 LLM이 심각한 환각(hallucination)을 일으킬 수 있음을 보여줍니다.
Kimi K2.7 코드가 Workers AI를 통해 공개되었습니다. 이 최적화된 MoE 모델은 복잡한 코딩 작업에 특화되어 높은 벤치마크 성능 향상과 대규모 262k 컨텍스트 창을 제공합니다.
Anthropic이 요청을 받아 Mythos를 활용하여 Zcash 프로토콜에 대한 보안 감사를 수행했습니다. 그 결과, 현재까지는 심각한 버그는 발견되지 않았습니다. Shielded Labs와 관련 팀들은 지속적인 보안 강화 작업을 진행할 예정입니다.
기존의 공개 벤치마크는 이미 포화 상태가 되어 최첨단 모델 학습에 활용되었으며, 리더보드는 더 이상 의미 있는 정보를 제공하지 못하고 있습니다. 따라서 AI를 운영하는 모든 기업은 자체적인 내부 평가 기준과 코드를 구축할 필요성이 대두되고 있습니다.
에이전트형 AI는 도구 사용, 컨텍스트 수집 등 복잡한 작업을 위해 다수의 모델 호출을 연결하는 방식입니다. 이에 맞춰 @ArtificialAnlys가 에이전트 성능 비교를 위한 벤치마크인 AgentPerf를 공개했습니다. 초기 결과에서 NVIDIA Blackwell은 Hopper 대비 메가와트당 월등히 높은 에이전트 처리 능력을 보여주었습니다.