Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
10개의 AI 모델을 대상으로 에이전트 코딩 작업 성능을 테스트한 결과, Grok 4.3이 81.6%로 가장 높은 성능을 기록했습니다. 무료 티어 모델은 출력 토큰 제한으로 인해 성능 편차가 매우 크며, 실질적인 개발 효율을 고려할 때 유료 모델 사용이 권장됩니다.
Decision Transformer를 활용하여 생체 모방 소프트 로보틱스의 유지보수 일정을 최적화하는 연구를 다룹니다. 기존 모델이 안전 제약 조건을 무시하고 가동 시간만을 최적화하는 문제를 해결하기 위해, 인간의 기대와 정렬된 실시간 정책 제약 조건 적용의 중요성을 강조합니다.
Ollama v0.30.0 프리릴리스와 Qwen3.5 35B 모델 출시, 그리고 WebGPU 기반의 1-bit 멀티모달 모델인 Bonsai Image 4B를 소개합니다. 로컬 추론 최적화를 위한 다양한 양자화 형식과 브라우저 기반 이미지 생성 기술의 발전을 다룹니다.
MiniMax가 M2 대비 1M 토큰 환경에서 프리필링 9.7배, 디코딩 15.6배의 속도 향상을 달성한 M3 Sparse Attention 아키텍처를 공개했습니다. 인덱스 브랜치를 활용한 2단계 접근 방식으로 트랜스포머 구조를 유지하며 선형적인 어텐션 스케일링을 구현했습니다.
에이전트 코딩 벤치마크를 통해 10개의 모델을 추가 테스트한 결과, 5개의 새로운 모델 제품군이 모두 75% 이상의 높은 점수를 기록했습니다. Mistral Large 2411과 DeepSeek Chat V3-0324가 90% 점수를 달성하며 90% 클럽에 합류했습니다.
Hacker News에서 AI Safety 관련 학술 논문보다 LLM에게 보내는 편지 형식의 포스트가 훨씬 높은 관심을 받은 사례를 분석합니다. 이는 연구 내용의 문제가 아니라, 기술적 주제를 전달하는 '프레이밍'의 차이가 대중과 엔지니어의 반응을 결정함을 보여줍니다.

Claude Jupiter v1-p, Opus 4.7, Sonnet 4.6 등 최신 Claude 모델들의 실시간 API 성능을 비교 테스트했습니다. 코딩 및 구조화된 출력 작업에서의 모델별 성능 차이와 API 호출 시 주의사항을 다룹니다.
Kostya Trachenko의 연구는 액체의 최소 점성이 플랑크 상수 등 근본 물리 상수로부터 유도됨을 증명합니다. 특히 물리학이 허용하는 최소 점성 범위가 생명 활동에 필요한 점성 범위와 일치한다는 점을 통해 인류 원리적 미세 조정 가능성을 제시합니다.
Google I/O 2026에서 Gemini 3.5 Pro의 공식 출시가 지연된 가운데, Gemini 3.5 Flash가 먼저 공개되었습니다. Flash 모델은 이전 세대인 Pro 모델을 능가하는 코딩 및 에이전트 벤치마크 성능을 보여주며 차세대 Pro 모델에 대한 기대감을 높이고 있습니다.
AI를 활용한 체계적 문헌 고찰 시 데이터의 정확성을 보장하기 위한 3단계 다층적 검증 프레임워크를 제안합니다. 자동 규칙 기반 확인, 샘플 불일치 분석, 전문가 타당성 검토를 통해 환각 및 맥락 오류를 방지하는 방법을 다룹니다.
Transformer 아키텍처를 Structure A11이라는 계층적 인지 프레임워크를 통해 분석합니다. Transformer가 지식(S3)과 이해(S4) 계층에서 보여주는 강점과 인지적 한계를 구조적 관점에서 고찰합니다.
OpenAI가 Apache 2.0 라이선스로 GPT-OSS-120B 모델을 오픈 소스로 공개했습니다. 이 모델은 o4-mini와 유사한 성능을 제공하며, 로컬 실행 및 미세 조정이 가능해 생태계에 큰 변화를 예고합니다.
10가지 에이전트 코딩 태스크를 통해 다양한 AI 모델의 성능과 비용 효율성을 테스트한 결과입니다. Qwen3 Coder 30B와 DeepSeek Chat이 90%의 높은 정확도를 기록했으며, LFM 2 24B는 압도적인 가성비를 보여주었습니다.
Anthropic의 미출시 모델인 Claude Mythos Preview가 주요 OS와 브라우저에서 수천 개의 치명적인 제로 데이 취약점을 자율적으로 발견했습니다. 이는 AI가 소프트웨어 인프라의 보안 태세를 평가하는 'AI 가시성'의 새로운 패러다임을 제시합니다.
Meta와 Stanford 등의 연구진은 AI 에이전트가 코드를 단순한 출력이 아닌 추론을 위한 핵심 작업 계층으로 사용할 때 성능이 향상된다는 'Code as Agent Harness' 개념을 제시했습니다. 코드는 실행 가능한 추론 환경으로서 도구, 메모리, 샌드박스를 통합하는 인지적 스캐폴드 역할을 합니다.
Anthropic의 Claude Mythos 모델이 오픈 소스 소프트웨어에서 10,000개 이상의 심각한 보안 취약점을 자율적으로 발견했습니다. 이 연구는 AI가 보안 위협을 가속화할 수 있음을 경고하며, 더 빠른 패치 주기와 강화된 보안 설정의 필요성을 강조합니다.
Google의 Gemini Omni Flash는 비디오 생성을 단발성 렌더링이 아닌 대화형 편집 과정으로 변환합니다. 텍스트, 이미지, 오디오 등 멀티모달 입력을 통해 캐릭터의 일관성과 물리 법칙을 유지하며 연속성 있는 비디오 편집을 지원합니다.

VLA 모델이 파인튜닝 과정을 거치며 진정한 의미론적 이해를 얻는지, 아니면 단순한 모방 학습기로 퇴보하는지를 분석합니다. 연구 결과, 파인튜닝이 장면의 이해 대신 훈련 데이터의 행동 시퀀스를 암기하게 만든다는 우려를 다룹니다.
CU Boulder의 Tom Yeh 교수가 'AI by hand' 프로젝트를 통해 강조하는 AI 학습의 본질을 다룹니다. 복잡한 AI 메커니즘을 수학적 공식과 도식으로 직접 그려보며 기초를 다지는 '느린 학습'의 중요성을 역설합니다.
Dropbox 전 수석 아키텍트 James Cowling과의 인터뷰로, 분산 트랜잭션 조정 연구와 Granola 알고리즘, Viewstamp Replication 등 하드코어한 분산 시스템 설계 원리를 다룹니다. 2PC의 한계를 극복하는 독립 트랜잭션 개념과 Dropbox의 인프라 전환 비화를 심도 있게 분석합니다.