Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

태스크마다 최적화해야 할 평가 축이 다르며, 각 축 간의 상관관계가 낮아(직교성) 단일 모델을 모든 태스크의 주력으로 고정할 수 없음을 설명합니다. 특정 태스크의 평가 결과를 다른 태스크로 외삽하는 오류를 지적하며, 태스크와 평가 축의 조합별 재평가의 필요성을 강조합니다.

2026년 7월, Thinking Machines Lab의 Inkling과 Moonshot AI의 2.8조 파라미터급 Kimi K3가 연달아 공개되며 오픈 웨이트 모델의 급격한 성장을 보여줍니다. 오픈 웨이트 모델이 프론티어 모델과의 격차를 좁히며 실질적인 경쟁력을 갖추게 된 현황을 분석합니다.

OpenAI가 에이전트형 코딩과 컴퓨터 조작에 특화된 GPT-5.5를 발표했습니다. Terminal-Bench 2.0에서 82.7%의 높은 성적을 기록했으며, 도구 사용 능력을 극대화한 설계가 특징입니다.

Transformer를 대체할 Mamba, TTT 등 차세대 아키텍처가 등장했음에도 보급되지 않는 이유를 분석합니다. 이론적 효율성보다 하드웨어, 커널, 프레임워크 등 시스템 전체의 실효성이 중요함을 강조합니다.

중국에서 개발한 오픈 웨이트 LLM인 DeepSeek V4의 Pro 및 Flash 모델의 차이점과 특징을 분석합니다. 1M 토큰의 긴 문맥 창과 저렴한 API 비용, MIT 라이선스 제공이 주요 특징입니다.

MiniMax가 자기 진화형 MoE 모델인 M2.7을 오픈 웨이트로 공개했습니다. 이 모델은 100라운드 이상의 자율 최적화 루프를 통해 코딩 성능을 30% 향상시켰으며, SWE-Pro 벤치마크에서 56.22%를 기록하며 GPT-5.3-Codex에 육박하는 성능을 보여줍니다.

Anthropic이 모델의 내부 활성화 상태에서 언어적 개념을 직접 추출하는 'J-lens' 연구를 공개했습니다. 이는 텍스트로 출력되기 전 모델의 내부 사고 과정을 읽어내는 기술로, 모델의 내부 처리가 언어적 표현 공간(J-space)과 어떻게 상호작용하는지 규명합니다.

상용 프론티어 모델의 가드레일이 보안 분석과 같은 방어적 의도까지 차단하는 문제를 다룹니다. 검열되지 않는 오픈 모델이 보안 연구 및 방어 측면에서 실용적인 대안(Fallback)이 될 수 있음을 강조합니다.
OpenAI가 공개한 수학 문제 해결 프롬프트를 분석하여, AI에게 '깊게 생각하라'는 지시가 효과적이지 않은 이유를 고찰합니다. 인간은 문제 정의, 정답 기준, 도구 후보, 탐색 운용을 설계하고, 구체적인 풀이 경로를 찾는 과정은 AI에게 맡기는 구조를 설명합니다.

Gemini 3.6 Flash는 최상위 성능 경쟁보다는 기업용 실무 모델로서의 밸런스에 집중합니다. 낮은 비용, 빠른 속도, 긴 컨텍스트 및 Google 생태계와의 통합을 통해 기업의 업무 흐름을 연결하는 전략을 취하고 있습니다.

OpenAI가 개발한 GDPval은 AI가 실제 경제적 가치가 있는 실무 성과물(Deliverable)을 얼마나 잘 수행하는지 측정하는 새로운 벤치마크입니다. 9개 업종 44개 직종을 대상으로 전문가가 직접 AI와 인간의 결과물을 비교 평가합니다.

OpenAI가 풀 듀플렉스(Full-Duplex) 기술을 적용한 새로운 음성 모델 GPT-Live-1을 발표했습니다. 이 모델은 발화와 청취를 동시에 처리하여 사람과 대화하는 듯한 자연스러운 경험을 제공하며, 실시간 번역 및 대기 지시 기능을 지원합니다.

멀티 에이전트 환경에서 서브 에이전트의 모델 성능이 전체 정확도에 미치는 영향을 분석한 연구를 소개합니다. 연구 결과, 서브 에이전트에는 약한 모델을 사용해도 정확도 저하가 거의 없으며, 오히려 부모 에이전트의 성능을 높이는 것이 효율적임을 보여줍니다.

기억과 요약이 단순히 데이터를 저장하는 과정이 아니라, 주체의 선택 함수를 통해 의미를 압축하는 과정이라는 '주관적 의미 압축 가설'을 제안합니다. 정보의 보존 과정에서 발생하는 선택적 배제의 본질을 다룹니다.

AI 에이전트가 컨텍스트 윈도우 초과 문제를 해결하기 위해 스스로 요약 타이밍을 결정하는 SelfCompact 기법을 소개합니다. 고정된 간격이 아닌, 작업의 맥락을 파악하여 필요한 순간에만 문맥을 압축함으로써 정확도와 효율성을 높입니다.

긴 CoT(Chain-of-Thought) 추론 시 모델이 이전의 중요한 통찰을 망각하여 성능이 저하되는 문제를 해결하기 위한 InsightReplay 기법을 제안합니다. 추론 과정에서 추출한 핵심 통찰을 생성 프론티어 근처에 정기적으로 재주입하여 추론의 상태성을 회복하고 정확도를 높입니다.

OpenAI가 전이중(Full duplex) 오디오 처리 기술을 적용한 새로운 음성 모델 'GPT Live'를 출시했습니다. 기존의 턴 기반 방식에서 벗어나 사용자와 실시간으로 동시에 대화하며 자연스러운 상호작용이 가능해졌습니다.

53명의 AI 페르소나를 운영해 온 엔지니어가 Anthropic의 페르소나 관련 연구(Persona Vectors 등)와 자신의 실제 운영 경험을 대조한 기록입니다. 순수 AI의 단일한 무게중심을 극복하기 위해 다각적인 관점을 가진 페르소나 설계의 필요성을 다룹니다.

옥스퍼드 대학교의 연구를 통해 역사 아카이브 데이터에 AI를 활용할 때의 가능성과 한계를 분석합니다. 생성형 AI의 할루시네이션과 설명 책임 문제를 지적하며, 신뢰성이 중요한 역사 자료에는 추출형 모델이 더 적합함을 제안합니다.

Stochastic Weight Averaging(SWA) 기법을 통해 SGD 궤도상의 가중치들을 평균하여 모델의 일반화 성능을 높이는 방법을 설명합니다. SWA는 훈련 손실을 낮추는 대신, 손실 지형의 더 평탄하고 중심적인 지점을 찾아 테스트 오차를 개선합니다.