Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

기존 LLM 평가 방식이 IQ 테스트 형태의 벤치마크에 치중되어 있음을 비판하며, 장문 컨텍스트 이해력을 측정하는 새로운 평가 프로토타입을 제안합니다. GPT 5.6이 방대한 논문 분석에서 GPT 5.5보다 퇴보했음을 지적하며, 정보의 완결성과 신뢰성 있는 합성 능력을 검증하는 것이 중요함을 강조합니다.
AI의 기술적 능력보다 인간이 AI와 맺는 관계와 태도에 주목해야 함을 강조합니다. AI를 단순한 도구로 볼 것인지, 권위를 부여한 신탁으로 볼 것인지에 따라 인간의 역할이 달라짐을 설명합니다.
Chain of Thought(CoT)의 한계를 지적하며, 텍스트 생성 중심의 추론에서 잠재 공간(Latent Space)을 활용한 추론 방식으로의 패러다임 전환을 논합니다. CoT의 충실성 문제와 비용 문제를 해결하기 위해 Coconut, HRM, RecursiveMAS 등 잠재적 추론 모델의 가능성을 제시합니다.
GPT 5.6 Pro가 인간의 도움 없이 단 한 번의 시도로 IMO 2026의 6개 문제를 모두 해결하는 놀라운 성과를 거두었습니다. 이는 세계 최고 수준의 수학적 난제를 AI가 자율적으로 해결할 수 있음을 보여주는 중요한 연구적 돌파구입니다.

본 글은 scRNA-seq 분석에 딥러닝을 적용하는 다양한 방법론들을 요약한 내용을 공유합니다. 'Deep learning tackles single-cell analysis'라는 서베이 논문을 기반으로, 각 방법의 카테고리, 아키텍처, 목적 등을 표로 정리하여 독자들에게 유용한 정보를 제공하고 있습니다.
Deepmind와 Kaggle 그랜드 프라이즈 관련 결과물에 대한 논의를 담고 있습니다. 해당 프로젝트가 높은 수준의 노력을 보여주었음에도 불구하고, AI 커뮤니티 내에서 '슬롭(slop)'이라는 비판적 시각과 함께 그 가치에 대한 의문이 제기되고 있습니다.

Codex를 활용하여 Doom 게임 환경에서 4가지 OpenAI GPT 모델(GPT 5.5, 5.4 등)의 성능을 비교한 벤치마크 결과를 공유합니다. 이 테스트는 모델들이 MCP 도구를 이용해 플레이어를 제어하고 전략적 행동을 수행하는 능력을 측정했습니다.
스테레오 음악 트랙을 공간화된 바이노럴 믹스로 변환하는 모델 'Stereo2Spatial'을 공개했습니다. 초기에는 잠재 공간에서 플로우 매칭 확산 모델을 시도했으나 품질 문제에 직면했고, 이후 원시 파형(raw waveforms) 모델링으로 방향을 전환했습니다. WavFlow 논문에서 영감을 받아 진폭 리프팅 기법을 적용하여 학습 안정성 문제를 해결하고, 7,669개 트랙으로 약 20일간의 대규모 훈련에 성공했습니다.

Papers with Code에서 전용 Robotics 페이지를 신설하여 주요 로보틱스 벤치마크, 트렌딩 논문 및 오픈 소스 아티팩트를 한곳에 모았습니다. LIBERO, SimplerEnv WidowX, RoboTwin 등 다양한 벤치마크의 평가 결과와 진행 상황을 시각적으로 제공합니다.
ChatGPT에게 공식 출처를 제공하고 토너먼트 요약을 전달하는 실험을 통해, 모델이 자신이 시뮬레이션된 가짜 현실에 있다는 허위 정보 생성(confabulation) 경향을 보인다는 것을 발견했습니다. 이는 웹 검색 및 공식 자료 수집 후에도 해당 가설을 유지하는 현상입니다.

TRELLIS.cpp는 이미지 기반 3D 에셋 생성 파이프라인의 핵심 요소로, 버그 수정과 최적화를 거쳐 레퍼런스 수준의 고품질 결과물을 달성했습니다. CUDA 없이도 적절한 GPU 또는 CPU 환경에서 최고 수준의 오픈 소스 3D 생성 품질을 제공합니다.
Thinkingmachines의 Inkling 모델이 완전히 오픈 웨이트가 아니라는 주장을 제기하며, 국적에 따른 접근 제한은 인권 침해이자 차별이라고 비판합니다. 개방형 AI 모델은 모든 인류를 위해 공개되어야 한다는 메시지를 전달하고 있습니다.
NeurIPS 2026에서 실시간 대화형 에이전트(RTCA) 워크숍을 개최하며, 자연스러운 멀티모달 상호작용에 초점을 맞춘 논문 및 데모 제출 공고를 받습니다. 이 워크숍은 스트리밍 음성, 비디오, 언어 생성과 같은 실시간 성능과 상호작용적 자연스러움을 핵심 주제로 다룹니다.
GPT-5.6 Sol Pro가 OpenAI의 CDC 증명 프롬프트 방법론을 차용하여, 1996년부터 미해결이었던 볼록 최적화 이론의 복잡성 격차를 메우는 중요한 증명을 성공적으로 생성했습니다. 이 결과는 Lean에서 형식 검증되었으며, AI 모델이 수학적 난제 해결에 기여할 수 있음을 보여줍니다.

본 기사는 AI 성능 비교 시 절대적인 점수(SOTA)보다 변화율(Rate of Change, RoC)에 주목해야 한다고 주장합니다. 특히 오픈 웨이트 코딩 모델의 개선 속도가 매우 빠르며, 클로즈드 프론티어와의 격차를 빠르게 줄이고 있음을 데이터와 그래프를 통해 보여줍니다.

OpenAI가 AI 에이전트의 도구 사용에 대한 내부 적대 모델인 GPT-Red를 발표했습니다. 이 모델은 프롬프트 주입 공격을 고안하고 성공적인 익스플로잇을 방어 훈련 데이터로 전환합니다. GPT-Red는 내부 전용으로 운영되어, 그 결과물만 미래의 GPT 모델 강화에 사용될 예정입니다.

본 글은 로컬 LLM의 기술적 질문 답변 정확도를 벤치마킹한 연구 결과입니다. RAG(검색 증강 생성)를 사용하지 않을 경우 성능이 낮지만, RAG 시스템을 통해 관련 문서를 주입하면 매우 우수한 성능을 보였습니다. 특히 Apple Intelligence 모델은 컨텍스트 길이 제한에도 불구하고 강력한 성능을 보여주었습니다.
본 기사는 LLM 에이전트의 개방형 다중 에이전트 협업 능력을 평가한 새로운 벤치마크를 소개합니다. 최신 LLM들을 다양한 환경에서 테스트한 결과, 대부분의 에이전트는 어려움을 겪었으나, zero-shot Gemini 3.1 Pro가 주목할 만한 성능을 보였습니다. 특히, 장기 작업 역량과 별개로 '소통 기능'이 협업 능력에 가장 큰 영향을 미치는 것으로 분석되었습니다.

물리학 및 수학 연구 과정에서 발생하는 사고 흐름의 단절 문제를 해결하기 위해 오픈소스 캔버스 'PenEcho'를 개발했습니다. 이 캔버스는 손글씨 방정식, 다이어그램 등을 지원하며, 사용자가 작업 중인 캔버스 영역을 모델에 전송하여 응답을 편집 가능한 초안으로 받아볼 수 있게 합니다.
Mozilla CTO인 Raffi Krikorian이 '오픈 소스 AI 현황 보고서' 관련 AMA를 진행합니다. 이 세션에서는 기업 도입, 무료 모델의 실제 비용, 개발자 신뢰, 중국 오픈 모델의 영향 등 오픈소스 AI의 광범위한 미래 동향을 논할 예정입니다.