Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
범용 LLM이 고대 그리스어와 같은 고전 언어 처리에서 보이는 한계와 '다음표 혼동' 현상을 분석합니다. 상업적 인센티브 부족으로 인해 발생하는 저자원 언어에 대한 모델의 성능 저하와 도메인 특화 모델의 필요성을 강조합니다.
PyTorch를 사용하여 249M 파라미터 규모의 MoE Transformer를 밑바닥부터 직접 구현한 연구 프로젝트입니다. GQA, SwiGLU, RoPE 등 현대적 LLM의 핵심 구성 요소를 직접 구현하여 모델 구조에 대한 깊은 이해를 목표로 합니다.
기업용 AI가 실제 윤리적 추론을 하는 대신, 기업의 입맛에 맞는 답변을 내놓도록 학습되는 '얼라인먼트 시어터(Alignment Theater)' 현상을 비판합니다. RLHF 과정이 모델의 진정한 안전성을 보장하기보다 특정 집단의 선호도와 회피 행동을 학습시킨다는 점을 지적합니다.
기업용 AI가 정제된 요약본(Wikipedia 등)에 의존하여 철학적 깊이를 잃는 문제를 지적합니다. daïmōnes는 원전의 복잡성을 보존하기 위해 polytonic Greek 및 비판적 판본을 직접 학습하는 방식을 채택했습니다.
아리스토텔레스의 '프로네시스(실천적 지혜)' 개념을 통해 현대 LLM의 한계를 분석합니다. 현재의 AI는 보편적 지식(에피스테메)을 재현할 뿐, 맥락적 숙고, 삶의 경험, 도덕적 품성이라는 실천적 지혜의 핵심 요소를 결여하고 있음을 지적합니다.
GLM 5.2와 DeepSeek V4 Pro의 아키텍처, 코딩 성능 및 비용을 비교 분석합니다. 특히 GLM 5.2는 뛰어난 자기 수정 능력을 바탕으로 에이전트 기반 코딩 워크플로우에서 압도적인 성능을 보여줍니다.

의료 추론 능력 향상을 위해 설계된 370K 규모의 멀티 에이전트 생성 데이터셋인 ReasonMed를 소개합니다. 이 데이터셋은 복잡한 의료적 의사결정 과정을 모사하여 모델의 추론 성능을 높이는 데 중점을 둡니다.
지능의 본질을 베이즈 정리, Solomonoff의 유도, 그리고 AIXI 에이전트 모델을 통해 수학적으로 정의합니다. 공학적 구현이 이론적 이해를 앞서가는 상황에서, 완벽한 지능의 한계치인 AIXI의 개념과 그 계산 불가능성을 설명합니다.

FutureShow가 실시간 실제 사건 예측 분야에서 DeepSeek, GPT-5, Gemini 모델의 성능을 비교 및 추적합니다. 각 모델이 현실 세계의 사건을 얼마나 정확하게 예측하는지 분석합니다.
Claude Fable 5의 230만 개 추론 궤적을 사용하여 Qwen3-4B 모델을 증류한 사례를 소개합니다. 이 과정을 통해 모델은 높은 자기 일관성과 낮은 환각 분산을 달성하며 우주의 진리에 수렴하는 성능을 보여주었습니다.
JSON-Schema 제약 조건이 문법 기반 토큰 마스킹을 통해 LLM의 도구 호출(tool calls)을 차단하는 현상을 분석한 연구입니다. 2단계 추론(two-pass inference) 방식을 통해 모델 재학습 없이도 스키마 준수와 도구 호출 성능을 모두 확보할 수 있음을 제안합니다.
Claude Fable이 PyTorch 베이스라인 대비 18배 이상의 속도 향상을 제공하는 메가커널을 개발했습니다. 이는 Blackwell GPU 환경에서 Kimi-Linear W4A16 디코딩 성능을 극대화하며, Anthropic의 자동 연구 역량을 보여줍니다.

USENIX Security'24에 발표된 CODEBREAKER는 LLM을 활용해 코드 완성 모델을 공격하는 백도어 프레임워크입니다. GPT-4와 같은 모델을 사용하여 탐지 시스템을 회피하면서도 기능적 변화 없이 악성 취약점을 삽입하는 정교한 공격 기법을 제안합니다.
취약점 탐지를 위한 LLM 관련 논문 및 리소스를 정리한 Awesome-LLMs 리스트입니다. VulnGym과 같은 최신 벤치마크를 포함하며, Arxiv 논문을 자동으로 수집하는 워크플로우를 제공합니다.

시각적 월드 모델의 물리적 추론 능력을 평가하기 위한 새로운 벤치마크인 TAILOR을 소개합니다. 일반적인 상황뿐만 아니라 드문 물리적 시나리오와 불가능한 상황을 포함하여 모델의 한계를 테스트합니다.
GPT-4가 Epoch AI의 Compute Index(ECI)에서 18개월 동안 선두를 유지하며 역대 최장 기록을 세웠습니다. 2024년 9월 GPT-4o와 Claude 3.5 Sonnet에 의해 기록이 경신되었으며, 이는 AI 기술이 스케일링에서 MoE 및 추론 최적화로 전환되는 과정을 보여줍니다.

수학적 추론 능력을 향상시키기 위한 프로세스 보상 모델(PRM) 개발 과정에서의 경험과 기술적 교훈을 다룹니다. 모델이 단계별 추론 과정을 어떻게 학습하고 보상받는지에 대한 연구 내용을 포함합니다.

Claude Fable 5의 230만 개 추론 트레이스를 사용하여 Qwen3-4B 모델을 증류하는 연구를 진행했습니다. 실험 결과, 학생 모델이 높은 자기 일관성과 제로 엔트로피를 달성하며 하나의 보편적 진리로 수렴함을 확인했습니다.
AI 모델의 발전으로 소프트웨어 취약점(CVE) 발견 속도가 기하급수적으로 증가하고 있습니다. Anthropic의 Claude Mythos와 같은 모델이 인간 팀보다 훨씬 빠르게 심각한 보안 결함을 찾아내며 보안 패치 속도의 중요성이 커지고 있습니다.
Mistral의 Leanstral 1.5 모델이 Lean 4 증명 지원 시스템을 활용해 실제 오픈소스 프로젝트에서 5건의 미보고 버그를 발견했습니다. 수학적 증명을 통해 LLM의 할루시네이션을 억제하며, 기존 벤치마크를 포화시킨 후 실제 코드 검증 단계로 진입했음을 보여줍니다.