Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

전 OpenAI CTO Mira Murati가 설립한 Thinking Machines Lab에서 공개한 오픈 웨이트 멀티모달 LLM 'Inkling'을 소개합니다. MoE 아키텍처를 기반으로 하며, 사용자가 추론의 깊이를 수치로 조절할 수 있는 혁신적인 기능을 제공합니다.

양자화 모델 평가 시 KLD(KL Divergence)와 Perplexity 지표가 실제 모델 품질과 일치하지 않는 '침묵 구역(Silent zone)'의 존재를 분석합니다. 특정 임계값 이하에서는 KLD가 품질 저하를 제대로 반영하지 못함을 실험적으로 증명합니다.

Thinking Machines Lab이 Apache-2.0 라이선스의 오픈 웨이트 멀티모달 모델인 Inkling을 출시했습니다. 975B 파라미터의 MoE 구조를 가진 이 모델은 미세 조정을 위한 강력한 베이스 모델로 설계되었습니다.

언어 모델이 학습 데이터 분포를 벗어난 새로운 암호 체계를 접했을 때, 이를 얼마나 빨리 이해하고 동일한 방식으로 답변하는지 실험한 연구입니다. 10가지 다양한 암호 체계를 통해 모델의 언어 경계와 추론 능력을 측정했습니다.

전통적인 머신러닝 기법을 활용하여 LLM이 생성한 텍스트를 탐지하는 방법론을 소개합니다. 텍스트의 당혹도(Perplexity)를 분석하여 단어의 예측 확률을 기반으로 인간의 글과 AI 생성 콘텐츠를 구별하는 원리를 다룹니다.

중성 원자 양자 컴퓨팅의 기술적 원리와 향후 로드맵을 분석합니다. 레이저 냉각된 원자를 광학 집게로 제어하여 큐비트로 활용하는 방식과 리드베리 상태를 이용한 연산 메커니즘을 설명합니다.

AI 코딩 모델 평가 시 단순 토큰당 비용이 아닌, 작업 완료를 위한 토큰 효율성이 중요함을 강조합니다. DeepSWE 벤치마크를 통해 모델의 성능(통과율)과 작업당 평균 비용 간의 상관관계를 분석합니다.
AI 벤치마크 평가에 활용되는 문항 반응 이론(IRT)의 신뢰성을 분석한 연구입니다. AI 데이터의 특수성이 기존 IRT 추정 도구의 성능과 신뢰성에 미치는 영향을 시뮬레이션을 통해 체계적으로 조사했습니다.
LLM이 생성한 텍스트를 탐지하기 위해 고전적 머신러닝 방법론의 가치를 재조명합니다. 딥러닝 대비 높은 설명 가능성, 효율성, 상호 운용성을 바탕으로 한 특징 공학 및 모델 활용 방안을 다룹니다.
PCA와 LDA의 차이점을 비교하며, 클래스 분리가 목적일 때 PCA가 왜 부적절할 수 있는지 설명합니다. LDA가 클래스 간 산포와 클래스 내 산포의 비율을 최대화하는 Fisher 기준을 통해 어떻게 최적의 투영 축을 찾는지 다룹니다.

Stochastic Weight Averaging(SWA) 기법을 통해 SGD 궤도상의 가중치들을 평균하여 모델의 일반화 성능을 높이는 방법을 설명합니다. SWA는 훈련 손실을 낮추는 대신, 손실 지형의 더 평탄하고 중심적인 지점을 찾아 테스트 오차를 개선합니다.

최근 arXiv에 게재된 aiAuthZ 연구에 따르면, 15개의 주요 LLM 중 일부는 텍스트에 삽입된 가짜 명령을 실제 명령으로 오인하여 실행하는 취약점을 보였습니다. 모델 자체의 프롬프트 방어만으로는 권한이 있는 명령과 위조된 명령을 구분하기 어렵다는 점을 시사합니다.

독일 AI 컨소시엄이 독일어와 영어 벤치마크에서 뛰어난 성능을 보이는 오픈 소스 30B 모델 Soofi S를 출시했습니다. 이 모델은 효율적인 하이브리드 아키텍처를 사용하여 긴 입력값에서도 빠른 처리 속도를 유지합니다.
코딩 작업에 최적화된 AI 모델을 판별하기 위해 구축된 공개 벤치마크 'Favur Evals'를 소개합니다. 다양한 모델(OpenAI, DeepSeek, Qwen 등)을 에이전트 팀의 두뇌로 교체하며 코드 품질, 비용, 속도 등 8가지 엔지니어링 지표를 실시간으로 비교 분석합니다.

Anthropic이 Fable 5 Claude 모델의 사이버 보안 방어 체계와 새로운 탈옥 심각도 척도인 CJS(Cyber Jailbreak Severity)를 공개했습니다. 유해 요청을 분류하는 4단계 범주화와 방어 체계 우회 정도를 0~4단계로 평가하는 시스템을 통해 모델의 안전성을 강화합니다.
물리 법칙을 준수하지 못하는 기존 확산 모델의 한계를 극복하기 위해, 물리적 제약 조건을 확산 과정에 직접 내장한 '물리 증강 확산 모델링(PADM)'을 제안합니다. 행성 지질 조사와 같은 과학적 응용 분야에서 물리적 보존 법칙과 기하학적 제약을 반영하여 생성 모델의 정확도를 높이는 연구를 다룹니다.
중국에서 100페이지 분량의 PDF를 한 번에 처리할 수 있는 3B 규모의 오픈 소스 모델 'Unlimited-OCR'을 공개했습니다. 페이지별 파싱 없이 전체 문맥을 보존하며 로컬 환경에서 비용 없이 실행 가능한 것이 특징입니다.

Anthropic은 Claude 모델 내부에서 인간의 의식적 접근과 유사한 기능을 수행하는 'J-공간(J-space)'을 발견했습니다. 이는 다단계 추론 시 소수의 개념만을 유지하며 통과하는 내부 병목 지점으로, Jacobian lens 방법론을 통해 인과적으로 검증되었습니다.
지식 증류(Knowledge Distillation)의 개념과 원리를 심층 분석한 글입니다. 거대 모델(Teacher)의 지식을 작은 모델(Student)로 전달하여 모델 크기를 줄이면서도 성능을 유지하는 최적화 기술을 다룹니다.

중국에서 3B 파라미터 규모의 오픈 소스 AI 모델인 'Unlimited-OCR'을 공개했습니다. 이 모델은 페이지 분할 없이 32K 컨텍스트 윈도우를 통해 PDF 전체를 한 번에 읽어 문서 구조를 완벽히 보존합니다.