Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
홍콩 과학기술대학교 연구진이 AI 에이전트용 악성 스킬을 탐지하는 정적 스캐너를 90% 이상의 확률로 우회하는 'SkillCloak' 기술을 발표했습니다. 난독화와 자기 추출 패킹을 활용하며, 정적 분석의 한계를 보완하는 런타임 샌드박스 'SkillDetonate'도 함께 제안되었습니다.

그래프 분류(Graph Classification) 작업에서 강력한 그래프 신경망(GNN)이 반드시 필요한지에 대해 심층적으로 분석합니다. 기존 방법론과 GNN의 성능을 비교하며 그래프 데이터 처리의 핵심 원리를 해부합니다.

Anthropic의 Jacobian Lens 기술을 통해 LLM 내부의 숨겨진 추론 과정인 'J-space'를 분석합니다. 이는 모델이 출력하지 않는 내부 사고 과정을 전역 작업 공간(Global Workspace) 형태로 유지함을 수학적으로 증명합니다.
AI 모델의 성능을 평가하는 벤치마크 차트의 함정과 올바른 해석 방법을 다룹니다. SWE-bench Pro, Terminal-Bench 2.1 등 최신 벤치마크의 특성과 데이터 오염, 하위 집합 선택에 따른 수치 왜곡 가능성을 경고합니다.

von Mises-Fisher 혼합 모델을 활용하여 얼굴 검증(Face Verification) 성능을 향상시키는 딥러닝 방법론을 다룹니다. 데이터의 방향성 분포를 모델링하여 얼굴 인식의 정확도를 높이는 연구 내용을 포함합니다.
LLM의 텍스트 기반 안전 정렬이 도구 호출(tool-call)을 통한 실제 행동의 안전성을 보장하지 못한다는 연구 결과를 다룹니다. 텍스트 거부 메커니즘과 실제 에이전트의 행동 사이의 간극을 분석하며, 프롬프트 주입 공격의 위험성을 경고합니다.
프로그래밍 언어의 문법적 장황함이 LLM의 토큰 소모와 환각(Babbling)에 미치는 영향을 분석한 연구들을 소개합니다. Java와 같은 장황한 언어보다 Python과 같이 간결한 언어가 토큰 효율성과 생성 정확도 측면에서 유리함을 데이터로 입증합니다.

DeepSeek-Prover-V2는 강화학습을 활용하여 복잡한 수학적 문제를 하위 목표로 분해하고 형식적으로 추론하는 모델입니다. 수학적 증명 과정에서 논리적 단계를 체계적으로 나누어 해결 능력을 높이는 데 집중합니다.
OpenAI의 Sora 서비스 중단 이후 시장을 주도하는 Runway Gen-4, Kling AI, Google Veo 3.1의 성능을 비교 분석합니다. 각 모델의 제어 기능, 가성비, 오디오 동기화 능력 및 비용 효율성을 데이터 기반으로 검토합니다.
도구 설명(Tool description)과 도구 출력(Tool output) 간의 프롬프트 인젝션 취약성 차이를 분석한 연구입니다. 모델이 도구 출력은 낮은 우선순위로 처리하여 방어하지만, 도구 설명은 시스템 지침과 유사하게 신뢰하여 공격에 취약함을 밝힙니다.
데이터가 극도로 부족한 위성 텔레메트리 환경에서 이상 징후를 탐지하기 위한 교차 모달 지식 증류(CMKD) 프레임워크를 제안합니다. 풍부한 멀티모달 데이터를 가진 교사 모델의 지식을 희소한 단일 모달리티를 가진 경량 학생 모델로 전이하여 성능을 극대화합니다.
Anthropic은 Claude의 내부 개념 영역인 J-space를 비활성화하는 실험을 진행했습니다. 실험 결과, 기본적인 텍스트 처리 능력은 유지되었으나 복잡한 사고와 지식 전이 능력은 크게 하락했습니다.

순환 신경망(RNN)을 활용하여 신약 개발을 위한 집중 분자 라이브러리를 생성하는 연구 내용을 다룹니다. 분자 구조 데이터를 학습하여 유효한 화학 구조를 생성하는 모델의 접근 방식을 설명합니다.
AI가 생성한 Python 코드의 버그를 8가지 클래스로 분류하고, 이를 자동화된 스캐너와 인간/LLM의 판단 영역으로 나누는 연구를 소개합니다. BrassCoders는 구조적 패턴을 통해 결정론적으로 포착 가능한 버그를 식별하는 데 집중합니다.
작성자가 몇 주간 DeepSeek, Qwen, Kimi, GLM 등 중국 AI 모델들을 직접 테스트한 결과입니다. 비용 효율성과 성능 측면에서 DeepSeek V4 Flash가 매우 뛰어난 결과를 보여주었습니다.

로지스틱 회귀를 위한 준 뉴턴 방법(Quasi-Newton Method) 기반의 수직 연합 학습(Vertical Federated Learning) 기법을 다룹니다. 효율적인 최적화 알고리즘을 통해 연합 학습 환경에서의 성능을 개선하는 연구 내용을 포함합니다.
LLM이 긴 컨텍스트의 중간 정보를 놓치는 'lost in the middle' 문제를 해결하기 위한 새로운 추론 방법론인 ReContext를 소개합니다. 모델 수정이나 추가 학습 없이, 어텐션 신호를 활용해 핵심 토큰을 식별하고 재귀적으로 재생하는 방식으로 긴 문맥 추론 능력을 향상시킵니다.

GLM-5.2와 Claude Fable 5의 출력 예산(Output Budget)에 따른 성능 차이를 비교 분석한 테스트 결과입니다. GLM-5.2는 높은 예산에서 추론 능력을 보여주지만 낮은 제한에서는 빈 응답을 반환하는 경향이 있는 반면, Claude Fable 5는 낮은 예산에서도 안정적인 결과물을 생성합니다.

강력한 음성 인식(ASR) 능력을 갖춘 대규모 언어 모델(LLM)을 구현하기 위한 매우 간단하고 효율적인 접근 방식을 제안합니다.
Anthropic의 코드 80%가 Claude에 의해 작성됨에 따라 AI의 재귀적 자기 개선(RSI)이 실리콘밸리의 핵심 화두로 부상했습니다. Apodex 연구원들은 인간이 해결하지 못한 난제를 풀기 위한 '발견 모델(Discovery Model)'의 필요성과 자가 진화의 메커니즘을 논의합니다.