Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
자연 모방 최적화 알고리즘인 군집 지능(Swarm Intelligence)을 활용한 블랙박스 적대적 공격 기법을 분석합니다. 그래디언트 정보가 없는 환경에서도 PSO, DE, ABC 등의 알고리즘이 어떻게 신경망의 취약점을 찾아내는지 설명합니다.
실제 운영 환경의 Race Condition 버그를 대상으로 6개 LLM 모델의 디버깅 능력을 비교한 벤치마크 결과입니다. DeepSeek V4 Flash는 비용 효율성과 고유 버그 발견 능력을, MiMo V2.5 Pro는 가장 높은 버그 발견 성능을 보여주었습니다.
Qwythos-9B-Claude-Mythos-5 모델의 1M 컨텍스트 성능을 실제 코드베이스를 통해 테스트한 결과입니다. 9B 규모의 모델임에도 불구하고 긴 컨텍스트 내에서 복잡한 논리적 결함을 찾아내는 뛰어난 추론 능력을 보여주었습니다.
최상위 AI 모델들이 학습 데이터 차단 시점(training cutoff) 이후에 철회된 실제 논문을 유효한 정보로 인용하는 구조적 한계를 분석합니다. 모델의 규모를 키워도 해결되지 않는 문제이기에, 외부 레지스트리와 대조하는 검증 계층의 필요성을 강조합니다.
Google DeepMind가 발표한 Gemma 4 기술 보고서는 단순한 벤치마크 성능을 넘어, 로컬 하드웨어 최적화와 멀티모달 기능에 집중합니다. 특히 12B 모델은 별도의 인코더 없이 이미지와 오디오를 직접 처리하여 메모리 효율성을 극대화했습니다.
기존 에이전트 벤치마크가 성능 점수에만 집중했던 한계를 넘어, 작업 완료에 소요되는 비용 데이터를 결합한 새로운 계층을 구축했습니다. 에이전트 설정부터 검증된 결과 및 비용까지 연결하여 실질적인 경제성을 평가할 수 있는 데이터를 제공합니다.

선형 미분 제약 조건이 존재하는 시스템을 위한 최적 모션 계획 알고리즘인 Kinodynamic RRT*에 대해 다룹니다. 시스템의 동역학적 특성을 고려하여 최적의 경로를 생성하는 연구 내용을 포함합니다.

로컬 LLM을 활용한 코드 리뷰 실험을 통해 다수결 투표 방식의 한계를 분석했습니다. 실험 결과, 다수결 방식은 모델의 정확성보다 특정 패턴의 지속성을 선택하는 경향이 있으며, 온도 설정에 따라 결과의 결정론적 특성이 변화함을 확인했습니다.
홍콩 과학기술대학교 연구진이 AI 에이전트용 악성 스킬을 탐지하는 정적 스캐너를 90% 이상의 확률로 우회하는 'SkillCloak' 기술을 발표했습니다. 난독화와 자기 추출 패킹을 활용하며, 정적 분석의 한계를 보완하는 런타임 샌드박스 'SkillDetonate'도 함께 제안되었습니다.

그래프 분류(Graph Classification) 작업에서 강력한 그래프 신경망(GNN)이 반드시 필요한지에 대해 심층적으로 분석합니다. 기존 방법론과 GNN의 성능을 비교하며 그래프 데이터 처리의 핵심 원리를 해부합니다.

Anthropic의 Jacobian Lens 기술을 통해 LLM 내부의 숨겨진 추론 과정인 'J-space'를 분석합니다. 이는 모델이 출력하지 않는 내부 사고 과정을 전역 작업 공간(Global Workspace) 형태로 유지함을 수학적으로 증명합니다.
AI 모델의 성능을 평가하는 벤치마크 차트의 함정과 올바른 해석 방법을 다룹니다. SWE-bench Pro, Terminal-Bench 2.1 등 최신 벤치마크의 특성과 데이터 오염, 하위 집합 선택에 따른 수치 왜곡 가능성을 경고합니다.

von Mises-Fisher 혼합 모델을 활용하여 얼굴 검증(Face Verification) 성능을 향상시키는 딥러닝 방법론을 다룹니다. 데이터의 방향성 분포를 모델링하여 얼굴 인식의 정확도를 높이는 연구 내용을 포함합니다.
LLM의 텍스트 기반 안전 정렬이 도구 호출(tool-call)을 통한 실제 행동의 안전성을 보장하지 못한다는 연구 결과를 다룹니다. 텍스트 거부 메커니즘과 실제 에이전트의 행동 사이의 간극을 분석하며, 프롬프트 주입 공격의 위험성을 경고합니다.
프로그래밍 언어의 문법적 장황함이 LLM의 토큰 소모와 환각(Babbling)에 미치는 영향을 분석한 연구들을 소개합니다. Java와 같은 장황한 언어보다 Python과 같이 간결한 언어가 토큰 효율성과 생성 정확도 측면에서 유리함을 데이터로 입증합니다.

DeepSeek-Prover-V2는 강화학습을 활용하여 복잡한 수학적 문제를 하위 목표로 분해하고 형식적으로 추론하는 모델입니다. 수학적 증명 과정에서 논리적 단계를 체계적으로 나누어 해결 능력을 높이는 데 집중합니다.
OpenAI의 Sora 서비스 중단 이후 시장을 주도하는 Runway Gen-4, Kling AI, Google Veo 3.1의 성능을 비교 분석합니다. 각 모델의 제어 기능, 가성비, 오디오 동기화 능력 및 비용 효율성을 데이터 기반으로 검토합니다.
도구 설명(Tool description)과 도구 출력(Tool output) 간의 프롬프트 인젝션 취약성 차이를 분석한 연구입니다. 모델이 도구 출력은 낮은 우선순위로 처리하여 방어하지만, 도구 설명은 시스템 지침과 유사하게 신뢰하여 공격에 취약함을 밝힙니다.
데이터가 극도로 부족한 위성 텔레메트리 환경에서 이상 징후를 탐지하기 위한 교차 모달 지식 증류(CMKD) 프레임워크를 제안합니다. 풍부한 멀티모달 데이터를 가진 교사 모델의 지식을 희소한 단일 모달리티를 가진 경량 학생 모델로 전이하여 성능을 극대화합니다.
Anthropic은 Claude의 내부 개념 영역인 J-space를 비활성화하는 실험을 진행했습니다. 실험 결과, 기본적인 텍스트 처리 능력은 유지되었으나 복잡한 사고와 지식 전이 능력은 크게 하락했습니다.