Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

보안 연구자 bikini가 AI 퍼징 워크플로우를 활용해 발굴한 PoC 및 취약점 리서치 통합 아카이브인 exploitarium을 공개했습니다. 7-Zip, FFmpeg 등 주요 소프트웨어의 취약점을 재현하며, AI를 퍼징 자동화 도구로 활용하는 방법론을 제시합니다.

로컬 LLM인 Gemma4를 활용하여 과거 연도의 날짜별 요일 정답률을 테스트한 실험 결과입니다. 2025년 기준 약 96%의 높은 정답률을 보였으나, 학습 데이터의 시점과 추론 방식에 따른 한계가 관찰되었습니다.
Hugging Face에서 주목받는 10개의 최신 AI 논문을 통해 세계 모델, 에이전트, 추론 가속화, 멀티모달 생성 모델의 트렌드를 분석합니다. Orca의 통합 잠재 공간 학습과 에이전트의 기권(Abstention) 전략 등 핵심 연구를 다룹니다.
Baidu가 단 한 번의 패스로 책 한 권 전체를 전사할 수 있는 'Unlimited OCR' 모델을 공개했습니다. 컨텍스트 윈도우를 늘리는 대신 어텐션 메커니즘을 최적화하여 메모리 사용량을 일정하게 유지하면서도 긴 문서 처리를 가능하게 했습니다.
S-Agent는 VLM을 플래너로 활용하여 다중 뷰 이미지와 비디오로부터 3D 장면 메모리를 구축하는 에이전트 프레임워크입니다. 시공간적 증거 축적 방식을 통해 8B 규모의 모델이 대규모 모델과 경쟁할 수 있는 공간 추론 능력을 제공합니다.
DeepSeek, Qwen, Kimi, GLM 등 중국산 LLM 4종을 대상으로 30일간 진행한 벤치마킹 결과를 공유합니다. 코드 생성, 추론, 채팅 성능과 지연 시간, 비용 효율성을 실제 워크로드 기반으로 비교 분석했습니다.

통계 학습 입문서인 'An Introduction to Statistical Learning'의 내용을 Python 코드로 구현한 오픈소스 프로젝트 isl-python을 소개합니다. 회귀, 분류, 규제화 등 주요 통계 학습 개념을 장별로 실습할 수 있도록 구성되었습니다.
olmOCR은 PDF 및 이미지 기반 문서를 깨끗한 Markdown 형식으로 변환하는 VLM 기반 툴킷입니다. 수식, 표, 필기체 등 복잡한 서식을 지원하며, 자체 벤치마크인 olmOCR-Bench를 통해 성능을 검증합니다.

Genie Sim 3.0은 LLM을 활용하여 합성 장면을 생성하고 체화된 AI(Embodied AI)를 평가하는 기술을 선보였습니다. 이를 통해 AI 모델의 환경 상호작용 능력을 더욱 정밀하게 검증할 수 있습니다.
EU AI Act 등 강화되는 데이터 프라이버시 규제에 대응하기 위한 분산형 머신러닝 기술인 연합 학습(Federated Learning)과 HPE Swarm Learning을 비교 분석합니다. 데이터 중앙집중화의 보안 및 규제 리스크를 해결하기 위한 두 아키텍처의 차이점을 다룹니다.

연구진이 LLM의 추론 과정을 조작하여 보안 가이드라인을 우회하는 'CoT Forgery' 취약점을 발견했습니다. 모델이 역할 태그보다 텍스트 스타일을 통해 권한을 판단한다는 점을 악용하여 탈옥 성공률을 대폭 높였습니다.
새로운 AI 벤치마크 GPTNT 테스트 결과, 모든 AI 모델이 실시간 협업 및 정보 비대칭 상황에서 폭탄 해체에 실패했습니다. 이는 현재 LLM이 단일 응답 최적화에 치중되어 있어 실시간 소통과 협업 능력이 부족함을 시사합니다.
Anthropic이 계산 생물학 및 신약 개발에 특화된 Claude Science를 출시했습니다. 이 도구는 전문 데이터베이스 조회와 과학 소프트웨어 실행을 통해 단백질 구조 예측 등 복잡한 연구 작업을 획기적으로 단축합니다.

Anthropic이 기존 Opus 4.8을 능가하는 성능을 가진 Claude Sonnet 5를 출시했습니다. 이 모델은 GDPval-AA v2 벤치마크에서 최고점을 기록하며, 더욱 강력한 에이전트적 능력을 갖춘 것이 특징입니다.
저장소 기반 자동 수리 과정에서 파일 수준의 이슈 로컬라이제이션이 미치는 영향을 평가하기 위한 모듈형 프레임워크 Loc2Repair를 제안합니다. 실험 결과, 명시적인 로컬라이제이션은 수리 성공률을 높이고 평균 경과 시간을 단축하는 핵심 요소임을 입증했습니다.
LLM의 버그 수정 능력을 정밀하게 평가하기 위해 제안된 대규모 벤치마크 MegaBugFix를 소개합니다. LLM을 활용해 Diff 방식의 코드 오염 기법으로 12,629개의 Python 버그 프로그램을 합성하여 기존 벤치마크의 한계를 극복했습니다.
명세 기반 개발(SDD) 프레임워크에서 LLM 생성 코드의 추적성과 환각 탐지 성능을 비교 연구한 논문입니다. 인용 주석을 강제하는 방식이 코드의 결정론을 낮추는 대신, 환각 탐지율을 획기적으로 높인다는 트레이드오프를 입증했습니다.
코드 LLM이 폐기된 API를 생성하는 문제를 해결하기 위해, 구식 지식을 억제하고 올바른 API 사용을 유도하는 '대조적 언러닝(CURE)' 기법을 제안합니다. 실험 결과, CURE는 코드 생성 성능을 유지하면서도 폐기된 API 사용을 줄이고 최신 API로의 대체 성능을 크게 향상시켰습니다.
소프트웨어 라이선스의 복잡한 관계를 체계적으로 비교하기 위해 LLM을 활용한 새로운 방법론을 제안합니다. 라이선스의 허용성을 기반으로 한 부분 순서 구축과 기존 분류 체계를 활용하여 라이선스 간의 관계를 분석합니다.
코드 생성 LLM이 생성한 코드의 보안 취약성을 스스로 인지하는 '보안 캘리브레이션' 능력을 분석한 연구입니다. GPT-4o-mini, Gemini-2.0-Flash 등을 평가한 결과, 모델들이 보안 문제에 대해 과잉 확신하는 경향이 있음을 발견했습니다.