Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
오픈 웨이트를 넘어 투명한 연구를 위한 오픈 트레이닝 프레임워크 FeynRL을 소개합니다. LLM, VLM, 에이전트의 강화학습(RL) 사후 학습 과정을 가시화하고 엔드 투 엔드로 이해할 수 있도록 설계되었습니다.
AI 에이전트의 도구 사용 및 데이터 처리 과정에서 GDPR 규정 준수를 보장하기 위한 런타임 검증 프레임워크 C-Trace를 제안합니다. 실행 트레이스를 분석하여 비준수 동작을 실시간으로 차단하고, 레드팀 공격을 통해 프레임워크의 방어 성능을 입증했습니다.
개발자의 인지적 다양성이 GitHub Copilot Chat과의 상호작용 방식에 미치는 영향을 연구한 논문입니다. 27명의 피실험자를 통해 5가지 상호작용 모드와 10가지 요구사항을 규명하여 개념 모델을 제시합니다.

OpenAI가 생물학 및 신약 개발 연구를 지원하는 프런티어 추론 모델 GPT-Rosalind를 공개했습니다. 또한, 생물학적 보안 위협에 대응하고 팬데믹 대비 역량을 강화하기 위한 'Rosalind Biodefense' 계획을 발표했습니다.
LLM 생성 텍스트 평가 시 발생하는 타당성(validity)과 판별력(discrimination) 사이의 트레이드오프를 분석한 연구입니다. Reddit 데이터를 활용한 새로운 평가 데이터셋 RECOM을 제안하며, 기존 지표들의 한계를 지적합니다.
LLM의 환각 현상과 구조화된 ML 모델의 데이터 입력 한계를 극복하기 위해, LLM을 인터페이스로 활용하는 하이브리드 시스템 ClaMPAPP을 제안합니다. LLM이 비정형 텍스트에서 임상 특징을 추출하면 XGBoost가 진단을 수행하여 높은 정확도와 안정성을 확보했습니다.
GRPO 강화학습 과정에서 발생하는 정책 엔트로피 붕괴 문제를 해결하기 위해 STARE 알고리즘을 제안합니다. 놀람도(Surprisal) 기반의 토큰 수준 이득 재가중치를 통해 안정적인 탐색과 활용의 균형을 유지하며 모델의 추론 성능을 향상시킵니다.
제2언어 습득(SLA) 연구를 위해 설계된 1.8B 규모의 L1 전용 LLM인 Dango를 소개합니다. L1 사전 학습 데이터 내 L2 오염 문제를 해결하기 위한 필터링 기법을 제안하며, 인간과 유사한 L2 생성 패턴을 구현했습니다.
블록 확산 언어 모델의 CoT 추론 성능을 높이기 위해 DreamReasoner-8B를 개발하고 블록 크기 커리큘럼 학습을 제안합니다. 작은 블록에서 큰 블록으로 점진적으로 전환하는 학습 방식을 통해 수학 및 코드 추론 성능을 극대화했습니다.
다중 에이전트 시스템(MAS)에서 발생하는 '관점 얽힘' 문제를 해결하기 위해 게임 이론 기반의 Multi-Agent Fictitious Play(MAFP)를 제안합니다. MAFP는 에이전트들이 상대의 과거 결정에 최적 대응하며 의사결정의 품질과 강건성을 높이는 새로운 패러다임입니다.
프랑스어 의료 질의응답(QA)을 사례로 도메인 적응 전략인 CPT, SFT 및 이들의 조합 효과를 비교 분석한 연구입니다. 모델 크기와 초기화 유형에 따른 성능 차이를 검증하며, 자원 제약 상황에서의 실질적인 적응 가이드라인을 제시합니다.
추론 언어 모델의 사후 학습 시 발생하는 노이즈와 스칼라 보상의 모호성을 해결하기 위한 '루브릭 조건부 자기 증류' 프레임워크를 제안합니다. 루브릭을 구조화된 피드백으로 활용하여 학생 모델이 스스로 샘플링한 궤적에 대해 토큰 수준의 정밀한 가이드를 제공합니다.
미국 지방 조례를 포괄적으로 다루는 기계 판독 가능 코퍼스인 LOCUS를 소개합니다. 9,239개 시 및 카운티의 법전을 포함하며, OCR 기술을 통해 파편화된 법률 데이터를 통합하여 법률 AI 연구를 지원합니다.
비디오 이해를 위해 POMDP 기반의 '관찰-사고-행동' 사이클을 사용하는 네이티브 옴니모달 에이전트 OmniAgent를 제안합니다. 이 모델은 필요한 정보만 선택적으로 추출하여 계산 비용을 줄이며, 테스트 시간 스케일링을 통해 성능을 향상시킵니다.
LLM의 조건부 분포를 전이 연산자로 활용하여 구조적 확률 추론을 수행하는 Large Language Gibbs 체계를 제안합니다. 단일 패스 생성 방식의 순서 의존적 편향을 극복하고, 반복적인 재샘플링을 통해 일관된 정지 분포를 생성하는 것이 특징입니다.
사용자 시뮬레이터를 효과적으로 학습시키기 위해 튜링 테스트 기반의 강화학습 방식인 Turing-RL을 제안합니다. 기존의 응답 매칭 방식 대신 LLM 판사를 활용해 실제 사용자와의 구별 불가능성을 최적화하여 성능을 높였습니다.

AI가 실제 생명 과학 연구를 지원하는 능력을 측정하기 위한 새로운 벤치마크인 LifeSciBench를 소개합니다. 173명의 전문가와 협력하여 7개의 워크플로우와 750개의 태스크를 구축했습니다.

Vals AI가 @harvey의 법률 에이전트 벤치마크(Legal Agent Benchmark) 실시간 리더보드를 공개했습니다. 이 벤치마크는 비공개 테스트 세트를 사용하여 에이전트가 실제 법률 업무 환경에서 도구를 활용해 결과물을 생성하는 능력을 평가합니다.

Anthropic의 새로운 연구를 통해 Claude AI 내부의 활성화(activations) 데이터를 인간이 이해할 수 있는 텍스트로 번역하는 기법을 소개합니다. 숫자를 텍스트로 번역한 뒤 다시 숫자로 되돌리는 '라운드 트립' 방식을 통해 AI의 내부 사고 과정을 해석하는 새로운 통찰을 제시합니다.
Anthropic의 Mythos 5와 Claude Fable 5가 고도의 취약점 발견 및 익스플로잇 개발 능력을 보여주며 보안 위협을 가중시키고 있습니다. 이러한 능력이 오픈 웨이트 모델을 통해 확산될 경우, 방어자들이 대응하기 어려운 공격 표면이 급격히 확대될 것으로 전망됩니다.