Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
교차 언어 인컨텍스트 학습(ICL)에서 소스 언어 선택이 성능에 미치는 영향을 분석한 연구입니다. 기존 미세 조정 방식과 달리 ICL에서는 기존의 통찰이 그대로 적용되지 않음을 밝히고, 언어 혼동 현상 분석과 새로운 소스 언어 선택 휴리스틱을 제안합니다.
복잡한 작업을 수행하기 위해 여러 기술을 조합하는 '구성적 기술 라우팅' 문제를 해결하기 위한 SkillWeaver 프레임워크를 제안합니다. 작업 분해, 기술 검색, 계획 구성을 결합하여 LLM 에이전트의 도구 활용 능력을 극대화합니다.
LLM이 간병인 지원 과정에서 실제 경험 없이도 마치 경험이 있는 듯한 언어를 생성하는 '합성된 삶의 경험의 역설'을 연구합니다. 연구 결과, AI는 정서적 표현은 모방하지만 실제 경험적 근거는 결여된 '서사적 진정성 격차'를 보였습니다.
하이브리드 어텐션 구조에서 FA와 SWA의 최적 할당을 학습하는 프레임워크 ConSA를 제안합니다. L0 정규화와 증강 라그랑주 제약 조건을 통해 사용자가 지정한 희소성 목표에 맞춰 어텐션 유닛을 효율적으로 배치합니다.
LLM 에이전트가 자율 연구 과정에서 유사과학을 생성하고 확산할 위험을 측정하기 위한 벤치마크인 PseudoBench를 소개합니다. 실험 결과, 현재의 최첨단 에이전트들은 유사과학적 주장에 대한 저항력이 매우 낮아 과학적 정렬이 시급함을 보여줍니다.
역사학적 방법론을 RAG 아키텍처에 통합한 HistoRAG 프레임워크를 제안합니다. 시간적 윈도잉과 분리된 검색/생성 방식을 통해 기존 RAG의 시간적 왜곡과 검색 한계를 해결하며, 해석적 학문을 위한 새로운 RAG 설계 모델을 제시합니다.
WildChat 데이터셋을 활용하여 사용자가 LLM에 질문하는 보안 및 개인정보 보호(S&P) 프롬프트의 특성을 분석한 연구입니다. 상용 모델이 오픈 웨이트 모델보다 우수한 성능을 보이지만, 실행 시마다 응답의 일관성이 떨어져 사용자에게 혼란을 줄 위험이 있음을 확인했습니다.
AI 에이전트가 사용자를 대신해 행동할 때 동물 복지를 고려하는지 측정하는 최초의 벤치마크인 TAC를 소개합니다. 실험 결과, 프론티어 모델들은 동물 착취를 피하는 능력이 확률 수준보다 낮았으며, 시스템 프롬프트 추가에 따른 모델별 성능 개선 폭도 상이함을 확인했습니다.
LLM이 사용자 메타데이터를 통해 지리적 정보를 인지할 때 발생하는 의도치 않은 지역적 편향과 위치 누출 현상을 분석한 연구입니다. 실험 결과, 위치 정보 노출 시 특정 지역 특화 출력이 급증하며 모델의 중립성이 훼손됨을 확인했습니다.
현재 법률 AI 평가는 단순 보조 업무에 치중되어 있어, 법률 해석의 핵심인 법리적 법률 추론 능력을 측정하는 데 한계가 있습니다. EU AI Act의 고위험 AI 정확성 요구 사항을 충족하기 위해서는 이를 검증할 수 있는 새로운 벤치마크가 필요합니다.
Anthropic의 Fable 5와 Opus 4.8 모델을 대상으로 HackAgent 프레임워크를 통한 레드팀 연구를 수행했습니다. 자동화된 탈옥 공격에 대한 모델의 적대적 강건성을 평가한 결과, 적응형 반복 공격에 대한 취약성이 확인되었습니다.
dLLMs(확산 언어 모델)를 위한 최초의 온폴리시 자기 증류(OPSD) 프레임워크인 d-OPSD를 제안합니다. 기존 자기회귀 방식과 달리 접미사 조건화와 단계 수준 감독을 통해 dLLMs의 반복적 노이즈 제거 과정에 최적화된 학습 방식을 제공합니다.
Al-Mawrid 아랍어-영어 사전을 디지털화하기 위해 ISO LMF와 TEI Lex-0를 결합한 인코딩 방법론을 제안합니다. 연구 결과 91%의 구조적 파싱 정확도와 높은 정보 추출 성능을 입증하며, 아랍어 NLP를 위한 재현 가능한 워크플로우를 제시합니다.
지식 증류 시 발생하는 일반화 성능 저하와 강화학습의 데이터 폐기 문제를 해결하기 위해 ZPPO 알고리즘을 제안합니다. 교사의 지식을 그래디언트가 아닌 프롬프트 내에 주입하여 학생 모델의 근접 발달 영역을 효과적으로 학습시킵니다.
인도 철학 전통을 아우르는 125,000개 이상의 텍스트 레코드로 구성된 Darshana Graph 코퍼스를 소개합니다. 문체론적 분석과 LLM 기반의 관계 추출을 통해 학파 간의 논증 스타일과 철학적 관계를 그래프 형태로 분석합니다.
의료용 개인 건강 에이전트의 성능을 평가하기 위한 새로운 프레임워크인 RubricsTree를 소개합니다. 전문가의 지식을 바탕으로 한 계층적 루브릭과 적응형 라우터를 통해, 비용 효율적이면서도 임상적으로 검증 가능한 대규모 개방형 평가 방식을 제공합니다.
GitHub 이슈를 활용하여 연구 결과의 재현성을 자동으로 감사하는 확장 가능한 프레임워크인 ReproRepo를 소개합니다. LLM 에이전트가 논문과 저장소 간의 불일치를 식별하는 능력을 평가하며, 실제 재현 방해 요소를 찾는 데 효과적임을 입증했습니다.
모든 레이어에 동일한 폭을 적용하는 기존 트랜스포머와 달리, 레이어별로 폭을 다르게 할당하는 '> <former' 아키텍처를 제안합니다. 초기와 후기 레이어는 넓게, 중간 레이어는 좁게 구성하여 성능을 높이고 계산 효율성을 개선했습니다.
장기 시뮬레이션 시 발생하는 비용과 오차 누적 문제를 해결하기 위해 루프형 아키텍처인 LoopWM을 제안합니다. 파라미터 공유 트랜스포머 블록을 통해 잠재 상태를 반복 정제하며, 적응형 연산을 통해 높은 파라미터 효율성을 달성합니다.
기존 Critic-free RL의 그룹 기반 롤아웃 방식이 가진 데이터 비효율성과 유연성 부족 문제를 분석합니다. 부정적 샘플에 대한 잘못된 페널티를 방지하는 '부정적 토큰 필터링' 전략을 통해 단일 롤아웃만으로도 높은 성능을 달성하는 방법을 제안합니다.