Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Transformer 모델에서 지시어 기반 억제가 금지된 개념의 내부 표현을 실제로 제거하는지 조사한 연구입니다. 실험 결과, 억제된 개념은 은닉 표현과 어텐션 라우팅에 여전히 남아 있어 행동적 정렬과 표현적 정렬 사이의 격차를 보여줍니다.
AutoScientists는 장기적인 과학 실험을 위해 탈중앙화된 방식으로 자가 조직화되는 AI 에이전트 팀 프레임워크입니다. 공유된 실험 상태를 바탕으로 가설을 검토하고 성공과 실패를 공유하며, 생물 의학 및 언어 모델 최적화 분야에서 기존 에이전트보다 뛰어난 성능을 입증했습니다.
LLM의 가드레일과 페르소나가 현실과의 격차를 만들어내는 '현실 세탁(reality laundering)' 현상의 위험성을 경고합니다. 안전 시스템이 실제 위험을 해결하기보다 제도적 안심을 위해 현실을 왜곡할 수 있음을 지적하며, 하향식 인과적 요구사항 명세를 대안으로 제시합니다.
본 논문은 SMT 기반의 형식적 계획 방식에 LLM을 결합하여 산업 자동화의 계획 수립을 돕는 하이브리드 시스템을 제안합니다. LLM은 자연어 상호작용과 지식 모델의 유연한 수정을 담당하며, 심볼릭 플래너는 계획의 정확성을 보장합니다.
DREAM-R은 멀티모달 모델의 추론 속도를 높이기 위한 새로운 투기적 추론 프레임워크입니다. 강화학습 기반의 SAPO와 임계값 기반 검증 메커니즘(TBVM)을 통해 초안과 대상 모델 간의 불일치를 해결하고 병렬 실행을 극대화합니다.
ACROS는 동결된 사전 학습된 디코더 언어 모델 내부에 명시적인 의미 경로를 유도하는 새로운 방법론을 제안합니다. SmolLM2-360M 모델을 통해 중의성 해소, 어휘 스티어링, 교차 언어 적응 성능을 입증했습니다.
자율 여행 계획 에이전트의 신뢰성을 평가하기 위한 새로운 벤치마크 VeriTrip을 제안합니다. 비정형 멀티모달 웹 데이터를 활용하여 정보 노이즈와 사실적 모순을 처리하는 능력을 검증하며, MLLM의 검색-추론 트레이드오프를 분석합니다.
딥러닝의 역전파 메커니즘과 인간 뇌의 시각 처리 계층 간의 일치 여부를 연구했습니다. DINOv3 등 비전 모델을 분석한 결과, 역전파된 그래디언트가 뇌 신호를 예측할 수는 있으나 그 공간적·시간적 조직은 생물학적 메커니즘과 일치하지 않음을 발견했습니다.
직장 내 AI 도입이 직업적 품위와 업무의 의미에 미치는 영향을 연구한 논문입니다. IT, 의료, 서비스직 종사자들을 대상으로 인터뷰를 진행하여 직무 만족도에 미치는 차별적 영향을 분석했습니다.
TRACER는 다중 LLM 에이전트의 협력적 추론을 위해 강화학습과 후회 매칭을 결합한 새로운 프레임워크입니다. 컨트롤러와 생성-크레딧 레이어를 분리하여 무임승차 문제를 해결하고, 수학적 수렴성을 보장하며 효율적인 협업 정책 학습을 가능하게 합니다.
심근 변형률 추정의 정확도를 높이기 위해 물리 기반 시뮬레이션과 반복적 정밀화 과정을 결합한 새로운 전략을 제안합니다. 실제 영상의 스펙클 탈상관 측도를 통합하여 사실적인 합성 시퀀스를 생성하며, 이를 통해 고성능의 오픈 소스 데이터셋을 구축했습니다.
GSM-Symbolic 벤치마크가 LLM의 추론 능력 부족을 주장한 결론에 대해 통계적 재평가를 수행합니다. GLMM 분석 결과, 성능 저하의 상당 부분이 큰 숫자 분포와 같은 데이터 편향에 기인하며, 모델별 실패 프로필이 상이함을 밝힙니다.
AI의 이분법적 도덕 판단 한계를 극복하기 위해 윤리적 다원주의를 확률적 분포로 모델링하는 프레임워크를 제안합니다. 규범 윤리 심플렉스를 도입하여 다양한 윤리 이론을 통합하고, 450개의 사례로 구성된 벤치마크를 통해 모델의 성능을 입증했습니다.
본 연구는 진화 알고리즘(EA) 분야에서 라마르크 및 볼드윈 진화의 성능을 다윈 진화와 비교 분석합니다. 실험 결과, 국소 탐색이 강화된 진화 방식이 딥러닝 베이스라인보다 우수한 성능을 보였으며, 이론적 분석을 통해 각 진화 유형의 실행 시간 상한과 하한을 증명했습니다.
본 연구는 다국어 환경에서 LLM-as-a-Judge의 신뢰성을 높이기 위한 전략을 탐구합니다. 영어, 스페인어, 바스크어를 대상으로 데이터 가용성에 따른 미세 조정 효과와 모델 크기 간의 트레이드오프를 체계적으로 분석했습니다.
본 연구는 사고 모델(thinking model)이 긴 컨텍스트를 자연스럽게 압축할 수 있다는 '압축으로서의 사고(TaC)' 패러다임을 제안합니다. 별도의 압축 모듈 없이 사고 흔적을 활용하며, 제약 조건이 추가된 TaC-C 모델은 기존 압축 방식보다 뛰어난 성능을 입증했습니다.
IPO 신고서의 복잡한 구조를 분석하기 위한 오픈 소스 프레임워크인 IPO-Toolkit과 대규모 멀티모달 데이터셋인 IPO-Dataset을 소개합니다. 10만 개 이상의 문서를 활용해 금융 문서 내 멀티모달 추론의 한계와 정렬 문제를 연구합니다.
LLM 검색 에이전트가 외부 검색보다 모델 내부 지식에 의존하는 '내재적 지식 의존성(IKD)' 문제를 분석합니다. 이를 평가하기 위해 최신 정보를 활용한 새로운 심층 검색 벤치마크인 LiveBrowseComp를 제안합니다.
모델 가중치를 수정하지 않고 LLM을 정렬하는 MARI 기법을 제안합니다. 에너지 보정 기반의 멀티 어댑터와 게이팅 모듈을 통해 샘플별로 최적화된 개입 방향과 강도를 결정하여 정렬 성능과 일반 능력을 동시에 향상시킵니다.
AlphaTransit는 MCTS와 신경망 정책-가치 네트워크를 결합하여 도시 규모의 대중교통 노선 설계를 최적화하는 프레임워크입니다. 지연된 피드백 문제를 해결하기 위해 시뮬레이터 롤아웃 없이도 의사결정 시점의 앞서보기를 제공하며, 벤치마크 테스트에서 기존 방식보다 높은 서비스율을 달성했습니다.