Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
방글라 수어(BdSL) 인식을 위해 전문가가 검증한 RSBdSL38 데이터셋과 경량 어텐션 기반 컨볼루션 네트워크를 제안합니다. 이 모델은 매우 적은 파라미터로도 높은 정확도를 기록하며, 온디바이스 배포에 최적화된 성능을 보여줍니다.
DASH는 추론 모델의 온폴리시 자기 증류(OPSD) 과정에서 발생하는 신호 희소성 문제를 해결하기 위한 새로운 방법론입니다. 발산 적응형 감독 지평(DASH)을 통해 토큰 수준의 감독 가중치를 시퀀스의 시간적 맥락에 따라 동적으로 조정하여 모델의 추론 성능을 향상시킵니다.
개인정보 보호를 위해 사용되는 합성 임상 벤치마크의 비현실성을 해결하기 위한 연구입니다. 유용성 검사를 유지하면서도 결측 구조와 인구 통계적 일치성을 개선하여 벤치마크의 현실성을 높이는 방법을 제안합니다.
멀티모달 LLM의 시각적 도구 사용(crop-and-zoom 등)이 실제 추론에 인과적 기여를 하는지 분석한 연구입니다. 분석 결과, 많은 모델이 비용 대비 낮은 성능을 보이거나 무의미한 시각적 정보를 호출하는 '시각적 도구 사용의 환상' 현상을 보임을 발견했습니다.
대규모 스킬 라이브러리를 사용하는 에이전트의 효율적인 스킬 검색을 위해 하이브리드 랭커와 타입화된 지식 그래프 방식을 비교 연구했습니다. 연구 결과, 지식 그래프는 관계 의미론을 풍부하게 할 수는 있으나 검색 도달 범위를 확장하는 데는 한계가 있음을 밝혀냈습니다.
EnvACE는 외부 환경과의 상호작용 대신 '월드 리허설'을 통해 환경 역학을 내재화하는 에이전트 강화 학습 방법론을 제안합니다. 모델이 행동과 그에 따른 환경 응답을 스스로 생성하며 학습함으로써, 외부 시뮬레이터 없이도 강력한 에이전트 세계 모델을 구축할 수 있습니다.
PRISM은 비쌍 이미지 변환에서 콘텐츠와 외형 분리를 개선하기 위해 분포 게이팅 기반 플로우 매칭 프레임워크를 제안합니다. 기존 방식의 전역 노이즈 대신, PRISM은 학습된 특징별 게이트(per-feature gate)를 사용하여 어떤 특징을 보존하고 무엇을 변경할지 정밀하게 제어합니다. 이 방법은 다양한 벤치마크에서 우수한 성능과 구조적 보존 능력을 입증했습니다.
순환 제조 공급망 최적화를 위한 강화학습 에이전트가 실제 정책 제약 조건을 반영하지 못하는 문제를 해결하기 위해, 생성형 AI를 활용한 '생성형 시뮬레이션 벤치마킹' 프레임워크를 제안합니다. 동적인 정책 제약 조건을 실시간으로 인코딩하여 실제 운영 환경과 유사한 적응형 시나리오를 합성하는 방법론을 다룹니다.

Artificial Analysis의 에이전틱 인덱스 평가 결과, Qwen3.8 Max가 종합 최고의 모델로 선정되었습니다. 본 보고서는 지능, 비용, 속도, 개방성 등 다양한 지표를 통해 프런티어 모델과 에이전트의 성능을 독립적으로 분석합니다.

Scotoma-2는 Gemma4를 기반으로 하며, 특정 클리셰(예: 'It's not x, it's y')와 과도한 어시스턴트 페르소나 습관을 줄여 문장력을 개선한 모델입니다. 제작자는 DPO(Direct Preference Optimization) 방식으로 4개의 별도 데이터셋을 구축하여 Gemma4의 고유한 문제점을 타겟팅했습니다.
DeepSeek V4 Flash 모델의 공식 출시와 함께 모델 카드 및 config.json을 통한 아키텍처 분석을 수행합니다. Flash 모델이 이전 Pro 버전보다 적은 활성화 파라미터로도 우수한 벤치마크 성능을 보임을 검증합니다.

캐릭터 LoRA 학습은 캐릭터의 '특징'을 구현하는 데는 효과적이지만, 연속된 영상에서 요구되는 '동일성(Identity)'을 유지하기에는 근본적인 한계가 있습니다. 이는 확산 모델이 매번 노이즈로부터 이미지를 재구성하는 과정에서 발생하는 원리적 드리프트(Drift) 때문입니다.
Qwen 3.8 Max가 Agentic Index에서 상위권을 기록하며 중국 모델의 기술적 추격을 보여줍니다. 최신 LLM 벤치마크 결과와 실제 사용 경험 사이의 괴리, 그리고 지능 평가 방식의 한계를 분석합니다.
4만 번의 시뮬레이션 게임을 통해 인간 감독관들이 AI 에이전트 명령 승인 과정에서 실제 위협 중 약 3분의 1을 놓치는 것으로 나타났습니다. 이는 '인간 참여형(Human-in-the-loop)'이라는 안전성 주장에 근본적인 의문을 제기하며, 구조적이고 계층화된 감독 전략의 필요성을 강조합니다.
OpenAI가 차세대 모델 Astra를 활용해 10년 동안 해결되지 않은 10가지 수학 문제를 해결하려는 시도를 공개했습니다. 이 과정에서 Lean 4 형식화와 추론 흔적을 포함한 높은 수준의 투명성을 제공하며, AI가 수학 연구의 패러다임을 바꿀 수 있음을 시사합니다.
LLM을 활용한 AI 취약점 스캐너의 첫 번째 벤치마크 테스트 결과를 공유합니다. OWASP Benchmark를 대상으로 테스트한 결과, 정밀도는 0.60으로 높았으나 재현율이 0.07에 그쳐 실제 버그의 93%를 놓치는 한계를 보였습니다.

Stanford 연구팀이 생성형 AI를 활용해 자연계에 존재하지 않는 새로운 합성 바이러스를 설계하는 데 성공했습니다. 이 기술은 의학적 돌파구가 될 수 있으나, 생물학적 무기 악용 가능성과 규제 사각지대에 대한 우려를 동시에 낳고 있습니다.
Meta의 Muse Code 및 Muse Spark 1.2 모델 출시와 성능/비용 구조를 분석합니다. DeepSeek의 대안으로서 비전 기능과 저렴한 비용을 갖췄으나, 벤치마크 비교 방식과 모델 공개 범위에 대한 비판적 시각을 담고 있습니다.

Character.AI는 러시아에서 기술적 접속 차단은 없으나, 18세 미만 사용자의 자유로운 대화 기능을 단계적으로 축소했습니다. 이는 플랫폼의 보안과 기능성 사이의 타협점이며, CEO는 이 조치로 인해 사용자 이탈(Churn)이 발생할 것이라 인정했습니다. 또한 외부 평가에서는 AI 컴패니언들이 미성년자에게 위험하며 연령 제한은 우회 가능하다고 지적합니다.
Google I/O 2026에서 발표된 Gemini 3.5 Flash 모델의 성능 향상과 전략 변화를 다룹니다. Flash 모델이 Computer Use 기능을 내장하며 에이전트 성능에서 기존 최상위 모델들을 능가하는 지표를 기록했음을 설명합니다.