Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

연구진은 Evo라는 유전체 AI 모델을 훈련시켜, 수조 개의 뉴클레오타이드 패턴을 학습하고 자연에 존재하지 않던 새로운 바이러스 게놈을 설계하는 데 성공했습니다. 이 모델은 생물학적 DNA 배열의 통계적 패턴을 이해하여, 기존 방식으로는 불가능했던 신규 유전체 청사진을 생성할 수 있음을 입증했습니다.
OpenAI가 차기 모델 Astra의 개발을 일시 중단했습니다. 자체 Preparedness Framework 평가 결과, 모델이 자율적인 사이버 보안 공격 역량을 가질 가능성이 있는 'Critical' 임계값을 초과했기 때문입니다.
LLM을 활용한 피어 리뷰 과정에서 발생하는 세 가지 주요 문제점을 분석합니다. LLM은 중요도가 낮은 변수를 과도하게 탐색하고, 비판 내용이 지나치게 추상적이며, 기술적 세부 사항에 대한 이해가 부족하여 실질적인 연구 검토에 한계가 있음을 지적합니다.
LLM을 이용한 테스트 오라클 생성 시, 반복적인 자가 수정이 결함 탐지 능력을 저하시키는 '자가 수정의 함정' 문제를 분석합니다. 이를 해결하기 위해 정적 문맥과 동적 상태를 통합하여 높은 신호 대 잡음비를 제공하는 비반복적 프레임워크 DCAware를 제안합니다.
Anthropic이 차세대 플래그십 모델인 Claude Opus 5를 공식 발표했습니다. 이와 함께 Python SDK 업데이트를 통해 에이전트의 도구 사용(tool-use) 역량과 세션 예산 관리 등 정교한 API 제어 기능을 강화했습니다.
본 연구는 자동차 소프트웨어 검증 과정에서 발생하는 방대한 센서 데이터를 분석하고 결함을 진단하는 새로운 방법을 제시합니다. 기존의 임계값 기반 도구나 데이터 분류기의 한계를 극복하기 위해, 오픈 소스 명령어 조정형 LLM을 활용하여 해석 가능하고 효율적인 결함 탐지 및 진단 엔진 역할을 할 수 있는지 조사했습니다.
본 연구는 LLM이 프로젝트 수준 코드 생성 시 특정 언어(특히 Python)를 과도하게 선호하는 문제를 측정하기 위해 LangChoiceBench라는 벤치마크를 제안합니다. 이 벤치마크는 다양한 소프트웨어 영역에서 LLMs의 언어 선택, 추천-구현 일관성, 그리고 언어 다양성을 평가했습니다.
한 개발자가 nanoGPT를 사용하여 오직 터키 드라마 데이터만을 학습시킨 2,500만 파라미터 규모의 소형 모델을 개발했습니다. 이 모델은 수학적 지식 없이 드라마의 서사적 패턴만을 학습한 것이 특징입니다.
임상 소프트웨어가 규제 대상 의료기기가 되는지 여부는 기술적 구현 방식이 아닌, '어떤 기능을 수행한다고 주장하는가(intended-use)'라는 의도된 용도에 따라 결정됩니다. EU와 미국 모두 특정 목적의 소프트웨어는 규제를 받지만, 특히 미국은 임상 의사결정 지원 소프트웨어에 대한 예외 조항을 가지고 있어 구조적 차이가 있습니다.
MiniMax H3 모델의 비디오 및 오디오 생성 속도를 혁신적으로 높이는 터보 가속 기능이 출시되었습니다. 오픈 소스 LoRA 기술을 활용하여 생성 단계를 20단계에서 4단계로 단축했습니다.

MiniMax H3는 R2V(Reference-to-Video) 방식을 통해 스토리보드를 시각적 참조로 사용하여 비디오를 생성합니다. 프롬프트 대신 스토리보드의 구도와 캐릭터 위치를 이해하며, 문맥을 통해 오류를 스스로 수정하는 능력을 갖췄습니다.

AgentOPSD는 에이전트 기반 강화학습에서 턴 단위 신용 할당을 위해 비평가(Critic-free) 방식을 사용하는 재귀적 방법론입니다. 희소한 보상을 조밀한 신호로 변환하여 ALFWorld, WebShop 등 다양한 환경에서 기존 GRPO 및 자기 증류 방식을 능가하는 성능을 보여줍니다.

Hugging Face에 학술 지식 그래프 검색 성능을 평가하기 위한 풀 사이클 벤치마크가 출시되었습니다. 실제 쿼리와 API 실행 궤적, 검증된 답변을 포함한 1,133개의 QA 쌍을 제공합니다.
Hugging Face가 서베이 논문을 평가하기 위한 리뷰어 정렬(reviewer-aligned) 벤치마크를 출시했습니다. 이 벤치마크는 실제 동료 심사 보고서를 바탕으로 가독성, 비판성, 포괄성, 구조를 점수화하여 평가합니다.

NVIDIA가 Hugging Face에 NeMo Gym의 대화형 도구 사용(conversational tool-use)을 위한 새로운 자산을 출시했습니다. 이 자산은 골든 정책/도구 참조 쌍과 프롬프트 기록 번들을 포함하고 있습니다.

컴퓨터 사용 에이전트의 궤적을 평가하는 VLM 판사의 신뢰성을 테스트하기 위한 인간-골드 벤치마크인 OSReward를 소개합니다. 상용 모델 대비 비용을 30~60배 절감하면서도 성능이 일치하는 오픈 소스 보상 모델 OS-Shepherd를 제공합니다.
EdgeXpert는 MoE와 추측적 디코딩을 결합할 때 발생하는 호환성 문제를 해결하기 위한 소프트웨어-하드웨어 공동 설계 가속기입니다. 프롬프트 단위의 전문가 재사용과 깊이 인식 전문가 병합 기술을 통해 메모리 액세스를 최소화합니다. 이를 통해 정확도를 유지하면서 지연 시간과 에너지 소비를 획기적으로 줄였습니다.

장기적 목표를 수행하는 터미널 에이전트를 위해 재귀적 합성 방식을 제안하는 논문입니다. 기존 고비용 작업 생성 방식과 달리, 난이도를 높여가며 매우 저렴한 비용으로 대량의 에이전트 작업을 생성하는 루프를 검증했습니다.
Tencent Hunyuan3D가 텍스트 프롬프트 하나로 3D 오픈 월드를 생성하는 WorldClaw를 공개했습니다. 에이전틱 플래닝 기술을 통해 지형과 에셋을 세분화하여 탐험 가능한 일관된 장면을 구축합니다.

자율 주행 VLM의 환각 현상을 줄이기 위해 제안된 DEFT-RLVR 연구를 소개합니다. 기존 CoT 방식의 문제점을 해결하기 위해 계획 과정을 다지선다형 궤적 선택 방식으로 재구성하여 성능을 개선했습니다.