Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 기사는 LLM 에이전트의 개방형 다중 에이전트 협업 능력을 평가한 새로운 벤치마크를 소개합니다. 최신 LLM들을 다양한 환경에서 테스트한 결과, 대부분의 에이전트는 어려움을 겪었으나, zero-shot Gemini 3.1 Pro가 주목할 만한 성능을 보였습니다. 특히, 장기 작업 역량과 별개로 '소통 기능'이 협업 능력에 가장 큰 영향을 미치는 것으로 분석되었습니다.
FreeBSD 16 버전에서는 기본 시스템에서 마지막 GPL 라이선스 소프트웨어인 *dialog* 구현체를 제거합니다. 이로써 최신 FreeBSD 코드는 GNU 코드를 완전히 배제하게 되며, 이는 FreeBSD 기본 시스템의 GNU 서브트리 폐기를 의미합니다.
Gemma-4-31B를 기반으로 개발된 AntiHal 모델은 요청의 잘못되거나 조작된 전제에 대해 단순히 따르지 않고 반박하도록 유도하는 새로운 변형 모델입니다. 이 모델은 '반환각지능 벤치마크(HalBench)'와 표현 조향(representation steering) 기법을 결합하여, 거짓 가정에 대한 반박 능력을 크게 향상시켰습니다.

물리학 및 수학 연구 과정에서 발생하는 사고 흐름의 단절 문제를 해결하기 위해 오픈소스 캔버스 'PenEcho'를 개발했습니다. 이 캔버스는 손글씨 방정식, 다이어그램 등을 지원하며, 사용자가 작업 중인 캔버스 영역을 모델에 전송하여 응답을 편집 가능한 초안으로 받아볼 수 있게 합니다.

AI 에이전트의 결과물 진위 여부가 중요해지면서 '검증 가능한 AI 추론' 기술이 주목받고 있습니다. 이는 특정 모델, 버전, 입력으로 생성된 출력이 실제로 일치함을 암호학적으로 증명하는 것을 목표로 합니다. 현재는 신뢰할 수 있는 권위자의 서명에 의존하지만, 궁극적으로는 영지식 증명(Zero-knowledge proofs) 등을 활용하여 제3자에게도 검증 가능한 시스템으로 발전하고 있습니다.

PrismML이 Bonsai 27B 모델을 공개했으며, 이는 BitNet/Ternary 개념을 활용하여 Qwen3.6 27B에 적용한 것입니다. 이 새로운 방법론 덕분에 메모리 약 10GB만으로도 높은 성능의 27B 모델 구동이 가능해져, 기기에서 사용하기 매우 실용적입니다.
Zhipu AI의 창립자가 GLM 5.3 출시를 예고하며, 모델 개발 방향이 단순한 성능 향상을 넘어 네이티브 멀티모달 비전 구축에 집중됨을 시사합니다. 이는 에이전트가 스크린샷이나 문서 등 시각적 자산을 해석하는 능력을 크게 개선할 것으로 기대됩니다.

PrismML 팀이 Bonsai 27B 모델을 공개했습니다. 이 모델은 1비트 양자화를 통해 크기를 대폭 줄여(54GB → 3.8GB)도 성능 저하를 최소화한 것이 특징입니다. 커스텀 WebGPU 커널을 활용하여 브라우저 환경에서 로컬 구동이 가능합니다.

전직 Meta 직원 26명이 회사가 AI 도구를 사용하여 휴가 중인 근로자들을 불공정하게 해고 대상으로 지정했다며 소송을 제기했습니다. 이들은 AI 사용이 부당하고 차별적이었다고 주장하며, 기업의 AI 활용 윤리 및 공정성 문제에 대한 논란을 일으키고 있습니다.
본 논문은 오픈소스 EDA 툴의 설계 공간 탐색(DSE)을 공개 노브를 넘어 소스 레벨 메커니즘으로 확장하는 ReviewDSE 프레임워크를 제안합니다. 이 보호된 화이트박스 DSE는 재사용 가능한 검색 지식을 기록하고, OpenROAD에 구현하여 최종 HPWL을 평균 1.78% 감소시키는 성능 향상을 입증했습니다.
본 연구는 LLM에서 언어의 '생성(Production)'과 '인식(Perception)' 간의 비대칭성을 탐구했습니다. 기존에는 동일한 다음 토큰 예측 메커니즘에 의존한다고 여겨졌으나, 직접적인 토큰 확률 측정을 통해 두 과정의 차이를 작동화했습니다. 실험 결과, 생성-인식 거리가 생성-생성 거리보다 유의미하게 크게 나타났습니다.
본 논문은 언어 모델의 다국어적이고 문화적인 도덕 추론 능력을 향상시키는 방법을 제시합니다. MCLASH라는 새로운 벤치마크를 소개하고, 심리학 및 철학 기반의 이론적 근거(grounds)를 활용하는 MET 프롬프팅 기법을 제안했습니다. 또한 자체 증류(self-distillation) 방법인 MET-D를 통해 모델 성능을 개선하여 문화 정렬된 다국어 도덕 추론에 기여합니다.
본 논문은 대규모의 비정형 이력서 기반 경력 궤적 데이터셋인 JobHop v2를 제시합니다. 이는 VDAB에서 제공한 다국어 이력서 말뭉치로부터 LLM 추출을 통해 구축되었으며, $355,315$개의 경력 궤적을 포함합니다. JobHop v2는 원래 버전보다 커버리지와 주석 풍부도를 확장하고, 개선된 추론 파이프라인과 평가 프로토콜을 도입하여 연구 재현성을 높였습니다.
본 논문은 이력서와 같은 비정형 데이터를 활용하여 시간적 및 교육적 신호를 포착하고, 다음 직업을 예측하는 새로운 경력 경로 추천 시스템 STEP을 제안합니다. STEP은 GRU 셀과 어텐션 기반 시퀀스 풀링을 사용하여 시간적 동역학을 모델링하며, ROUTE라는 두 단계의 대비 절차를 통해 내부 직업 표현을 개선했습니다.
MM-ToolSandBox는 시각적 기반을 갖춘 도구 호출 에이전트 평가를 위한 통합 프레임워크입니다. 이 프레임워크는 16개 애플리케이션 도메인, 500개 이상의 도구를 아우르며 다중 이미지/다중 턴 작업을 지원합니다. 최신 모델들을 평가한 결과, 현재 에이전트들은 시각적 도구 호출 능력과 정밀도 측면에서 여전히 부족함을 보여주었습니다.
본 논문은 대규모 오디오-언어 모델(LALMs)이 놓치기 쉬운 화자의 감정 같은 세밀한 음성 속성을 개선하는 새로운 방법을 제시합니다. 'IAAN'이라는 훈련 불필요/레이블 불요 방법은 오디오 인코더의 개별 뉴런을 식별하고 증폭하여, 모델의 음향 이해도를 크게 향상시킵니다.
본 논문은 장편 오디오 설명(AD)의 서사적 일관성과 맥락 보존 문제를 해결하기 위해 StoryTeller라는 학습 불필요 프레임워크를 제안합니다. 기존 VLM들이 국소적인 단서에 의존하는 한계를 극복하고, 검증된 '서사 메모리'를 유지하여 이야기 전체의 맥락을 풍부하게 설명할 수 있습니다.
본 연구는 RAG가 LLM 출력물에 미치는 이념적 편향의 영향을 다룹니다. COVID-19 치료 기사 코퍼스를 활용하여 세 가지 이념적 담론을 식별하고, 다양한 샘플링 온도에서 모델들이 이념적 질문에 답변하도록 평가했습니다. 연구 결과, RAG는 이념적 담론을 전이하는 경향이 있으며, 샘플링 온도가 이러한 전이 강도에 측정 가능한 영향을 미친다는 것을 보여줍니다.
AdvancedMathBench는 LLM의 고급 수학적 추론 능력을 평가하기 위해 설계된 새로운 벤치마크 스위트입니다. 이 스위트는 학부 및 박사 수준의 문제를 포함하는 ProverBench와 증명 검증 능력을 측정하는 VerifierBench로 구성되어 있습니다. 실험 결과, 최신 모델들도 고급 수학 증명 생성과 오류 감지에서 여전히 상당한 개선이 필요함을 보여주었습니다.
본 연구는 LLM이 컴퓨터 아키텍처 논문을 단순 요약하는 것을 넘어, 핵심 메커니즘을 비판적으로 분석하고 구조화된 이해를 수행할 수 있는지 Gauntlet이라는 오픈 소스 파이프라인으로 검증했습니다. 20개 최신 학회 논문 분석 결과, Gauntlet은 인간 전문가의 분석보다 '비판적 엄밀성' 측면에서 유의미하게 우수한 성능을 보였습니다.