Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Trail 벤치마크를 통해 이중 진자 적분 태스크에서의 LLM 코딩 성능을 분석했습니다. 알고리즘, 수학, 프론트엔드 역량을 종합하여 모델별 품질 대비 성능과 가성비를 평가했습니다.

터키 법률 분야에 특화된 오픈 소스 의사결정 지원 LLM인 Mizan-27B가 공개되었습니다. RAG 방식의 데이터 생성 파이프라인을 통해 구축된 고품질 데이터셋으로 학습되었으며, 베이스 모델인 Qwen2.5-27B 대비 뛰어난 성능을 보여줍니다.
터키 법률 분야에 특화된 27B 파라미터 규모의 Legal LLM이 오픈 소스로 공개되었습니다. MLX 및 GGUF 형식의 4비트 양자화 버전이 함께 제공됩니다.

최신 Frontier LLM 모델들을 TYT 2026 시험에 적용하여 성능을 비교한 벤치마크 결과입니다. Gemma4-31B와 같은 소형 오픈 소스 모델이 거대 모델과 대등한 성능을 보였다는 점이 핵심입니다.
Kimi K3 모델의 추론을 위한 계산량과 하드웨어 요구사항을 분석합니다. 3조 개의 파라미터를 가진 모델을 긴 컨텍스트에서 구동하기 위한 최소 사양을 다룹니다.

당뇨병 환자를 위해 CGM 데이터와 ChatGPT를 연동하여 혈당 반응을 분석하는 오픈 소스 앱 GlycoGuide를 소개합니다. 사용자의 식사 정보와 혈당 수치를 결합해 개인화된 분석 보고서를 생성하며, 모든 데이터는 기기 내에 머무는 프라이버시 중심 구조를 가집니다.
최첨단 코딩 LLM들을 대상으로 복잡한 셀룰러 오토마타(Cellular Automata) 시뮬레이션 생성 능력을 평가한 벤치마크 결과입니다. GPT Sol 5.6이 물리 법칙과 복잡한 상호작용을 완벽히 구현하며 압도적인 점수로 승리했습니다.

터키어 추론 모델 연구를 위해 사고 과정(CoT)을 터키어로 담은 고품질 데이터셋인 Turkish-CoT-Instruct-Dataset을 공개합니다. 4,868개의 샘플로 구성되었으며, 터키의 문화적 맥락과 다양한 추론 유형을 반영하도록 설계되었습니다.

사이버 보안 도메인에 특화된 LLM의 역량과 성능을 평가하기 위한 새로운 벤치마크인 'Seneca-CyBench' 연구가 IEEE ASYU 2026 컨퍼런스에 채택되었습니다. 이 연구는 보안 표준 및 성능 기준을 표준화된 프레임워크 내에서 평가할 수 있는 인프라를 구축하는 데 목적이 있습니다.
Qwen3.6-35B와 Kimi-K3 2.8T 모델의 코딩 및 물리 시뮬레이션 벤치마크 결과를 비교 분석합니다. 에이전트 구조와 미세 조정을 통해 소규모 모델이 대규모 인프라 모델과 경쟁할 수 있는 가능성을 제시합니다.
Qwen3.6-35B와 Kimi-K3 모델의 코딩 벤치마크 성능을 비교 분석합니다. Qwen3.6-35B가 Kimi-K3의 성능 지표에 도달하기 위해 필요한 개선 과정을 중점적으로 다룹니다.

Codex를 위한 리포지토리 인식 플러그인인 CodexQB가 대폭 강화되었습니다. 프로젝트 온톨로지 추출, 아키텍처 이해, 단계별 계획 수립 및 보안 검토 기능을 통해 복잡한 코드베이스 분석과 구현을 지원합니다.
단일 프롬프트로 실행 가능한 복잡한 코딩 프로젝트 생성 능력을 평가하는 코딩 벤치마크 페이즈 1 결과입니다. 블랙홀 물리 시뮬레이션 구현을 과제로 하여 GLM 5.2 Max가 수치적 정확성과 물리적 정직성에서 가장 높은 점수를 기록했습니다.

다양한 LLM의 심층 조사(Deep Research) 능력을 학술 논문 조사 성능을 기준으로 비교 분석했습니다. ChatGPT Work(GPT-5.6 Very High)가 정확성, 소스 이동성, 엔지니어링 의사 결정 지원 측면에서 가장 높은 점수를 기록하며 우승했습니다.

본 연구는 다중 에이전트 시스템에서 발생하는 모순된 결정 문제를 해결하기 위한 중간 소프트웨어 아키텍처를 제안합니다. 프로세스 컨텍스트 레이어와 의도 그래프 통합을 통해 워크플로우의 실시간 일관성을 확보하여 기업 환경에서의 신뢰도를 높이는 것이 목표입니다.

KimiQB v0.3.0이 출시되어 Kimi Code를 위한 엔드투엔드 리포지토리 계획 시스템을 제공합니다. 이 버전은 프로젝트 이해, QA 감사, 구현 인계 과정을 체계화하여 복잡한 개발 작업에서 컨텍스트 드리프트를 최소화하는 데 중점을 둡니다. 특히 세션 실행과 아티팩트 추적 기능을 강화하고, 리뷰 및 릴리스 과정에 대한 검증 가능한 절차를 추가했습니다.
본 기사는 주요 AI 모델들(Kimi, Perplexity, Gemini 등)의 최근 발표 내용에 대한 사실적/방법론적 문제점과 강점을 심층 분석합니다. 특히 데이터 표기 오류, 일반화 과잉, 그리고 학술적 개념을 시스템 수준으로 통합한 독창적인 기여를 중점적으로 다루고 있습니다.
본 기사는 Qwen3.6-35B와 Gemma4-31b 모델의 코딩 성능을 Sonnet 5와 비교하는 벤치마크를 다룹니다. 최신 사용자 모델들이 반복적인 개선 과정을 거쳐 기존 모델인 Sonnet 5를 능가할 수 있는지 그 가능성을 확인하고자 합니다.
GPT 5.6과 Fable 5 같은 주요 모델의 부재에도 불구하고, GLM과 Kimi가 자체적인 성능 향상을 보이며 경쟁력을 입증하고 있다는 주장이 제기되었습니다. 이는 특정 거대 모델에 대한 의존도를 낮추고 다양한 LLM 생태계의 역동성을 강조합니다.

본 과제는 외부 라이브러리 없이 순수 WebGL2와 GLSL ES 3.00만을 사용하여 슈바르츠실트 블랙홀을 물리적으로 정확하게 구현하는 실시간 광선 추적기(raytracer)를 개발하는 것을 목표로 합니다. 측지선 적분, 중력 렌즈 효과, 도플러 비밍 등 복잡한 천체물리학적 현상을 단일 프래그먼트 셰이더 내에서 60 FPS로 구현해야 합니다.