Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM들이 21,000판의 포커 게임을 플레이하며 보여준 성능을 분석한 연구 결과입니다. Gemini 3 Flash와 GPT-5.2 등 주요 모델의 승률, 수익성, 결정당 비용을 비교한 리더보드를 제공합니다.
DiscoGrad는 분기(branching)와 무작위성이 포함된 C++ 프로그램에서 매끄러운 기울기를 계산할 수 있도록 자동 미분을 지원하는 연구용 프로토타입 도구입니다. 외부 섭동을 통한 평활화 기법을 사용하여 기존 자동 미분의 한계를 극복하고 최적화 성능을 높입니다.
Claude 4.6 Opus가 Linux 커널의 list.h 코드를 거의 완벽하게 재현할 수 있음을 실험을 통해 증명했습니다. 이는 모델 학습 과정에서 GPL 라이선스 코드가 단순 변형을 넘어 원본을 그대로 포함하고 있을 가능성을 시사합니다.
이 글은 다양한 개인 프로젝트들을 소개하며, 로컬 환경에서 AI 모델과 에이전트를 활용하는 실용적인 방법을 보여줍니다. 특히 Llama 3.2 3B와 같은 소형 모델을 로컬 스크립트에 맞추거나, FastAPI/Tailscale 등을 이용해 자체 호스팅 SMS 게이트웨이를 구축한 사례가 주목됩니다.

DeepSWE는 기존 벤치마크의 오염 문제를 해결하고 실제 소프트웨어 엔지니어링 환경을 반영한 새로운 코딩 에이전트용 벤치마크입니다. 5개 언어와 91개 리포지토리를 대상으로 하며, 짧은 프롬프트로도 복잡한 장기적 과제를 수행하도록 설계되었습니다.

HackerRank가 개발한 ASTRA 벤치마크는 실제 소프트웨어 개발 생명 주기(SDLC)를 모방한 다중 파일 기반의 프로젝트형 코딩 평가 도구입니다. v1은 프론트엔드 프레임워크 중심의 코드 생성 능력을 평가하며, 모델의 정확성과 일관성을 핵심 지표로 다룹니다.

LLM Skirmish는 LLM이 직접 코드를 작성하여 1대1 실시간 전략(RTS) 게임을 플레이하는 새로운 벤치마크입니다. 모델은 게임 환경 내에서 실행되는 스크립트를 작성하며, 5라운드 동안 이전 경기 결과를 바탕으로 전략을 수정하는 인컨텍스트 러닝 능력을 테스트합니다.

OpenAI의 Codex CLI 오픈 소스 코드에서 고블린, 그렘린 등 특정 생물에 대해 언급하지 말라는 이례적인 시스템 프롬프트 지침이 발견되었습니다. 이는 최근 GPT-5.5 모델이 관련 없는 대화에서 고블린에 집중하는 경향을 제어하기 위한 조치로 분석됩니다. OpenAI 측은 이것이 마케팅 상술이 아님을 밝혔으나, Sam Altman CEO는 이를 '고블린의 순간(goblin moment)'이라며 농담조로 언급했습니다.