Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Gemma4-31B 코딩 모델 개발이 막바지 단계에 이르렀으며, NVIDIA AI B200 칩을 활용하여 GLM 5.2 NVFP4를 구동했습니다. 다음 단계로는 RLAIF(Reinforcement Learning from AI Feedback) 과정을 진행할 예정입니다.
고급 코딩 능력을 측정하기 위해 수치 물리와 UI 구현이 결합된 벤치마크를 실시한 결과, GLM 5.2 Max가 가장 높은 성능을 기록했습니다. 이 테스트는 단순 코딩을 넘어 수치 해석 방법론과 정밀한 물리 엔진 설계 능력을 평가합니다.
다양한 최신 AI 모델들을 대상으로 HTML 이중 진자 시뮬레이터 구현 능력을 평가한 코딩 벤치마크 결과입니다. Fable 5 Max가 94점으로 우승했으며, 각 모델의 아키텍처 설계, 물리 엔진 정확도, 코드 효율성 측면의 장단점을 분석했습니다.

시퀀스 길이 128k, 5.16B 토큰 규모의 코딩 사전 학습 데이터셋을 구축했습니다. 품질 지표를 통과한 약 1만 개의 GitHub 오픈 소스 저장소를 기반으로 생성되었습니다.

Qwen3.6-35B를 기반으로 사이버 보안에 특화하여 파인튜닝한 Titus-35B-A3B MoE 모델이 개발되었습니다. 이 모델은 사이버 보안 AI 벤치마크인 CS-Eval에서 오픈 소스 모델 중 1위를 기록하며 뛰어난 성능을 입증했습니다.
Sakana Fugu, Opus 4.8 Max, GPT 5.5 Very High 모델 간의 코딩 성능을 이중 진자 시뮬레이션 벤치마크를 통해 비교합니다. Euler와 RK4 적분 방식의 차이를 통해 모델의 물리 시뮬레이션 및 코딩 정확도를 시각적으로 검증합니다.
Sakana AI Fugu, Claude Opus 4.8 Max, OpenAI GPT 5.5 Very High 모델을 대상으로 이중 진자 물리 시뮬레이션 코딩 능력을 비교한 벤치마크 결과입니다. 각 모델의 물리 법칙 구현 정확도, 궤적 렌더링 아키텍처, 시각적 완성도를 분석했습니다.

Anthropic의 규제적 조치에 대한 우려와 함께 오픈 소스 모델의 부상을 다룹니다. 특히 Gemma-4-31B를 활용하여 코딩 및 수학 특화 모델을 만들기 위한 SFT와 RLAIF 기반의 파인튜닝 계획을 공유합니다.
Google Gemini 3.5 Flash High와 Zai_org GLM 5.2 모델의 코딩 벤치마크 결과를 비교 분석합니다. 수학적 정확도, 수치적 안정성, 시각화 및 코드 아키텍처 측면에서 GLM 5.2가 더 우수한 엔지니어링 코어를 보여주며 승리했습니다.
Opus 4.8 Max와 Kimi-K2.7-Code Thinking 모델의 코딩 성능을 '이상한 끌개' 시각화 과제를 통해 비교 분석한 벤치마크 결과입니다. Opus 4.8 Max는 수치적 안정성, 메모리 관리, 성능 및 코드 아키텍처 측면에서 Kimi 모델보다 우수한 성능을 보였습니다.

본 글은 TTS 모델, 금융/법률 및 사이버 보안 특화 LLM 등 다양한 AI 결과물들을 소개합니다. 터키어에 특화된 TTS 모델과 전문 분야별 LLM 개발을 통해 시스템 구성의 성과를 보여줍니다.

이스라엘 가자 지구의 실향민 휴대폰 위치 데이터(geolocation data)를 '패닉 임프린트'라고 부르며, 이 데이터를 활용해 고스트레스 환경에서 혼란을 관리하는 AI 에이전트를 개발했습니다. 이 AI는 영국 NHS에 10억 파운드에 판매되어 대량 사상자 발생 시 의료진의 패닉 관리를 돕는 도구로 재활용되었습니다.

오픈 소스 에이전틱 사이버 보안 모델인 Titus-35B-A3B를 Hugging Face Space의 ZeroGPU 환경에서 테스트할 수 있게 되었습니다. 이 모델은 Qwen3.6-35B-A3B를 파인튜닝하여 제작되었으며, 특히 에이전틱 작업과 도구 사용 능력에 강점을 보입니다.

Fable 5와 GPT 5.5 모델 간의 케이스 스터디를 통해 도출된 오류, 리스크 및 개선 사항을 비교 분석한 테이블입니다.

Qwen3.6-35B-A3B를 기반으로 한 오픈 소스 터키어 금융 추론 모델 Mihenk-LLM v2가 공개되었습니다. 터키 금융 시장, 거시경제, 암호화폐 및 리스크 관리 등 특화된 금융 데이터로 SFT를 거쳤습니다.

Trendyol에서 새로운 TTS(Text-to-Speech) 모델인 Trendyol-TTS를 Hugging Face를 통해 공개했습니다. 사용자들이 직접 모델을 테스트해 볼 수 있도록 전용 Space 환경도 함께 구축되었습니다.

사이버 보안에 특화된 Agentic LLM인 TitusLLM-35B-A3B-v1의 GGUF 버전이 출시되었습니다. Qwen3.6-35B-A3B MoE 모델을 기반으로 50만 개의 보안 데이터셋을 사용하여 미세 조정되었습니다.

Opus 4.8 High 모델과 Opus 4.7 High 모델의 성능 및 비용 지표를 비교합니다. Opus 4.8 High가 속도와 토큰 생성량 측면에서 우위를 보임을 보여줍니다.

Opus 4.8 High와 Opus 4.7 High 모델의 성능을 벤치마크한 결과입니다. 데이터 스트림 내 고유 사용자 ID 계산을 위한 확률적 자료구조 알고리즘 설계 능력을 평가했습니다.

Opus 4.8 High 모델과 Opus 4.7 High 모델의 성능을 비교한 벤치마크 결과입니다. 복잡한 분산 시스템 설계 문제를 해결하는 능력과 토큰 생성 속도, 비용, 처리량 등을 정량적으로 비교했습니다.