AI '무엇이 잘못되었나?' — Gemma 4와 Laya를 활용한 사고 현장 탐지기
요약
본 프로젝트는 Gemma 4의 멀티모달 기능을 활용하여 사고 현장의 이미지와 맥락을 분석하고, 눈에 보이는 증거와 가능한 가설들을 추출합니다. 이후 Laya라는 시스템이 이 증거를 바탕으로 각 가설의 신뢰도 점수를 산출하여 가장 가능성 높은 설명을 제시하는 '사고 현장 탐지기'입니다.
핵심 포인트
- Gemma 4가 이미지/맥락을 분석해 증거와 가설 추출 (See and Understand).
- Laya는 Gemma가 만든 증거를 바탕으로 가설의 신뢰도 점수 평가.
- 추론 과정을 투명하게 보여주며, 가장 가능성 높은 설명을 순위화함.
- 멀티모달 AI를 활용한 사고 분석 및 추론 시스템 구축 사례.
만약 AI 시스템이 사고 현장을 살펴보고, 눈에 보이는 증거를 식별하며, 무슨 일이 일어났을지 제안하고, 그 가능한 설명들을 증거를 바탕으로 평가할 수 있다면 어떨까요?
이것이
Team Tech Fusion이 만든 해커톤 프로젝트인 _AI '무엇이 잘못되었나?' — 사고 현장 탐지기(Incident Detective)_의 아이디어입니다.
우리가 구축한 시스템
저희 시스템은 두 가지 입력을 받습니다:
- 사고 현장의 이미지
- 사고에 대한 짧은 설명 또는 맥락
예를 들어, 사용자는 어지럽게 놓인 실험실 작업 공간의 이미지를 업로드하고 다음과 같은 맥락을 제공할 수 있습니다:
“이 사고는 전자공학 실험실에서 발생했습니다.”
시스템은 이어서 두 단계에 걸쳐 분석을 수행합니다.
1단계 — Gemma 4: 보고 이해하기 (See and Understand)
저희는 _Gemma 4의 멀티모달 기능(multimodal capabilities)_을 사용하여 업로드된 이미지와 제공된 맥락을 함께 분석합니다.
Gemma는 다음을 추출합니다:
- 눈에 보이는 사물(Visible objects)
- 눈에 보이는 상태(Visible conditions)
- 증거(Evidence)
- 가능한 설명(Possible explanations)
- 불확실성(Uncertainties)
여기서 설명들은 확정된 사실이 아니라 _가설(hypotheses)_로 간주됩니다.
예를 들어, Gemma는 다음을 식별할 수 있습니다:
- 작업 표면의 얼룩
- 얼룩진 영역 근처에 놓인 병
- 보호 장갑
- 용기 위의 잔여물(Residue)
그리고 다음과 같은 가능한 설명을 제안합니다:
- 우발적인 유출(Accidental spill)
- 일상적인 실험실 활동(Routine laboratory activity)
- 재료 취급 문제(Material handling issue)
결과는 구조화된 JSON 형태로 반환되어 다음 단계로 직접 전달될 수 있습니다.
2단계 — Laya: 증거 평가하기 (Evaluate the Evidence)
Gemma가 생성한 구조화된 출력은 개방형 소스 결정 엔진인 _Laya_로 전달됩니다.
Laya는 Gemma가 식별한 증거를 바탕으로 가능한 설명들을 평가하고, 각 가설에 대한 신뢰도 점수(confidence score)를 산출합니다.
대시보드는 이 설명을 카드 형태로 표시하며, 가장 높은 신뢰도의 설명은 _가장 가능성 높은 설명(most likely explanation)_으로 강조하여 보여줍니다.
목표는 확실성을 주장하는 것이 아니라, 추론 과정 자체를 투명하게 만드는 것입니다:
_Gemma가 보고 → 증거 추출 → Laya 평가 → 설명 순위 매기기(Explanations are ranked)
사용자
│
├── 사고 이미지 (Incident Image)
└── 사고 상황 맥락 (Incident Context)
│
▼
리액트 프론트엔드 (React Frontend)
│
▼
FastAPI 백엔드
│
▼
Gemma 4
│
▼ 구조화된 증거 (Structured Evidence)
- 가설 (Hypotheses)
- 불확실성 (Uncertainties) │ ▼ Laya │ ▼ 순위별 설명 (Ranked Explanations)
- 신뢰도 점수 (Confidence Scores) │ ▼ 리액트 대시보드 (React Dashboard)
기술 스택 (Technology Stack)
- Gemma 4 — 다중 모드 사고 현장 분석 (multimodal incident scene analysis)
- Laya — 증거 기반 가설 평가 (evidence-based hypothesis evaluation)
- Python — AI/백엔드 구현
- FastAPI — 백엔드 API
- React + Vite — 프론트엔드 대시보드
- Google GenAI SDK — Gemma API 통합
이 접근 방식이 필요한 이유 (Why This Approach?)
단순한 비전 모델은 이미지에서 무엇이 보이는지만 알려줄 수 있지만, 우리의 목표는 그보다 한 단계 더 나아가는 것입니다.
우리는 다음을 분리하고자 합니다:
_보이는 것_과 _일어났을 수도 있는 것_을 분리하는 것입니다.
Gemma가 현장 이해와 가설 생성을 담당하고, Laya는 증거를 사용하여 독립적으로 그 가설들을 평가합니다.
이러한 분리는 한 모델에게 무엇이 일어났는지 직접 결정하도록 요청하는 대신, 더 명확하고 설명 가능한 파이프라인을 제공합니다.
책임 있는 AI (Responsible AI)
본 시스템은 법의학적 또는 안전 당국 역할을 하는 것이 아니라, _사고 가설 및 추론 보조 도구_로 설계되었습니다.
출력 결과는 사용 가능한 증거를 기반으로 한 가능한 설명일 뿐입니다. 이를 확정적인 증거나 개인에 대한 비난으로 취급해서는 안 됩니다.
또한 시스템이 이용 가능한 정보만으로는 결정할 수 없는 부분을 전달할 수 있도록 불확실성(uncertainties)을 명시적으로 보존합니다.
링크 (Links)
GitHub 저장소:
[여기에 GitHub 저장소 링크를 추가하세요]
Laya:
https://github.com/NandhaKishorM/laya
Gemma:
https://ai.google.dev/gemma
팀: Tech Fusion
다음 단계 (What's Next?)
현재 개별 모듈들을 완전한 애플리케이션으로 통합하는 작업을 진행하고 있습니다.
다음 단계에는 다음이 포함됩니다:
- React 업로드 인터페이스를 FastAPI 백엔드에 연결하기
- 사용자 제공 이미지와 컨텍스트를 Gemma에 전달하기
- Gemma의 구조화된 출력을 Laya에 연결하기
- 최종 인시던트 분석 대시보드 구축하기
- 다양한 유형의 인시던트 현장을 가로질러 시스템 테스트하기
핵심 아이디어는 간단합니다:
Gemma가 보고. Laya가 결정한다. 우리의 시스템이 설명한다.
_Team Tech Fusion_이 해커톤 프로젝트의 일환으로 구축했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기