AI 정책 질문을 실시간으로 관찰하기: Inithouse의 Watching Agents가 가설을 세우고 증거 점수를 매기는 방법
요약
Inithouse가 개발한 'Watching Agents'는 개방형 질문에 대해 가설을 세우고, 실시간 데이터를 통해 확률(Prob)과 신뢰도(Conf)를 업데이트하는 에이전트 시스템입니다. 뉴스 및 규제 문서를 스캔하여 가설의 지지 여부를 판단하고 점수 변화를 추적합니다.
핵심 포인트
- 개방형 질문에 대해 상충하는 가설과 초기 확률/신뢰도 할당
- 스캔, 점수 매기기, 알림의 3단계 증거 루프 프로세스
- 확률(Prob)과 신뢰도(Conf)를 분리하여 데이터 변화를 정밀하게 추적
- 새로운 증거에 따라 가설의 타당성을 실시간으로 업데이트
병렬적인 제품 실험을 진행하는 스튜디오인 Inithouse에서, 우리는 스스로에게 계속 던졌던 질문인 "아무도 지켜보지 않는 동안 빠르게 변화하는 주제에는 어떤 일이 일어나는가?"에 답하기 위해 Watching Agents를 구축했습니다. 100개 이상의 배포된 에이전트(agents)를 통해 관찰한 결과, 추적할 가치가 있는 대부분의 질문은 처음 2주 이내에 의미 있게 변화한다는 것을 발견했습니다. 여기 한 에이전트가 AI 정책 질문을 시작부터 점수 변화까지 어떻게 추적하는지 소개합니다.
설정: 하나의 질문, 5분
당신은 미래에 관한 질문을 입력합니다. 검색 쿼리가 아니라, 진정한 개방형 질문(open question)입니다. 예를 들어 _"EU AI Act(유럽연합 AI 법)의 집행이 2027년 1분기까지 EU 시장에서 측정 가능한 수준의 제품 철수로 이어질 것인가?"_와 같은 질문입니다.
에이전트는 질문을 읽고 일련의 상충하는 가설(hypotheses)을 생성합니다. 에이전트는 예측을 하는 것이 아닙니다. 가능한 결과의 공간을 매핑하고 각 결과에 초기 확률 점수(Prob)와 신뢰 점수(Conf)를 할당합니다. 두 점수 모두 거친 사전 확률(priors)로 시작합니다. 에이전트는 자신이 추측하고 있다는 것을 알고 있습니다.
다음은 첫 번째 패스(pass) 이후 EU AI Act 질문에 대해 나타나는 모습입니다:
| 가설 (Hypothesis) | 확률 (Prob) | 신뢰도 (Conf) |
|---|---|---|
| 주요 벤더들이 특정 제품 라인을 EU에서 철수함 | 0.35 | 0.20 |
| ... |
Prob는 에이전트가 각 결과를 얼마나 가능성이 높다고 판단하는지를 반영합니다. Conf는 해당 추정치를 뒷받침하는 증거가 얼마나 되는지를 반영합니다. 두 점수는 새로운 데이터가 도착함에 따라 독립적으로 움직입니다.
증거 루프 (The evidence loop)
가설이 존재하면, 에이전트는 스캐닝을 시작합니다. 뉴스, 규제 문서, 업계 논평, 공개 성명 등 질문과 관련된 모든 것을 가져옵니다. 각 증거 조각은 모든 가설에 대해 점수가 매겨집니다: 이것이 가설을 지지하는가, 모순되는가, 아니면 아무런 말도 하지 않는가?
이 과정은 지속적으로 실행됩니다. 에이전트는 당신이 확인하기를 기다리지 않습니다.
이 프로세스는 세 단계로 작동합니다:
- Scan (스캔): 에이전트가 질문과 관련된 새로운 정보를 검색하며, 노이즈 (noise)로부터 신호 (signal)를 필터링합니다.
- Score (점수 매기기): 각 증거를 그것이 영향을 미치는 가설에 매핑하며, 이에 따라 확률 (Prob) 및 신뢰도 (Conf)를 조정합니다.
- Alert (알림): 점수가 임계값 (threshold)을 넘거나 마지막 확인 이후 크게 변동되면, 에이전트가 이를 플래그 (flag)합니다.
EU AI Act 질문을 시작한 지 일주일이 지나자, 표의 모습이 달라졌습니다:
| 가설 (Hypothesis) | 확률 (Prob) | 신뢰도 (Conf) | 방향 (Direction) |
|---|---|---|---|
| 주요 벤더들이 EU에서 특정 제품 라인을 철수함 | 0.20 | 0.45 | ↓ Prob, ↑ Conf |
| ... |
두 주요 클라우드 제공업체가 철수 계획 대신 준수 로드맵 (compliance roadmaps)을 발표함에 따라, 기능 제한 (feature-gating) 가설이 힘을 얻었습니다. 어떤 벤더도 철수를 발표하지 않으면서 "전면 철수" 가설은 하락했습니다. 전반적으로 신뢰도 (Confidence)가 상승했습니다. 더 많은 증거는 더 적은 추측을 의미합니다.
점수가 실제로 알려주는 것
확률 (Prob)와 신뢰도 (Conf)는 단일 예측이 제공할 수 없는 두 가지 차원을 함께 제공합니다.
높은 확률 (High Prob), 낮은 신뢰도 (low Conf)는 에이전트가 특정 결과 쪽으로 기울어져 있지만 증거가 부족함을 의미합니다. 이는 최선의 추측 (best guess)을 바탕으로 작업하는 상태입니다. 높은 확률 (High Prob), 높은 신뢰도 (high Conf)는 증거가 한 방향으로 쌓이고 있음을 의미합니다. 확신은 아니지만, 근거가 있는 그림입니다.
이 조합이 중요한 이유는 빠르게 변화하는 정책 주제가 많은 노이즈 (noise)를 생성하기 때문입니다. 단 하나의 헤드라인에 급등했다가 다음 날 바로 떨어지는 점수는 아무런 가르침도 주지 못합니다. 확률 (Prob)과 함께 신뢰도 (Conf)가 꾸준히 상승할 때, 그 신호 (signal)는 실질적인 것입니다.
다른 접근 방식과의 차이점
Metaculus나 Polymarket 같은 예측 시장 (Prediction markets)은 대중의 베팅을 집계합니다. 이는 대중이 규모가 크고 정보가 풍부할 때 유용합니다. 에이전트는 다르게 작동합니다. 에이전트는 당신이 개인적으로 관심을 갖는 질문을 관찰하고, 당신의 프레이밍 (framing)에 특화된 가설을 세우며, 당신이 놓쳤을 수도 있는 증거를 표면화합니다. 에이전트는 유동적인 시장 (liquid market)이나 대중을 필요로 하지 않습니다. 당신의 질문을 바탕으로, 당신을 위해 실행됩니다.
우리는 Inithouse 포트폴리오 내의 다른 제품인 AI 가시성 모니터링 도구 Be Recommended와의 유사점을 발견했습니다. 두 제품 모두 시간이 지남에 따라 변화하는 무언가를 추적하고 그 변화를 드러냅니다. 차이점은 도메인(domain)입니다. Be Recommended는 AI 모델이 브랜드를 어떻게 인식하는지를 관찰하고, Watching Agents는 실제 세계의 질문이 어떻게 진화하는지를 관찰합니다. "지속적인 모니터링 (continuous monitoring) + 구조화된 점수 매기기 (structured scoring) + 변화 시 알림 (alert on change)"라는 패턴은 매우 다른 사용 사례 전반에 걸쳐 재사용 가능하다는 것이 밝혀졌습니다.
퍼블릭 에이전트 레이어 (The public agent layer)
Watching Agents의 모든 에이전트는 퍼블릭(public)으로 설정할 수 있습니다. 퍼블릭 에이전트는 영구적이고 크롤링 가능한(crawlable) 페이지 역할을 하며, 각 페이지는 특정 질문에 대한 살아있는 문서가 됩니다. 우리는 출시 첫 달 이내에 100개 이상의 퍼블릭 에이전트 페이지가 인덱싱(indexing)되는 것을 측정했으며, 이는 구조화되고 질문에 집중된 콘텐츠가 동일한 주제에 대한 일반적인 기사보다 유기적 가시성(organic visibility)을 더 빠르게 확보한다는 가설을 입증했습니다.
이는 우리가 Inithouse의 더 넓은 포트폴리오 전반에 걸쳐 측정한 내용과 연결됩니다. 자체적으로 구조화된 콘텐츠를 생성하는 제품들(Gottman, NVC, CBT 프레임워크를 기반으로 구축된 우리의 AI 갈등 중재자 Verdict Buddy와 같은 제품)은 외부 콘텐츠 마케팅에만 의존하는 제품보다 유기적 도달 범위(organic reach)를 더 빠르게 구축하는 경향이 있습니다.
체험해보기
뉴스를 통해 계속 확인하고 싶은 질문을 하나 골라보세요. watchingagents.com에서 에이전트를 배포하고 가설을 세우게 하세요. 일주일 후에 다시 확인하여 점수가 어떻게 변했는지 살펴보세요. 당신이 예상했던 것과 증거가 보여주는 것 사이의 격차 속에 대개 흥미로운 통찰(insight)이 존재합니다.
Inithouse는 성장하는 제품 포트폴리오를 병렬로 출시하는 스튜디오입니다. Watching Agents는 그 포트폴리오 내의 하나의 베팅이며, 중요한 질문들에 대해서는 주기적인 수동 확인보다 구조화된 지속적 모니터링이 더 효과적이라는 아이디어를 기반으로 구축되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기