Launch HN: Mentat (YC F24) – 런타임 개입을 통한 LLM 제어
요약
Mentat은 LLM의 행동에 결정론적 통제력을 부여하는 API를 제공합니다. 기존의 RAG나 프롬프트 엔지니어링 방식이 확률적이고 취약한 한계를 가졌던 것과 달리, Mentat은 모델의 추론 과정(forward pass) 중 잠재 특징 벡터(latent feature vectors)에 직접 개입하여 편향이나 환각을 수정합니다. 이를 통해 금융, 의료 등 높은 신뢰도가 요구되는 산업에서 감사 수준의 안정성(audit-grade reliability)을 확보할 수 있습니다.
핵심 포인트
- Mentat은 모델 추론 과정 중 잠재 특징 벡터를 수학적으로 조작하여 편향이나 오개념 같은 '내부' 문제를 해결합니다. (h_prime = h - alpha * (h @ v) * v)
- 기존의 RAG는 지식 제공에만 그치며, 공간 추론(spatial inversion)과 같은 복잡한 통합적 오류를 수정할 수 없습니다.
- GPT-OSS-120b 모델을 대상으로 테스트했을 때, 오개념 특징 벡터 억제만으로 TruthfulQA 정확도를 21%에서 70%로 향상시켰습니다.
- 시스템은 지식 그래프(Knowledge Graph) 검증과 결합하여 의미 엔트로피를 확인하고 관계적 환각을 포착함으로써 신뢰성을 극대화합니다.
안녕하세요, CTGT의 Cyril입니다. 오늘 저희는 개발자에게 LLM(Large Language Model) 동작에 대한 결정론적(deterministic) 통제권을 부여하는 API인 Mentat (https://docs.ctgt.ai/api-reference/endpoint/chat-completions)을 출시합니다. 이 API는 파인튜닝(fine-tuning)의 컴퓨팅 자원 소모나 프롬프트 엔지니어링(prompt engineering)의 취약성 없이, 추론 과정을 안내하고 편향성을 실시간으로 제거하여 LLM 동작을 제어할 수 있게 해줍니다. 저희는 기능 수준 개입(feature-level intervention)과 그래프 기반 검증(graph-based verification)을 사용하여 환각(hallucination)을 수정하고 정책을 강제합니다.
이러한 능력은 규제가 엄격하거나 AI의 오작동 또는 성능 저하가 심각한 결과를 초래할 수 있는 애플리케이션에서 중요하게 작용합니다. 예를 들어, 금융 서비스 분야에서 생성형 AI(GenAI)를 사용하여 비준수 통신을 스캔하는 것은 복잡한 정책을 모델에 쉽게 내장하기 어렵기 때문에 까다로울 수 있습니다. 마찬가지로, 언론 매체는 자체 콘텐츠의 AI 생성 요약을 확장하고 싶어 할 수 있지만, 신뢰성과 정확성이 가장 중요합니다. 이 두 사례 모두 포춘 500대 기업들이 기존 모델의 성능을 개선하기 위해 저희 기술을 활용한 분야이며, 저희는 이 역량을 더 많은 사람들에게 제공하고자 합니다.
프로세스를 보여주는 간단한 2분짜리 데모 비디오가 있습니다: https://video.ctgt.ai/video/ctgt-ai-compliance-playground-cf...
RAG(Retrieval-Augmented Generation)나 시스템 프롬프트 같은 표준 '가드레일(guardrails)'은 근본적으로 확률적(probabilistic)입니다. 즉, 모델에게
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기