whylabs/langkit
요약
LangKit은 언어 모델의 입력 및 출력 텍스트를 모니터링하기 위한 오픈 소스 툴킷입니다. 이 도구는 가독성, 관련성, 보안 취약점(프롬프트 주입, 탈옥 등), 감성/독성 분석 등 다양한 메트릭을 제공하여 LLM 프로덕션 과정의 관측 가능성을 높여줍니다. LangKit은 whylogs와 통합되어 사용자가 쉽게 커스텀 스키마를 정의하고 모델 행동을 추적할 수 있게 합니다.
핵심 포인트
- LLM 운영 시 발생하는 비정형 텍스트 데이터 모니터링에 초점.
- 가독성, 관련성 외에도 보안(프롬프트 주입/탈옥) 메트릭 제공.
- whylogs와 연동되어 사용자 정의 스키마로 활용 가능.
- 다양한 분석을 통해 모델의 안정성과 품질을 검증할 수 있음.
LangKit은 언어 모델을 모니터링하기 위한 오픈 소스 텍스트 메트릭스 툴킷입니다. 이 도구는 입력 및/또는 출력 텍스트에서 관련 신호를 추출하는 다양한 방법을 제공하며, 이는 오픈 소스 데이터 로깅 라이브러리 whylogs와 호환됩니다.
💡 LangKit을 경험하고 싶으신가요? 여기 노트북으로 가보세요!
LLM(대규모 언어 모델)을 포함한 언어 모델을 프로덕션화하는 과정은 무한한 입력 조합으로 인해 다양한 위험을 수반하며, 이는 또한 무한한 양의 출력을 유발할 수 있습니다. 텍스트의 비정형적인 특성은 ML 관측 가능성(ML observability) 영역에서 어려움을 제기합니다. 모델 행동에 대한 가시성이 부족하면 심각한 결과를 초래할 수 있기 때문에 해결할 가치가 있는 문제입니다.
기본 제공되는 메트릭은 다음과 같습니다:
-
텍스트 품질 (Text Quality)
- 가독성 점수 (readability score)
- 복잡도 및 학년 점수 (complexity and grade scores)
-
텍스트 관련성 (Text Relevance)
- 프롬프트/응답 간 유사성 점수 (Similarity scores between prompt/responses)
- 사용자 정의 테마 대비 유사성 점수 (Similarity scores against user-defined themes)
-
보안 및 개인 정보 보호 (Security and Privacy)
- 패턴 (patterns) - 사용자 정의 정규 표현식(regex pattern) 그룹과 일치하는 문자열 개수
- 탈옥 (jailbreaks) - 알려진 탈옥 시도 대비 유사성 점수
- 프롬프트 주입 (prompt injection) - 알려진 프롬프트 주입 공격 대비 유사성 점수
- 환각 (hallucinations) - 응답 간 일관성 검사
- 거부 (refusals) - 알려진 LLM 서비스 거부 응답 대비 유사성 점수
-
감성 및 독성 (Sentiment and Toxicity)
- 감성 분석 (sentiment analysis)
- 독성 분석 (toxicity analysis)
LangKit을 설치하려면 Python Package Index(PyPI)를 사용하여 다음과 같이 사용하세요:
pip install langkit[all]
LangKit 모듈은 whylogs가 제공하는 String 피처의 UDF(사용자 정의 함수, User-Defined Functions) 컬렉션에 자동으로 연결되는 UDF를 포함하고 있습니다. 우리가 할 일은 LangKit 모듈을 가져와서 아래 예시에서와 같이 사용자 정의 스키마를 인스턴스화하는 것뿐입니다.
import whylogs as why
from langkit import llm_metrics
results = why.log({
위 코드는 기본 whylogs 메트릭(metrics)을 가진 텍스트 피처와 가져온 모듈에 정의된 모든 메트릭으로 구성된 일련의 메트릭을 생성할 것입니다. 이 프로파일은 WhyLabs 플랫폼에서 시각화하고 모니터링하거나, 사용자가 직접 추가 분석할 수 있습니다.
더 많은 예제는 여기에서 확인할 수 있습니다.
다양한 모듈과 해당 메트릭에 대한 더 많은 정보는 여기에서 얻을 수 있습니다.
| AWS 인스턴스 유형 | 메트릭 모듈 | 처리량 (Throughput) |
|---|---|---|
| c5.xlarge | Light metrics | 2335 chats/sec |
| ... |
다빈(FAQs) 섹션에서 자주 묻는 질문을 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub AI Tools의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기