🛡️ Shield 82M: PII 제거/필터링 모델 🛡️
요약
Shield 82M은 distilroberta-base를 파인튜닝한 오픈소스 모델로, 모든 언어에 걸쳐 텍스트 내의 개인식별정보(PII)를 필터링하는 데 특화되어 있습니다. 이름, 이메일 주소, 전화번호, 주소 등 다양한 유형의 PII를 감지하고 각기 다른 태그(\[PERSON\] 등)로 대체할 수 있으며, 테스트 결과 총 정확도 약 96%를 달성했습니다.
핵심 포인트
- Shield 82M은 distilroberta-base 기반으로 개발된 PII 필터링 전문 모델입니다.
- 이 모델은 이름, 이메일, 전화번호, 주소 등 다양한 유형의 개인식별정보를 감지하고 마스킹할 수 있습니다.
- 다국어 지원이 가능하며, 프랑스어 테스트에서도 높은 성능을 보여주었습니다.
- 총 정확도가 약 96%에 달하는 고성능 모델이며 완전히 오픈소스입니다.
안녕하세요, r/LocalLLaMA!
최종적으로 새로운 모델로 돌아왔습니다: 🛡️ Shield 82M
이는 distilroberta-base 의 파인튜닝 (fine-tuning) 버전이며, 어떤 언어든 텍스트 내의 모든 유형의 PII(Personally identifiable information, 개인식별정보) 를 필터링할 수 있습니다.
다음은 몇 가지 예시입니다:
1) 이름, 이메일 및 전화번호 테스트:
Original: My name is John Doe. Email: john@example.com. Phone: +49 123 45678.
Protected: My name is [PERSON]. Email: [EMAIL]. Phone: [PHONE].
2) 기본 테스트:
Original: I live in Cambridge
Protected: I live in [ADDRESS]
3) 프랑스어 테스트 (다국어):
Original: Mon e-mail est jean.dupont@example.fr et mon téléphone est +33 6 12 34 56 78.
Protected: Mon e-mail est [EMAIL] et mon téléphone est [PHONE].
이로써 이 모델이 총 정확도 ~96% 로 매우 잘 수행됨을 알 수 있습니다.
그리고: 모든 저의 모델처럼 완전히 오픈소스입니다. :D
사용해 보고 싶다면: https://huggingface.co/LH-Tech-AI/Shield-82M
즐기세요. :-)
댓글에서 만나요. 여러분의 피드백을 정말 원합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기