279M 모델이 오프라인에서 다국어 PHI 비식별화를 수행합니다. OpenMed 2.0 출시 (Apache-2.0)
요약
의료 NLP 스택인 OpenMed 2.0이 출시되었습니다. 279M 및 560M 파라미터의 경량 모델을 사용하여 클라우드 전송 없이 오프라인에서 개인 건강 정보(PHI)를 비식별화할 수 있습니다.
핵심 포인트
- 데이터 외부 유출 없는 완전한 오프라인 비식별화 지원
- Transformers.js를 통한 브라우저 기반 실행 가능
- 23개에서 56개 언어로 확장된 다국어 지원
- 단순 식별자 제거를 넘어선 데이터 익명화 위험 분석 기능 제공
저는 Apache-2.0 라이선스의 의료 NLP 스택인 OpenMed를 관리하고 있으며, 오늘 2.0 버전이 출시되었습니다. 이 프로젝트의 핵심은 그 어떤 데이터도 외부로 전송(phone home)하지 않는다는 점이며, 이 점을 실제로 중요하게 여기는 서브레딧은 이곳뿐이기에 여기에 게시합니다. 여러분과 관련 있는 부분은 다음과 같습니다: PHI (개인 건강 정보) 비식별화에는 거대한 모델이 필요하지 않습니다. 주력 모델은 279M 및 560M 파라미터 인코더(encoders)이며, 이들은 임상 기록을 클라우드 API에 전달하지 않는다는 명백한 이유 때문에, 임상 기록을 클라우드 API에 전달하는 방식보다 뛰어납니다. 현재 레지스트리에 있는 것들: 2,000개 이상의 모델, 모두 HF 665, Apple Silicon용 MLX 빌드, 3개의 ONNX 빌드. 이번 릴리스의 새로운 기능: 벵골어 279M, 중국어 560M, 타밀어 279M PII (개인 식별 정보) 모델입니다. 이들은 Transformers.js를 통해 브라우저에서 실행할 수 있는 첫 번째 모델들입니다. 내보내기(export) 도구는 1.9.1 버전부터 있었지만, 실제 아티팩트(artifacts)는 이번에 새로 추가되었습니다. 언어 지원 범위는 이번 릴리스에서 23개에서 56개 코드로 확장되었으며, 약 51개의 오프라인 국가 식별자 검증기(validators)가 포함되었습니다. 이 중 약 절반은 정규 표현식(regexes)이 아닌 실제 체크섬(checksums)을 사용합니다. 에스토니아 isikukood, 크로아티아 OIB, 핀란드 HETU, 베트남 CCCD, 중국 USCC, 파키스탄 CNIC가 포함됩니다. CNIC는 체크섬이 있는 척하는 대신 체크섬이 없다는 것을 문서화하고 있기 때문에 제가 가장 좋아하는 항목입니다. 이번 릴리스의 PR(Pull Requests) 59개 중 51개가 제가 한 번도 만난 적 없는 분들로부터 왔으며, 이것이 목록이 그토록 긴 유일한 이유입니다. 2.0 버전에는 제가 실제로 구축하고 싶었던 부분인 구조화된 릴리스 위험 워크플로(release-risk workflow)도 추가되었습니다. 요약하자면: 식별자를 제거하는 것이 곧 익명화(anonymisation)는 아닙니다. 이름, MRN(의료 기록 번호), 생년월일(DOB)이 없는 200행짜리 테이블을 예로 들어보겠습니다. 연령, 성별, 우편번호(ZIP), 입원 날짜만으로도 200명에 대해 74,550개의 조합이 만들어지므로, 200개 행 모두가 고유해집니다. 이것은 발견된 사실이라기보다 생일 문제(birthday-problem) 계산에 가깝지만, 추출물을 배포하기 전에 이를 실행해보는 사람은 거의 없습니다.
assess_release(rows, policy) -> achieved k 1, 200 singletons, max risk 1.0
anonymize_release(rows, policy) -> achieved k 15, 0 singletons, max risk 0.0667
그리고 이 과정에서 발생하는 비용을 알려줍니다: 연령(age)은 완전히 억제(suppressed)되었고, 입원 기간(length of stay)도 완전히 억제되었으며, 모든 날짜는 연도로 통합(collapsed)되었고, 삭제된 행(row)은 0개입니다. 만약 당신의 분석에 연령 정보가 필요했다면, 해당 배포본은 당신에게 무용지물입니다. 저는 도구가 단순히 체크 표시를 출력하는 것보다 차라리 그렇다고 말해주기를 바랍니다. 그런 경우 도구는 승인을 거부합니다. HIPAA 전문가 결정(expert determination)을 위한 증거 번들(evidence bundle)은 다음과 같은 결론을 수용하지 않습니다: ValueError: qualified-expert review fields must remain placeholders. 도구는 임의의 임계값(threshold)을 선택하지 않으며, 의도적으로 인구 데이터(population data)를 배포하지 않습니다. 자격을 갖춘 인간이 그 결정을 내려야 하기 때문입니다.
누군가 물어볼 수 있으니 주의사항(Caveats)을 덧붙입니다: 2.0 버전에서 GGUF 내보내기(export)가 존재하지만, 저는 아직 어떤 GGUF 아티팩트(artifact)도 게시하지 않았습니다. 현재까지는 임베딩 백본(embedding backbones)만 지원됩니다. Android 및 ORT-mobile 경로는 이번 출시 전부터 존재했으나, 레지스트리(registry)에 휴대폰 패키지 형태의 아티팩트는 여전히 없습니다. 이는 제 할 일 목록에 있으며, 아직 완료되지 않았습니다. 1,520개의 모델 중 단 3개만이 ONNX 빌드를 지원합니다. 나머지는 torch/MLX입니다. 모델 라이선스는 다양합니다. SDK는 Apache-2.0이며, 대부분의 모델도 이를 따르지만 일부는 그렇지 않습니다.
https://github.com/maziyarpanahi/openmed
pip install openmed==2.0.0
submitted by /u/dark-night-rises [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기