NIST Generative AI Profile (AI 600-1): 개요 및 포함 내용
요약
NIST가 생성형 AI의 고유한 위험에 대응하기 위해 'Generative AI Profile (NIST AI 600-1)'을 발표했습니다. 이 프로파일은 기존 AI RMF를 확장하여, 거버넌스, 매핑, 측정, 관리 네 가지 기능 아래 12가지 실행 범주를 제시합니다. 이는 기업이 LLM 기반 시스템의 위험을 체계적으로 관리하는 데 도움을 주는 실용적인 가이드라인입니다.
핵심 포인트
- 생성형 AI는 환각, 유해 콘텐츠 등 고유한 위험을 발생시켜 별도의 프로파일링이 필요함.
- 프로파일은 거버넌스, 매핑, 측정, 관리 4가지 기능으로 구성되어 체계적 관리를 지원함.
- 주요 실행 범주는 레드팀 운영, 제로 트러스트 적용, 데이터 출처 투명성 확보 등을 포함함.
- 이는 파운데이션 모델 및 코드 어시스턴트 등 LLM 기반 시스템 거버넌스 구축에 유용함.
원래 https://charz.ai/blog/generative-ai-profile-nist-ai-600-1 Char-Z AI에서 게시됨.
생성형 AI가 자체 프로파일을 필요로 하는 이유
NIST AI RMF는 광범위한 AI를 위해 설계되었지만, 생성형 AI는 환각(confabulated output), 유해 콘텐츠, 사적 학습 데이터 공개, 정보 무결성에 대한 위협 등 고유한 위험을 발생시킵니다 (NIST, 2024). 이에 NIST는 조직이 AI RMF의 거버넌스(Govern), 매핑(Map), 측정(Measure), 관리(Manage) 기능을 대규모 언어 모델(large language models)을 포함한 생성형 AI 시스템에 구체적으로 적용하는 데 도움을 주기 위해 Generative AI Profile (NIST AI 600-1)을 2024년 7월에 발표했습니다.
이 프로파일은 자발적이며, AI RMF를 바라보는 렌즈 역할을 합니다. 이는 네 가지 기능 아래에서 12가지 실행 범주(action categories)를 식별하고, 각 범주를 관련 AI RMF 하위 범주 및 통제 항목에 매핑합니다. 이 문서는 파운데이션 모델(foundation models), 챗봇(chatbots), 코드 어시스턴트(code assistants), 미디어 생성 도구 주변의 거버넌스를 구축하는 팀에게 가장 실용적인 참고 자료 중 하나입니다.
12가지 실행 범주
거버넌스 (Govern)
실행 1: 실제 및 의도된 사용 사례와 맥락을 정의하고 전달합니다. 생성형 AI 시스템이 무엇을 위한 것이며 어디에 배포되거나 오용될 수 있는지 명확히 합니다.
실행 2: 출력에 대한 신뢰를 보장할 수 있도록 충분한 맥락을 문서화합니다. 사용자가 신뢰성을 추론할 수 있도록 학습 분포, 의도된 경계(intended bounds), 그리고 한계를 문서화해야 합니다.
실행 3: 레드팀 운영 및 테이블탑 운동을 수행합니다. 배포 전에 시스템에 대해 탈옥(jailbreaks), 유해 출력, 실패 모드를 선제적으로 조사합니다.
실행 4: 제로 트러스트 아키텍처 접근 방식을 적용합니다. 시스템, 데이터, 그리고 통합 주변에 최소 권한(least-privilege) 및 신원 통제(identity controls)를 적용합니다.
실행 5: 출력에 대한 강력한 통계 분석에 투자합니다. 성능 저하(degradation)와 드리프트(drift)를 감지하기 위해 출력 동작을 추적하고 분석해야 합니다.
매핑 (Map)
액션 6: 위험 및 잠재적 피해를 평가하고 공개합니다. 생성형 AI가 귀하의 환경에서 어떤 유형의 피해를 일으킬 수 있는지 식별하고 문서화합니다.
액션 7: 위험 관리 프로세스를 수립합니다. 프로파일의 액션을 광범위한 AI RMF(Risk Management Framework) 위험 프로세스에 연결합니다.
액션 8: AI 자산의 책임 있는 출처 확보 및 투명한 공유. 사용하거나 게시하는 모델, 데이터셋, 가중치의 출처(provenance)를 이해합니다.
측정 (Measure)
액션 9: 평가, 검증, 벤치마크 및 주장을 확인합니다. 성능 주장을 신뢰하거나 게시하기 전에 출력물을 정의된 지표에 따라 테스트합니다.
액션 10: 개인 정보, 민감 정보 또는 유해한 것으로 식별된 콘텐츠에 대한 효과적인 완화 조치를 구현합니다. 필터링, 검열(redaction), 거부 행동을 마련합니다.
관리 (Manage)
액션 11: 사이버 보안 취약점에 대한 효과적인 완화를 식별하고 구현합니다. 프롬프트 주입(prompt-injection) 및 적대적 입력(adversarial inputs)을 포함하여 생성형 AI의 시스템별 보안 위험을 다룹니다.
액션 12: AI 기술 사고 대응 및 복구 계획을 수립합니다. 생성형 AI 사고를 탐지하고, 대응하며, 복구할 준비를 합니다.
프로파일 적용 방법
범위부터 설정합니다 (Scope first). 모든 액션이 모든 시스템에 깊이 있게 적용되는 것은 아닙니다. 광범위한 사용자 접근성, 자율성 또는 민감한 데이터를 가진 생성형 AI 시스템부터 시작하십시오.
기존 통제 항목과 액션을 매핑합니다. 열두 가지 액션 중 다수는 이미 수행하고 있는 보안 및 개인 정보 보호 작업과 겹칩니다. 이 프로파일을 사용하여 '제로(zero)'에서 시작하기보다는 격차(gap)를 찾는 데 활용하십시오.
EU AI Act와 결합합니다. EU 시장의 경우, 투명성, 콘텐츠 출처 확보, 위험 공개에 중점을 둔 이 프로파일은 해당 법률의 제50조 투명성 의무 및 GPAI 요구 사항을 보완합니다 (European Commission, 2024). 두 가지는 서로를 강화합니다. 프로파일이 방법론을 제공하고, 법률이 마감일(워터마킹 유예 기간이 끝나는 2026년 12월 2일)을 제시하는 것입니다.
예시: 고객 대면 챗봇 (Customer-Facing Chatbot)
-
거버넌스 (Govern): 의도된 사용 목적을 문서화하고, 출시 전 레드팀(red-team) 테스트를 수행하며, 허위 정보에 대한 위험 수용 수준(risk appetite)을 정의합니다.
-
매핑 (Map): 피해(confabulation, 브랜드 위험, 유해 콘텐츠 등)와 그 출처를 평가합니다.
-
측정 (Measure): 사실적 정확도를 벤치마킹하고, 거부율 및 유해 출력률을 모니터링합니다.
-
관리 (Manage): 출력 필터링(output filtering), 프롬프트 주입 방지(prompt-injection mitigations) 및 사고 대응 계획(incident-response plan)을 적용합니다.
출처 (Sources)
NIST. (2024). *Generative Artificial Intelligence Profile (NIST AI 600-1)*. National Institute of Standards and Technology. https://doi.org/10.6028/NIST.AI.600-1
NIST. (2023). *Artificial Intelligence Risk Management Framework (AI RMF 1.0)*. National Institute of Standards and Technology. https://doi.org/10.6028/NIST.AI.100-1
European Commission. (2024). Regulation (EU) 2024/1689 of the European Parliament and of the Council. *Official Journal of the European Union*. https://eur-lex.europa.eu/eli/reg/2024/1689
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기