사람이 붙인 라벨은 정말 '정답'일까? — 어노테이션의 전제를 생각하다
요약
본 기사는 실세계 검수와 같은 인간의 판단을 AI 학습 데이터(Ground Truth)로 사용할 때, '정답'과 어노테이터 자체에 대한 전제를 깊이 있게 탐구합니다. 단순히 라벨링 건수만 늘리는 것이 아니라, 판단 불일치나 조건 변화 등 데이터가 가진 복잡한 맥락적 정보를 어떻게 활용할지 논의합니다.
핵심 포인트
- 라벨링 시 '정답'과 어노테이터 상태를 분리하여 가정해야 한다.
- 단순 다수결보다 불일치(Variation) 자체에 주목하는 것이 중요하다.
- 질문 방식이나 UI 설계가 라벨 품질 및 모델 성능에 영향을 미친다.
매일 100건의 라벨링은 같은 품질일까요?
공장에서 제품 이미지를 보며 '정상/비정상' 라벨을 붙이는 작업을 상상해 보세요. 실세계 검수 판단을 AI에 학습시키기 위해 담당자에게 매일 100건, 365일 동안 총 36,500건의 어노테이션(Annotation)을 부탁한다고 가정합니다.
작업을 시작한 직후와 피로해진 후반부의 판단 정교함이 같을까요? 경계적인 제품을 여러 번 보는うちに '이 정도면 정상'이라는 기준 자체가 바뀔 수도 있을 것 같습니다.
숙련자들 사이에서도 판단이 갈릴 때가 있습니다. 한쪽이 놓치고 있는 부분이 있거나, 다른 쪽이 아직 매뉴얼에 적히지 않은 조건을 보고 있을 수도 있습니다.
그렇다면 사람이 붙인 라벨을 그대로 Ground Truth(GT)로 취급해도 괜찮을까요?
본 기사에서는 검수와 같은 실세계 판단을 학습 데이터로 사용할 때, 어노테이터와 '정답'에 어떤 전제를 두어야 하는지 생각합니다. 나아가 판단의 불일치를 단서 삼아 아직 명시되지 않은 판단 규칙을 탐색하는 어노테이션 설계까지 살펴보겠습니다.
참고로, 피로로 인한 변화는 고려할 수 있는 예시 중 하나입니다. 숙련에 따라 판단이 적절해질 수도 있으며, 소수의 정교한 라벨이 대량의 라벨보다 반드시 유용하다는 이야기도 아닙니다. 건수뿐만 아니라 어떤 조건으로 판단되었는지 데이터에도 주목하고 싶다가 출발점입니다.
설계하기 전에 두 가지 가정을 분리하기
| 설계 축 | 확인하고 싶은 것 |
|---|---|
| 정답에 대한 가정 | 하나의 답을 확신하고 싶은지, 여러 타당한 판단을 남기고 싶은지, 공유되지 않은 업무 기준을 명확히 하고 싶은지 |
| 어노테이터에 대한 가정 | 사람 간 지식의 차이가 있는지, 같은 사람의 상태가 변하는지, 질문이나 UI에 따라 답변이 달라지는지 |
이러한 차이에 따라 수집, 재확인, 집약 방법도 달라집니다.
예를 들어, 3명의 어노테이터에게 동일한 제품 이미지를 보여주고 '정상/비상' 라벨을 붙여달라고 했다고 가정해 봅시다. 답변이 '정상, 정상, 비상'으로 나뉘더라도, 그 불일치가 무엇을 의미하는지는 하나로 정할 수 없습니다.
| 정답을 어떻게 생각할지 | 불일치에 대한 대응 |
|---|---|
| 하나의 답을 확신할 수 있을 때 | 증거나 재확인으로 오류를 수정한다 |
| ... | |
| 애매한 문장의 해석이나 사람마다 다른 취향을 다수결만으로 하나로 모으면 정보를 잃게 됩니다. 이러한 문제는 Human Label Variation 연구에서도 정리되어 있습니다[1]. |
반면, 불일치를 모두 남겨야 하는 것도 아닙니다. 예를 들어 Noise Correction on Subjective Datasets에서는 어노테이터별 예측과 라벨 보정을 결합하여 시점의 차이와 오류를 모두 다루고 있습니다[2].
남기고 싶은 차이와 고치고 싶은 오류. 우선은 그 구별부터 시작하고 싶습니다.
참고로, 표의 세 가지는 겹칠 수 있습니다. '판단을 통일하고 싶다'는 업무상의 요구와 유일한 객관적 정답이 존재한다는 것은 별개의 문제입니다.
사람도 조건에 따라 출력이 바뀌는 교사
같은 사람이라도 작업 중의 상태는 변합니다. 이러한 변화를 모델에 반영하는 연구도 있으며, Attention-Aware Answers of the Crowd에서는 주의 변화를 고려하여 답변 품질과 정답 라벨을 추정하고 있습니다[3].
질문 방식이나 화면 설계 역시 단순한 외형상의 문제가 아닙니다.
예를 들어 Annotation Sensitivity에서는 동일한 트윗에 대해 '혐오 발언인지', '공격적인 표현인지'를 묶어서 질문할지, 나누어 질문할지, 어떤 순서로 질문할지를 변화시켰습니다. 그 결과 라벨의 비율뿐만 아니라 그것으로 학습한 BERT의 성능이나 예측도 달라졌습니다[4].

출처: Kern et al., Annotation Sensitivity (2023), Figure 1. HS는 hate speech, OL은 offensive language. 논문 이미지를 게재함.
이 실험에서는 어노테이터를 다섯 가지 조건에 무작위로 할당했습니다. 같은 사람에게 모든 조건으로 답변을 받아보는 실험은 아닙니다.
그림의 A는 두 판단을 같은 화면에서 진행하고, B와 C는 화면을 나누어 순서를 바꿨습니다. D와 E는 한쪽 판단을 먼저 끝낸 후 다른 쪽으로 넘어갑니다. 대상이 같더라도 관측하는 방식에 따라 얻게 되는 라벨은 달라질 수 있는 것입니다.
다만, 여기서 비교하고 있는 성능은 각 조건에서 수집한 사람의 라벨에 대한 성능입니다. 어떤 조건이 유일한 객관적 정답에 가장 가까운지를 보여준 실험이 아니며, 이미지 검수에서도 같은 효과가 나타나는지는 별도로 확인해야 합니다.
そのため、想定する問題に合わせて収集方法も工夫したくなります。
| 想定する問題 | 設計上の工夫 |
|---|---|
| 知識や能力に差がある | 共通の練習例で理解を確認する |
| ... | |
| 이것들은 설계안이며, 각 태스크에서 효과의 확인이 필요합니다. '어노테이터의 질이 나쁘다'로 치부하지 않고, 어디에 원인이 있는지 가려내기 위한 것입니다. |
판단할 수는 있어도, 이유를 바로 설명할 수 없다
여기서는 업무상의 기준이 충분히 언어화되지 않은 경우를 생각해 봅니다. 여기에서는 숙련자가 판단에 사용하는 것들 중, 본인조차 바로 언어화하기 어려운 단서나 판단 방식을 '암묵지(tacit knowledge)'라고 부릅니다.
실제로 EVERSTEEL에서는 철 스크랩 검수 숙련자와의 공동 작업이나 대화를 통해 판단 근거를 언어화하고, 어노테이션에 적용하는 노력이 소개되었습니다[5].
이러한 실천을 바탕으로, 다음에 생각해 보고 싶은 것은 다음 질문입니다.
어떤 사례를 보여주고, 무엇을 물어야 판단의 단서를 끌어낼 수 있을까.
목재를 분류하는 목공인이 있다고 가정해 봅시다. 양품/불량품은 판단할 수 있습니다. 하지만 '기준을 전부 설명해주세요'라고 하면, 바로 말로 표현하기 어렵습니다.
아래는 실제 목재의 규격이 아니라, 설명용 가상 예시입니다.
| 사례 | 처음에 기록한 특징 | 목공인의 판단 |
|---|---|---|
| A | 색상이 비슷하고, 옹이가 작다 | 양품 |
| B | 색상이 비슷하고, 옹이가 작다 | 불량품 |
우리에게는 비슷해 보입니다. 하지만 목공인은 아직 기록되지 않은 조건을 사용하고 있을지도 모릅니다.
여기서 '왜요?'라고 반복하는 것만으로는 설명이 나오지 않을 때도 있습니다. 그래서 과거의 비슷한 사례를 검색하여 나열하고, 질문을 구체화합니다.
이 둘을 구분한다면, 어디를 보나요?
어느 쪽이 사용할 때 문제가 생길 것 같나요?
같은 옹이가 끝부분이 아니라 중앙에 있어도 판단은 변하지 않나요?
그러자, '옹이의 크기뿐만 아니라, 끝 부분에 가까운지까지 보고 있다', '이 용도에서는 끝 부분의 약함이 문제가 된다'와 같은 조건이 보일 수도 있습니다.
말로 설명하기 어려울 때는, 신경 쓰이는 영역을 가리키게 하거나, 둘 중 하나를 고르게 하거나, 조건을 바꾼 사례를 판정하게 하는 방법도 있습니다. 설명할 수 있는 것과, 판단할 수 있는 것을 동일시하지 않는 것이 포인트입니다.
암묵적인 조건을, 수식으로 포착해 보기
처음에 기록한 특징을
하지만, 목공인이 '옹이가 끝 부분에 가까운지'라는 미기록의 조건
여기서는, 사례별 조건, 조건을 어떻게 판단에 연결하는지를 나타내는 규칙 표현 매개변수입니다. 이 절에서는 한 명의 목공인의 판단을 생각하고, 사람이나 시간에 따른 차이는 생략했습니다.
참고로,
작은 옹이도 불량이 되는 이유
더 단순화하여, 옹이의 크기를
예를 들어
물론, 이 식이 목공인의 머릿속에 그대로 존재한다는 의미는 아닙니다. 관측된 판단을 설명하는 규칙 후보입니다. 암묵지 전체를 꺼내는 것이 아니라, 그 일부를 검증할 수 있는 형태로 명시화하려고 하는 것입니다.
비교함으로써, 규칙 후보를 좁히기
처음에는 '크기로 결정된다', '위치도 관련 있다', '용도에 따라 달라진다' 등 여러 후보가 있습니다. 비교와 추가 판단을 통해, 어떤 후보가 사례를 설명할 수 있는지 확인해 나갑니다.
수식으로 보면, 추가 질문에 의한 가설 업데이트
지금까지의 사례와 답변을
오른쪽 끝은 질문 전 규칙에 대한 확신, 우도 규칙 후보를 구별할 수 있는 질문을 선택한다고 생각됩니다.
이 식은, 후보로 생각한 규칙의 확신을 업데이트하는 것이며, 미지의 조건
실제로 사용하려면, 답변의 오류까지 포함하는 모델을 설계해야 합니다. 여기서는 시스템을 설명하기 위한 표현이며, 특정 논문의 방법을 재현한 것은 아닙니다.
'비슷하지만 라벨이 다르다'는 모순의 확정이 아니라, 조사할 입구입니다. 놓친 부분, 규칙 변경, 필요한 정보 부족도 후보가 됩니다.
비교의 장에서 나온 이유는 가설로 기록하고, 위치 등의 조건을 바꾼 다른 사례로 확인합니다. 비교 전의 판단도 남겨두고, 유도하기 어려운 질문부터 시작합니다. 동조의 영향까지 확인할 거라면, 제시 순서나 비교 사례를 바꾼 확인도 필요합니다.
도저히 판단 자체가 정해지지 않는 경우에는, 억지로 암묵적인 정답을 가정하지 않고, 보류 또는 추가 검사, 기준 합의로 돌려야 합니다.
사람의 판단을 지원하고, 다음 판단에도 활용하기
사람에 대한 지원을 어노테이션 작업 도중에 수행하는 연구도 있습니다.
예를 들어 LabelAId에서는, 작업 중인 행동이나 도메인 지식을 바탕으로, 오류가 발생할 것 같은 타이밍에 AI가 피드백합니다. 사람이 붙인 라벨을 나중에 체크하는 것을 넘어, 라벨을 붙이고 있는 사람의 판단 자체를 지원하는 접근 방식입니다[6].
그림에서는 도메인 지식이나 과거 데이터를 활용하여 작업하는 사람에게 피드백을 제공하는 흐름이 그려져 있습니다. 단순히 사람의 출력을 받는 것을 넘어, 그 판단을 뒷받침하는 환경까지 설계 대상에 두고 있는 것입니다.
이러한 연구와 실천 사례를 바탕으로 볼 때, 이미지와 언어를 다루는 모델(VLM)의 판정을 사람이 수정하는 상황에서도 이런 메커니즘이 구상될 수 있을 것 같습니다.
- 기록하기: 대상, 사람의 판단, 작업 조건을 남깁니다. -
- 검색하기: 과거 유사 사례에서 판단이 다른 것을 찾습니다. -
- 구별하기: 비교/영역 지정/조건을 변경하여 재판정함으로써 차이를 탐색합니다. -
가설 만들기: 미기록 조건과 그것을 사용하는 규칙 $z$의 후보 $ heta$를 정리합니다. - - 검증하고 반영하기: 미확인 사례로 확인하고, 입력/검색/프롬프트/규칙 등을 업데이트합니다.
이는 작업 중 지원이나 대화에 의한 지식 명시화를 유사 사례 검색과 결합한 설계안입니다. 이 전체 흐름의 유효성이 소개된 연구에서 확인된 것은 아닙니다.
또한, 이전부터 사용되던 규칙이 발견된 것인지, 아니면 그 자리에서 새로운 기준에 합의된 것인지를 구분할 필요도 있습니다. LLM 평가에서도 구체적인 사례를 평가하는 과정에서 기준이 바뀌는 criteria drift가 보고되었습니다[7].
원래 답변, 변경 이유, 규칙 버전을 남기고, 이 메커니즘이 동일한 확인 시간 내에 미확인 사례에 대한 판단을 개선하는지를 확인합니다. 이때 사람의 판단 재현 여부를 측정할 것인지, 검사 결과나 하류 공정의 결함을 예측할 것인지를 구분하고 평가 기준도 명시해야 합니다.
'이번에는 불량이었다'라고 기록하면 라벨이 하나 늘어납니다.
만약 '왜 지난번과 판단이 다른지'까지 확인할 수 있다면, 다음에도 사용할 수 있는 규칙이나 부족했던 정보가 보일 수도 있습니다.
어노테이션에서 무엇을 관측하고 싶은가. 그를 위해 사람의 정답을 어떻게 가정할 것인가. 거기서부터 수집 방법을 고민하는 것이 학습 데이터 설계에도, 적응형 에이전트 설계에도 연결된다고 생각합니다.
보충: 사람에 의한 품질 차이를 조사한 연구
맺음말: 실세계의 지식을 추출하고 활용하기
주식회사 SCIEN은 AI 연구 개발과 현장 구현을 통해 실세계의 과제에 직면하고 있습니다.
저희가 목표로 하는 것은 현장의 경험이나 사람의 판단에 담긴 지식을 추출하여, AI가 활용할 수 있는 형태로 만드는 것입니다. 그 노력 중 하나로, 실세계에서 얻는 피드백을 기반으로 상황에 맞게 판단을 개선해 나가는 적응형 AI 에이전트 개발도 진행하고 있습니다.
이번에 다룬 어노테이션 설계 역시 그를 위한 중요한 주제 중 하나입니다.
이러한 질문들을 연구와 구현 양면에서 함께 고민하고 형태를 만들어나갈 동료를 모집하고 있습니다.
Barbara Plank. The ‘Problem’ of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. 2022. ↩︎
Uthman Jinadu and Yi Ding. Noise Correction on Subjective Datasets. ACL 2024. ↩︎
Jingzheng Tu et al. Attention-Aware Answers of the Crowd. SDM 2020. ↩︎
Christoph Kern et al. Annotation Sensitivity: Training Data Collection Methods Affect Model Performance. EMNLP Findings 2023. Figure 1의 논문 게재판은 CC BY 4.0. ↩︎
N.Nishi. 철스크랩 검수 숙련자의 '암묵지'를 AI에 계승하는 — EVERSTEEL 어노테이션 팀의 도전. EVERSTEEL Tech Blog, 2025년 9월 5일. ↩︎
Chu Li et al. LabelAId: Just-in-time AI Interventions for Improving Human Labeling Quality and Domain Knowledge in Crowdsourcing Systems. CHI 2024. ↩︎
Shreya Shankar 외. 누가 검증하는가? 인간의 선호도에 맞춰 LLM 출력 평가를 정렬하기 (Aligning LLM-Assisted Evaluation of LLM Outputs with Human Preferences). UIST 2024. ↩︎
논의(Discussion)

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn ML의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기