CCQ: 아동 건강 연구를 위한 다중 상태 영유아 돌봄 품질 데이터셋
요약
본 논문은 초기 생애 아동 건강 연구를 위한 대규모 비식별화 데이터셋 CCQ(Child Care Quality)를 제시합니다. 이 데이터셋은 12개 주에 걸친 59,372개의 아동 돌봄 제공자 기록을 통합했습니다. 또한, LLM 기반 자동화된 큐레이션 파이프라인과 다양한 모델을 활용한 성능 벤치마크 결과를 공개하여 연구 가속화를 목표로 합니다.
핵심 포인트
- CCQ 데이터셋은 12개 주에 걸친 대규모 아동 돌봄 제공자 기록을 포함합니다.
- LLM 기반 자동화된 파이프라인으로 개인 정보 보호와 연구 유용성을 확보했습니다.
- 테이블 분류기가 주 내부에서 가장 좋은 성능을 보였으며, 전이 학습 전략도 제시되었습니다.
- 아동 건강 및 발달 개선에 기여할 AI 기반 연구를 가속화하는 것을 목표로 합니다.
초기 생애 시기의 고품질 아동 돌봄은 아동의 성장과 발달에 중요한 결정 요인입니다. 아동 돌봄 품질에 대한 연구는 파편화되고, 연구 친화적이지 않으며, 개인 정보 보호 제약이 있는 데이터셋으로 인해 제한되어 왔습니다. 우리는 AI와 초기 아동 건강이 교차하는 지점에서 응용 데이터 과학 연구를 위한 대규모의 비식별화된 데이터셋인 CCQ (Child Care Quality)를 제시합니다. CCQ는 12개 미국 주에 걸친 59,372개의 아동 돌봄 제공자 기록을 통합하며, 다양한 제공자 유형과 데이터 스키마를 포괄합니다. 연구 유용성을 보장하는 동시에 개인 정보를 보호하기 위해, 우리는 원시 주(state) 기록들을 익명화하고, 정리하며, 표준화하는 자동화된 LLM 기반 큐레이션 파이프라인을 구현했습니다. 이 파이프라인은 두 가지 상호 보완적인 버전으로 결과를 도출합니다: 정제된 텍스트 버전과 완전히 전처리된 테이블 버전입니다. 또한 우리는 품질 등급 예측 및 주요 특징 분석에 대해 전통적인 머신러닝 모델, 테이블 기반 파운데이션 모델, 그리고 언어 모델을 벤치마크했습니다. 주(state) 내부에서는 전처리된 테이블에 대한 테이블 분류기가 가장 좋은 성능을 보였습니다. 주 간에는 제로샷 전이(zero-shot transfer)가 우연 수준에 가깝지만, 적당한 목표 상태 감독(target-state supervision)은 주 내부의 대부분의 성능을 회복시키고, 다른 주를 이용한 사전 학습(pretraining)은 미세 조정된 언어 모델에 이점을 제공합니다. 우리는 아동 돌봄 품질에 대한 AI 기반 연구를 가속화하고 궁극적으로 아동의 건강과 발달을 개선하기 위해 두 데이터셋과 모든 코드를 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기