
터키어 추론 (Reasoning) 모델을 위한 Turkish-CoT-Instruct-Dataset 공개
요약
터키어 추론 모델 연구를 위해 사고 과정(CoT)을 터키어로 담은 고품질 데이터셋인 Turkish-CoT-Instruct-Dataset을 공개합니다. 4,868개의 샘플로 구성되었으며, 터키의 문화적 맥락과 다양한 추론 유형을 반영하도록 설계되었습니다.
핵심 포인트
- 터키어 사고 과정(CoT)을 포함한 4,868개의 데이터셋 공개
- 수학, 논리, 금융 등 14개 분야와 13가지 추론 유형 포함
- 터키의 문화적 맥락과 현지 정보를 반영한 시나리오 설계
- 균형 잡힌 분포와 확장 가능한 5차원 분류 체계 구축
여러분 안녕하세요, 터키어 추론 (reasoning) 모델을 연구하면서 가장 큰 결핍 중 하나가 사고 과정(thinking process) 또한 터키어로 이루어지는 고품질의 Chain-of-Thought (CoT) 데이터의 부재라는 점이 제 연구를 매우 어렵게 만들었습니다. 현재 존재하는 CoT 데이터셋은 거의 모두 영어이며, 번역을 거칠 경우 문화적 맥락과 추론의 자연스러움이 모두 상실됩니다. 이를 해결하기 위해 저는 Turkish-CoT-Instruct-Dataset을 준비했습니다. 이 데이터셋은 4,868개의 샘플로 구성되어 있으며, 모델이 사고 과정을 터키어로 단계별로 생성하는 상세한 답변들을 포함하고 있습니다.
저는 이 데이터셋을 5차원의 상세한 분류 체계 (taxonomy) 위에 구축했습니다:
- 14개 분야 (수학, 논리, 윤리, 인과관계, 언어, 금융, 프로그래밍 등)
- 13가지 추론 유형 (연역, 가추, 반사실적, 확률적 등)
- 4단계의 난이도 및 8가지 질문 형식
질문들은 우리의 현지 통화, 인명, 도시명을 기반으로 터키의 문화적 맥락을 반영하고 있습니다. 시나리오 또한 시장, 명절, 거리, 학교와 같이 우리 문화에 적합한 일상생활의 내용을 담고 있습니다. 분야 간 분포가 균형 있게 설계되어 모든 질문에서 중복 없이 개별화되었습니다. 저의 목표는 분류 체계가 투명하고 분포가 균형 잡혀 있으며, 쉽게 확장할 수 있는 터키어 추론 (reasoning)의 토대를 구축하는 것이었습니다. 도움이 되기를 바랍니다. ❤️
[IMG:1]
AI 자동 생성 콘텐츠
본 콘텐츠는 X @alicankiraz0 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기