MyanmarChemCalc-Bench: LLM이 영어와 버마어에서 화학 문제를 다루는 능력 비교
요약
MyanmarChemCalc-Bench는 미얀마의 화학 교과서 예제를 활용하여 LLM이 영어와 버마어에서 화학 계산 문제를 해결하는 능력을 비교한 벤치마크입니다. 이 연구는 특히 저자원 언어(버마어) 환경에서의 다국어 격차를 탐색하고, 모델의 실행 안정성 및 산술적 오류 패턴을 분석했습니다.
핵심 포인트
- LLM 화학 문제 풀이 시, 단순 점수보다 '실행 안정성' 확인이 중요합니다.
- 영어-버마어 쌍(Paired translations) 설계는 언어별 실패 사례를 검사하는 데 효과적입니다.
- 소규모 벤치마크의 순위 차이는 과도하게 해석하기보다는 반복적인 평가가 필요합니다.
- 프롬프트 개선을 통해 버마어 환경에서의 모델 실행 안정성을 높일 수 있습니다.
벤치마크: https://www.kaggle.com/benchmarks/winkoaung/myanmar-chem-calc-bench
어떤 과제를 수행했나요?
MyanmarChemCalc-Bench는 미얀마의 9~12학년 화학 교과서 예제에서 가져온 15개의 화학 계산 문제로 구성된 30가지 과제로 만들어졌습니다(정답은 교과서를 통해 검증됨). 각 문제는 영어 버전과 버마어 버전, 두 가지 버전으로 존재합니다. 즉, 동일한 문제에 동일한 숫자와 예상 정답을 사용했습니다.
주제는 몰 개념, 아보가드로 수, 동위원소, 백분율 조성, 연소 분석, 화학량론, 기체 부피, 이상 기체 법칙, 몰 농도, 희석, 적정, pH, 패러데이 법칙, 수율(percentage yield), 평형 상수 등 전체 계산 커리큘럼을 아우릅니다.
채점은 엄격하고 자동적입니다. 모델은 풀이 과정을 보여준 후, 별도의 줄에 FINAL ANSWER: <숫자>를 작성해야 합니다. Python 검사기가 이 숫자를 추출하여 과제별 허용 오차 범위 내에서 정답과 비교합니다.
흥미로운 포인트는 다음과 같습니다: 동일한 화학 문제를 버마어로 질문했을 때 모델의 점수가 낮아지나요? 버마어는 저자원 언어(low-resource language)이기 때문에, 만약 다국어 격차(multilingual gap)가 실제로 존재한다면 여기서 나타나야 합니다.
어떤 모델들을 대상으로 했나요?
Kaggle의 여러 모델 중 다섯 가지를 사용했습니다:
| Model | Score |
|---|---|
| Claude Sonnet 4.5 | 100.00 |
| ... |
주요 통찰점은 무엇인가요?
1. 가장 흥미로운 발견은 화학 자체가 아니라 실행 안정성입니다
Qwen의 46.67점은 화학적 실패처럼 보일 수 있습니다. 하지만 그렇지 않습니다. Qwen이 실제로 점수가 매겨진 답변을 생성한 경우, 대다수는 통과했습니다. 누락된 셀들은 오답이 아니라 실행 오류였습니다: 제공자 과부하로 인한 429 rate-limit 에러입니다.
리더보드 점수는 전체 30가지 과제로 나누어 통과율을 계산하기 때문에, 오류가 무능함으로 위장될 수 있습니다. 교훈: 작은 벤치마크에서는 모델의 역량보다 실행 안정성이 리더보드를 더 왜곡할 수 있습니다. 저는 통과(passes), 실패(fails), 그리고 오류(errors)를 별도로 보고합니다. 여러분도 그렇게 해야 합니다.
2. 영어-버마어 쌍(Paired translations)은 실패 사례를 검사 가능하게 만든다
EN/MM 조합은 구체적인 사례에서 효과가 입증되었다. 몰(mole) 계산 문제("8g의 NaOH에는 몇 몰이 있습니까?")에서 Qwen은 영어 버전에서는 정답을 맞혔지만, 버마어 버전에서는 23 + 16 + 1 = 50이라고 작성하여 0.16 mol이라는 오답을 얻었다. 실제로는 0.2 mol이어야 한다. 같은 숫자, 같은 문제였음에도 불구하고 버마어 실행에서 순수한 산술적 실수가 발생한 것이다. 이는 단일 사례이며 체계적인 언어 격차의 증거는 아니지만, 이 벤치마크 설계가 포착해내는 바로 그 종류의 실패 사례이다.
3. 소규모 벤치마크는 절제된 해석을 요구한다
총 30개의 과제로 구성되어 있어, 단 하나의 과제가 점수를 3.33점씩 변동시킨다. Claude(100.00)와 93.33점을 기록한 그룹 간의 차이는 단지 두 개의 과제에 불과하다. 순위만으로 과도하게 해석해서는 안 된다. 의미를 가지려면 완성된 평가와 반복적인 실행이 필요하다.
4. 버마어는 최고 모델들을 무너뜨리지 못했고, 숫자 수정은 검증되었다
버마어 프롬프트를 아라비아 숫자를 사용하도록(8 대신 ၈) 업데이트한 후, 새로운 버마어 과제에서 완료된 모든 실행은 PASS를 기록했다. 다섯 개 모델 모두 100%였다. 숫자 변경이 어떤 것도 저하시키지 않았으며, 모델들은 버마어 프롬프트 내 아라비아 숫자를 신뢰성 있게 처리한다. Claude는 전체적으로 완벽한 100.00을 달성했다. 교과서 스타일의 계산에 있어서 현재의 최첨단(frontier) 모델들은 버마어 처리가 영어만큼 잘 된다.
어디에서 확인할 수 있나요?
벤치마크 (공개): https://www.kaggle.com/benchmarks/winkoaung/myanmar-chem-calc-bench
총 30개의 과제, 리더보드, 모델별 실행 추적 기록이 모두 공개되어 있다. 이 과제 파일들은 단일 Python 스크립트에서 생성되었으며, 정답(ground truths)은 미얀마 교과서의 풀이 예시를 기반으로 재계산되었다.
다음 계획은 무엇인가요?
- 경계를 가진 재시도(bounded retries)와 재실행을 통해 남아있는 오류 셀들을 수정하고 깨끗한 비교를 위해 다시 실행할 예정입니다.
- 15개 과제를 넘어 확장하여, 화학량론(stoichiometry) 및 다단계 문제에서 실제 격차가 나타날 것으로 예상합니다.
- 엄격한 버마어 설명(단순 프롬프트가 아닌)이 무언가를 변화시키는지 테스트할 예정입니다.
Kaggle 벤치마킹 챌린지용으로 구축되었습니다. 모든 문제는 미얀마 초등 교육 화학 교과서(9~12학년)를 기반으로 검증되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기