AI 모델은 Tanglish를 얼마나 잘 읽을까? 13개 모델 테스트 결과
요약
본 기사는 13개 AI 모델을 대상으로 'Tanglish'(영어 알파벳과 타밀어의 혼합 형태) 이해도를 테스트한 결과를 공유합니다. Gemini 3.7 Flash와 Gemini 3.5 Flash 등 Google의 최신 플래시 모델들이 높은 정확도를 보였으며, 작은 규모의 Gemma 모델들도 예상보다 좋은 성능을 보여주었습니다. 전반적으로 구어체 타밀 자체에 어려움이 있으며, 스크립트 형태가 결정적인 차이를 만들지는 않았습니다.
핵심 포인트
- Gemini 3.7 Flash와 Gemini 3.5 Flash 등 Google의 플래시 모델들이 높은 이해도를 보였습니다.
- 작은 규모의 Gemma 모델들도 예상보다 좋은 성능을 보여주어 주목됩니다.
- Tanglish 테스트 결과, 구어체 타밀 자체에 어려움이 있으며 스크립트 형태가 결정적이지 않았습니다.
- Claude Haiku 4.5와 gpt-oss-20b 등 일부 모델은 타밀 스크립트 이해에서 감점을 받았습니다.
_이 글은 Kaggle Benchmarking Challenge 제출물입니다.
내가 벤치마크한 내용
저는 타밀어 사용자입니다. 타밀 사람들이 문자를 보낼 때, 우리는 주로 영어 알파벳으로 타밀 단어를 입력하고, 영어가 더 쉬운 곳에 영어 단어를 섞어 사용합니다. 이 혼합된 형태를 Tanglish라고 부릅니다.
각 모델은 생각하는 과정을 말할 수 있도록 허용되며, 'Answer: X'라는 문장으로 끝내야 합니다. 코드가 이 마지막 글자를 확인합니다. 심사 모델(judge model)은 없습니다.
초기 실수 두 가지가 설계에 영향을 미쳤습니다. 제 파일럿 테스트를 진행한 분이 순수한 알파벳만 요구했고, Claude Haiku는 정답에 도달했음에도 풀이 과정을 보여준 것 때문에 감점되었습니다. 또한 빼기가 필요한 질문도 있었는데, 두 모델이 영어로 이를 틀렸다는 것은 산술 계산을 테스트하고 있었다는 의미였습니다. 그래서 채점 방식을 변경하고 합산 문제는 제외했습니다.
테스트된 모델
Kaggle의 무료 할당량을 사용하여 13개 모델을 실행했습니다:
- Google: Gemini 3.7 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemma 4 31B 및 Gemma 4 26B
- Anthropic: Claude Sonnet 5 및 Claude Haiku 4.5
- OpenAI: GPT-5.4 mini, GPT-5.4 nano 및 오픈 gpt-oss-20b
- Z.ai의 GLM-5와 xAI의 Grok 4.20 (추론 과정 제외)
저는 의도적으로 작고 저렴한 모델들 위주로 구성했습니다. 대량으로 타밀 사용자에게 서비스를 제공하는 앱은 Flash-Lite나 nano를 구동할 것이므로, 스크립트 페널티가 실제 사용자에게 도달하는 지점이 바로 그곳입니다. 더 큰 규모의 모델들은 참고 자료로 존재합니다.
일부 모델이 누락되었습니다. Kaggle에는 Grok 4.5와 Grok 4.6이 나열되어 있지만, 둘 다 'model not found'라는 메시지를 반환했습니다. gpt-oss-120b, DeepSeek-R1 및 Qwen 3 Next는 실행하는 동안 시간 초과되거나 과부하가 걸렸습니다. GPT-5.5는 세 가지 작업 중 하나에서 할당량 예약 오류(quota reservation error)가 발생하여 아직 완전한 점수가 없습니다.
최종 실행은 2,456개의 모델 호출이었고, 할당량의 $1.97을 사용했습니다.
발견 사항
| Model | English | Tamil script | Tanglish | Change |
|---|---|---|---|---|
| Gemini 3.7 Flash | 100% | 100% | 100% | 0 |
| ... |
Google의 모델들은 스크립트를 거의 알아채지 못했습니다. Gemini 3.5 Flash와 Gemini 3.7 Flash는 모든 180개의 프롬프트를 정확하게 처리했습니다. 두 개의 Flash-Lite 모델과 오픈 Gemma 4 모델 두 개 모두 어떤 버전에서도 최대 한 문제만 놓쳤으며, Claude Sonnet 5가 이들과 비슷한 수준이었습니다. 저는 작은 Gemma 모델들이 어려움을 겪을 것이라고 예상했지만 그렇지 않았습니다.
다섯 개의 모델이 감점을 받았습니다. GLM-5, GPT-5.4 mini, Grok 4.20은 타밀 스크립트에서 Tanglish로 넘어오면서 각각 5점씩 감점을 했습니다. Claude Haiku 4.5는 13점, gpt-oss-20b는 18점을 잃었는데, 이들은 타밀 스크립트에서는 대부분 이해했던 문장이었습니다.
GPT-5.4 nano는 두 스크립트 모두에서 77%를 기록했으므로, 문제는 구어체 타밀 자체에 있으며 스크립트는 차이를 만들지 않았습니다.

숫자, 시간 및 친족 관련 단어에서 가장 많은 실수가 발생했습니다. 무언가를 놓친 11개 모델 전체를 통틀어 볼 때, 이 그룹은 타밀 스크립트에서는 92%였던 점수가 Tanglish에서는 79%로 떨어졌습니다. 위의 버스 질문이 가장 명확한 사례입니다. 13개 모델 중 6개가 Tanglish에서 이것을 틀렸고, 타밀 스크립트에서는 단 하나만 틀렸습니다. 'Mundhaa naal'(바로 전날)은 Tanglish에서 다섯 개 모델을 혼란에 빠뜨렸고, 그중 네 개가 '어제'라고 답했습니다.
관용구는 예상보다 쉬웠으며, 두 스크립트 모두 95%였습니다. 모든 모델이
제가 작은 간격까지 얼마나 신뢰할 수 있는지에는 한계가 있습니다. 각 모델은 한 번씩 실행되었기 때문에, 질문이 하나나 두 개 차이 나는 것은 노이즈입니다. 60개의 질문은 적은 세트이며, 그중 25개는 모든 버전의 모든 모델에 의해 정확하게 답변되었습니다. 타밀어는 제가 아는 구어체 종류이고, 다른 지역에서는 다르게 말하고 철자합니다.
다음으로는 모음이 생략된 더 심한 SMS 철자를 테스트하고, 지역 방언을 추가하며, 작은 간격들을 신뢰할 수 있도록 모든 실행을 반복할 것입니다. 또한 이번 주에 Kaggle에서 제공하지 못한 모델들의 점수도 받고 싶습니다.
저의 벤치마크
벤치마크: Tanglish Script Penalty on Kaggle
이것 뒤에 있는 세 가지 작업은 다음과 같습니다:
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기