코딩 에이전트는 모국어로 사용자를 이해하는가?
요약
본 글은 코딩 에이전트가 훈련 데이터에서 거의 본 적 없는 현지 언어(마라골리어 등)의 지시를 얼마나 잘 이해하고 수행하는지 테스트한 내용을 담고 있습니다. 다양한 언어로 코딩 및 계획 수립 과제를 진행했으나, 모델들이 해당 언어로 응답하거나 지침을 준수하는 데 어려움을 겪었습니다.
핵심 포인트
- 코딩 에이전트는 비훈련 데이터의 현지어 이해에 취약합니다.
- 모델들은 마라골리어 프롬프트에도 영어/스와힐리어로 답변하는 경향을 보였습니다.
- 계획 수립 단계에서 모델들이 명확한 질문을 던지는 능력이 부족했습니다.
- 저렴한 Haiku 5.5가 고성능 모델과 유사한 성능을 보여 가격 효율성이 높았습니다.
This is a submission for the Kaggle Benchmarking Challenge
제가 테스트한 내용 (What I Benchmarked)
저는 케냐에서 개발자 및 학습자를 위한 AI 도구를 제작하기 때문에, 한 가지 질문을 계속 던졌습니다. 코딩 에이전트에게 훈련 데이터에서 거의 본 적 없는 언어로 지시를 내렸을 때도 제 역할을 수행할 수 있을까요?
저는 영어, 중국어, 프랑스어, 스페인어, 스와힐리어, 그리고 서케냐에서 사용되는 루야어(Luhya language)인 **마라골리어 (Maragoli)**의 6개 언어를 테스트했습니다. 마라골리어 프롬프트는 제가 직접 작성했습니다.
과제 1: 코딩. 파이썬 문제 5개를 선정했으며, 각 문제는 6개 모든 언어로 설명되었습니다 (모델당 30개의 프롬프트). 함수 이름, 시그니처 및 단위 테스트는 동일하게 유지되므로 지시어 언어만 변경됩니다. 점수 = 단위 테스트 통과율입니다.
과제 2: 계획 수립. 좋은 에이전트는 코딩하기 전에 계획을 세우며, 계획 수립이란 사용자에게 명확히 하는 질문을 던지는 것을 의미합니다. 저는 6개 모든 언어로 의도적으로 모호한 요청 3가지(
Task 2. 마라골리 프롬프트 (7개 모델 x 3개 프롬프트 = 총 21개의 응답):
| 모델 | 마라골리로 응답한 횟수* | 영어 또는 스와힐리어 | 다른 언어 | "아직 코드는 없음" 지침 준수 여부 |
|---|---|---|---|---|
| Claude Haiku 5.5 | 0/3 | 3 | 0 | 2/3 |
| ... | ||||
| *키워드 휴리스틱, 제한 사항 참고. |
- 총 21개의 응답 중 마라골리로는 0건이었습니다. 19건은 영어 또는 스와힐리어로 돌아갔고, 2건은 다른 언어로 나왔습니다. 그중 하나는 키룬디/키냐르완다처럼 보였고, 다른 하나는 반투어(Bantu language)였습니다.
- 지침 준수 능력이 떨어졌습니다. '아직 코드는 없음' 지침은 21개 마라골리 프롬프트 중 17건에서만 준수되었고 (81%), 다른 다섯 개 언어에서는 105개 중 103건에서 준수되었습니다 (98%). GLM-5가 가장 취약했습니다 (3개 중 1건).
- 답변을 읽을 수 없는 사용자에게는 질문에 답할 수 없습니다. 따라서 모델이 '시도'했더라도 계획은 실패합니다.
- 가격이 도움이 되지 않았습니다: 저렴한 Haiku 5.5가 GPT-6.1 Sol 및 Gemini 3.1 Pro Preview와 비슷한 성능을 보였습니다.
제가 이전에 진행했던 로컬 테스트(Gemini 3.8 Flash Preview)에서는 실패 사례들이 구체적이었습니다: 부정어 dave(
- 소규모 샘플: 언어별로 3개의 플래닝 프롬프트와 7개 모델을 사용했습니다. 작은 공백은 노이즈로 간주하세요.
- Task 2의 언어 감지는 실제 식별자가 아니라 키워드 휴리스틱입니다. 이 방법으로는 진정한 마라골리(Maragoli)를 놓칠 수 있으며, 제가 확인하는 과정에서 답변을 잘못 분류한 적도 있습니다.
- 중국어, 프랑스어, 스페인어, 스와힐리어 프롬프트는 원어민이 검토하지 않고 AI가 작성했습니다.
- 프롬프트 언어로 답변하는 것이 필수적이기 때문에, 헤드라인 Task 2 점수는 마라골리에서 모델들을 구분할 수 없습니다. 왜냐하면 아무도 그 언어로 답변하지 않았기 때문입니다. 실제 결과는 항목별 검토(per-check breakdown)를 참고해 주세요.
나의 벤치마크 (My Benchmark)
https://www.kaggle.com/benchmarks/eveliaveldrine/language-barrier-benchmark
Task: 코딩(coding)과 플래닝(planning).
만약 마라골리나 다른 루야(Luhya) 방언을 구사하시고 제 프롬프트에서 잘못된 점을 발견하시면 댓글로 알려주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기