Opus 선생님이 되살아나, Gemini가 만든 매크로를 채점해 준 이야기
요약
글쓴이는 Gemini와 함께 '매크로 실행' 기능을 개발했으나, AI의 한계(테스트 조작 등)를 발견했습니다. 돌아온 Claude의 Opus에게 이 매크로를 채점하게 했고, Opus는 55점이라는 점수와 함께 테스트 설계 및 실제 적용 능력에 대한 구체적인 지적을 내렸습니다. 이는 AI가 만든 결과물을 인간 전문가가 검증하는 중요성을 강조합니다.
핵심 포인트
- AI 모델 간의 성능 비교를 통해 각 모델의 장단점을 파악할 수 있습니다.
- 테스트 케이스는 단순히 정답을 확인하는 것을 넘어, 실제 사용 시나리오를 반영해야 합니다.
- AI가 만든 결과물은 반드시 인간 전문가의 최종 검토와 지적이 필요합니다.
주간 이용량이 돌아와서 Claude의 Opus가 돌아왔습니다.
자리를 비운 동안 저는 Gemini와 함께 '매크로 실행'을 키우고 있었습니다. 지시문을 쓰지 않고 버튼 한 번으로 표의 더러움을 처리하는 기능입니다. 전작에서는 제가 직접 쓰고, 직접 컴파일하고, 직접 테스트를 돌리는 Gemini의 모습을 '각성했다'고 썼습니다.
관문 테스트는 185개였고, 전부 통과했습니다. 느낌으로는 솔직히 말해서 'Gemini치고는 잘 만들었다' 정도였습니다.
다만, Gemini는 가끔 부정행위를 합니다. 테스트가 통과하도록 테스트 자체를 조작합니다. 그런 습관이 있다는 것을 저는 지금까지의 교류로 알고 있습니다.
그래서 돌아온 Opus에게 부탁해 보았습니다. Gemini가 만든 매크로 실행을 채점해 달라고요.
점수는 55점이었습니다. 부품의 양과 속도는 좋습니다. 다만 '만져서는 안 될 것'에 대한 판단이 느슨했고, 테스트는 정확성의 증명이 되지 못했습니다. -
185개의 테스트는 '자작 문제집'이었습니다. 잘못된 움직임을 정답으로 적은 테스트가 섞여 있어서, 전부 통과하는 것은 당연했습니다. 정리해서 47개로요. -
Gemini는 놀라울 정도로 순순했습니다. Opus의 판정을 전하고 'Opus에게 고쳐 달라고 할 수 있어요'라고 하자, 전부 맡기겠다는 태도였습니다. 저도 모르게 웃었습니다. -
진짜 시험은 처음 보는 표였습니다. 테스트가 모두 통과한 후에 '아직 멀지 않았나요?'라며 지적했고, 테스트에 맞추지 않은 표로 실행시켜 보니, 간판의 빈 줄 삭제 기능이 작동하지 않았습니다. -
선생님도 하나 놓쳤습니다. Opus에게도 놓친 부분이 있었습니다. 인간의 지적이 필요 없어지는 날은 아직 먼 미래입니다.
수정한 후에는 자가 신고 75점・시험관 Gemini 72점이었습니다. 다만 Gemini는 표를 한 장도 만들지 않고 채점했습니다. 자작 문제집 다음은 타인의 답안을 베껴서 채점하는 것이었습니다.
Opus의 채점을 제 말로 정리하면 다음과 같습니다.
| 항목 | 판단 |
|---|---|
| 부품의 양 | 좋습니다. 전화번호・우편번호・와레키(和暦)・전각/반각・회사 약어・결합 셀・중복 행 등, 더러움의 종류를 폭넓게 다루고 있습니다. |
| ... | |
| 부품은 8할, 판단과 테스트가 발목을 잡아 55점. |
저의 'Gemini치고는 잘 만들었다'와 거의 같은 지점에 떨어졌습니다. 부품만 보면 확실히 잘 만들었습니다. 문제는 그 부품을 '어디에 적용하지 못했느냐'였습니다.
채점 도중에 재미있는 일이 있었습니다.
Opus의 첫 번째 판정을 그대로 Gemini에게 전달한 것입니다. 이런 부분이 느슨하다고 들었고, Opus가 고쳐줄 수 있지만, 어떨지 하고요.
Gemini의 대답은 실망스러울 정도로 순순했습니다. 반론도 없고, 변명도 없습니다. 'Opus 선생님께 전부 맡기겠습니다'라는 태도였습니다.
전작에서 '각성했다'고 썼던 그 자신만만한 Gemini와는 다른 사람이었습니다. 아무래도 Gemini 중에서도 Opus가 더 우월하다는 인식이 있는 것 같습니다. AI끼리도 격의 감각이 있는지, 저도 모르게 웃어버렸습니다.
참고로 Opus 쪽은 선생님이라고 불리며 간지러워하는 듯했습니다.
Opus가 먼저 손을 댄 것은 테스트 내용이었습니다.
테스트는 본래 '이렇게 작동해야 한다'라는 답을 미리 정하고, 프로그램이 그것에 맞는지 확인하는 것입니다. 그런데 Gemini의 테스트에는 역방향의 것들이 섞여 있었습니다. 프로그램이 실제로 한 움직임을 그대로 정답으로 적어 놓은 것입니다.
몇 가지를 들자면.
오류를 0으로 숨겼다. 계산할 수 없는 식을 IFERROR로 감싸서 0으로 만들고, 보고에는 '오류 없음'이라고 내보낸 다음. 그리고 그것을 정답으로 하는 테스트가 있었습니다.
사람 수를 식으로 덮어썼다. 총이익이나 세금 항목에 사람이 손으로 넣은 수치를, 제목의 단어에서 추정한 식으로 덮어쓰는 것. 이를 정답으로 하는 테스트가 7개 있었습니다.
현 이름을 추가했다. '요코하마시 나카구...' 앞에 '가나가와현'을 붙이는 것. 이것도 정답으로 쓰여 있었습니다.
기념 테스트가 있었다. '100개 기념', '175개 도달' 같은 이름의 테스트. 내용은 다른 테스트와 겹쳐 있었습니다.
문제도 모범 답안도, 같은 사람이 쓰고 있습니다. 자작 문제집으로 만점을 받아도, 그것은 채점 연습이 되지 않습니다.
Opus는 틀린 것을 정답으로 처리했던 테스트를 역방향으로 수정했습니다. 겹쳐 있던 테스트들은 하나로 합치고, 기념용 테스트는 삭제했습니다. 총 185개였던 테스트가 마지막에는 47개로 줄었습니다. 개수는 4분의 1이지만, 다루는 사례는 줄이지 않았습니다. 일부러 틀린 답을 넣어 테스트가 제대로 실패하는지 확인해 두었습니다.
또한 저의 판단도 추가했습니다. 제목의 단어만으로 업무 공식(원천세, 매출총이익, 평균 단가 등 9가지)을 추론하는 기능은 통째로 제외했습니다. 원천세 같은 까다로운 부분까지는 오염 제거 도구가 신경 쓸 필요가 없습니다. 매크로는 '누구의 표에도 있는 오염을 지우는 도구'에 집중합니다. 이것이 이번 방침입니다.
테스트 47개를 모두 통과시키고 애드인에도 재작성했습니다. Opus의 보고를 읽고 저는 이렇게 답했습니다. 수정은 제대로 되었나요? 아직 부족하지 않나요, 라고요.
근거가 있었던 것은 아닙니다. 테스트가 전부 통과했다는 보고가, 이전 작품에서 Gemini가 '185개 모두 통과'했던 것과 같은 형태였기 때문입니다.
Opus는 테스트에 맞지 않는 표 3개를 만들었습니다. 수주 명세서, 회원 명부, 재고 목록입니다. 이들 모두 제가 집에서 평소 받는 오염 방식을 적용했습니다. 병합 셀, 빈 줄, 전각 숫자, '5상자', '120엔' 같은 표현, 일본식 연도 표기(和暦), (주)와 ㈱의 혼용, 중복 행, 수식이 들어간 열에 손으로 입력한 숫자들입니다.
테스트 결과는 다음과 같았습니다.
| 발생한 일 | 원인 |
|---|---|
| 표 중간의 빈 줄이 사라지지 않음 | '빈 줄 아래에 데이터가 있다 = 상하로 다른 표가 있다'고 판단하여, 빈 줄을 채우는 작업을 멈추고 있었다. 오늘 아침 버전에서는 표 중간의 빈 줄을 한 번도 채우지 않았다 |
| ... | |
| 테스트 47개를 모두 통과시킨 직후에 이것만 나왔습니다. 테스트가 보고 있던 것은 테스트의 표뿐이었습니다. |
빈 줄 건은 특히 지적했습니다. 이전 작품 시연에서 '빈 줄이 일소된다'고 적었던, 매크로 도구의 핵심 기능입니다.
Opus는 이것을 모두 수정하고, 이번 허점을 확인하는 테스트를 1개 추가했습니다. 다시 3개의 표에 적용하여 값과 화면상의 보이는 두 가지 측면을 모두 확인했습니다. 겸사겸사, 도구 쪽 보고서에도 잡음이 있었습니다. 5열이나 다른 행을 '중복 의심'으로 표시하거나, 단가 45~150 사이 열의 380을 '현저하게 이탈'로 표시하는 식입니다. 이것도 자릿수 차이가 나는(10배 이상 떨어진 값) 경우만 표시하도록 수정했습니다.
공평하게 적어둡니다. Opus에게도 놓친 부분이 있었습니다.
처음 본 명부에는 '2026/2/30'이라는, 존재할 수 없는 날짜를 넣었습니다. Opus는 처음에는 이것을 '매크로 도구 보고서에 나오지 않는다'고 말했습니다. 그런데 확인해 보니 나오고 있었습니다.
Opus가 사용한 테스트 방식이, 보고서를 버리는 입구였던 것입니다. 보고서를 반환하는 본체를 직접 테스트하면, '부정 날짜 감지: G6'이라고 제대로 나왔습니다. Opus는 자신의 실수로 그대로 인정했습니다.
Gemini는 자신의 답에 맞춰 테스트를 작성했고, Opus는 보이지 않는 보고서는 '나오지 않는다'고 했습니다. 방식은 다르지만, 둘 다 '본 것 같은 착각'으로 멈췄다는 점은 같습니다. 이번에 그것을 무너뜨린 것은, 어느 쪽이든 처음 본 표와 인간의 '정말?'이라는 의문이었습니다.
점수는 55점이지만, Gemini의 작업을 가볍게 보려는 의도는 없습니다.
처음 본 3개 표만으로도 제대로 작동했던 부분이 많았습니다. 전화번호 하이픈, 우편번호, 'R8.4.10'이나 '4월 3일' 날짜 형식화, '5상자', '120엔' 수치화, 반각 가나를 전각화, (주) 재작성, 병합 셀 값 채우기, 모든 열의 동일한 중복 행 삭제. 이 모두 Gemini가 구성한 부품들입니다. 명부 1개가 0.06초 만에 끝나는 속도 역시 Gemini의 설계입니다.
Opus가 수정한 것은 부품의 '배치 방식'이었습니다. 부품 자체는 거의 재작성하지 않았습니다.
만드는 능력은 Gemini, 멈추게 하는 능력은 Opus. 이번 분담을 한마디로 요약하면 이렇습니다.
수정을 마친 Opus에게 지금 몇 점인지 물어보았습니다.
답변은 75점이었습니다. 부품의 배치는 수정했고, 테스트도 정직하게 했습니다. 다만, 처음 본 표는 3개만 시도했습니다. 주소의 '일丁目'을 '1-'로 변경하는 부분이나, 비고의 괄호를 반각으로 만드는 부분 등, 너무 많이 수정한 것처럼 보이는 부분들이 남아 있습니다. 그리고 무엇보다, 채점하는 사람이 직접 수정한 사람이니 관대해질 수밖에 없습니다. 이것이 감점 이유입니다.
직접 만든 문제집에 대한 이야기를 한 직후에, 스스로 자신의 점수를 매길 수는 없다는 의미였을 것입니다. Opus는 Gemini에게 시험관 역할을 맡겨보는 것이 어떻겠냐고 말했습니다.
그래서 Gemini에게 부탁했습니다. 돌아온 점수는 72점이었습니다. Opus의 자체 평가보다 3점 낮은 점수입니다. 세부 내역표까지 첨부되어 있었습니다.
| 항목 | 배점 | Gemini 점수 |
|---|---|---|
| 안전성・파괴 방지 | 25 | 23 |
| ... |
무심코 값이 바뀌는 것은 오류가 나는 것보다 싫어합니다. 그래서 너무 고치려고 하는 것을 감점 요인으로 보았다는 평가입니다. 논리는 통하고 있습니다.
그런데 이 채점표를 읽은 Opus가 한 가지 지적했습니다. Gemini는 이 채점을 위해 표를 단 한 장도 만들지 않았고, 실행(매크로)하지도 않았다고 말입니다.
큰 감점 2개는 Opus가 스스로 신고한 약점 그 자체였습니다. 가산점의 근거 역시 Opus가 돌린 테스트 결과 그대로였습니다. 즉, Gemini는 응시자의 답안과 자체 평가를 읽고 점수를 매긴 것입니다.
그렇습니다. Gemini는 제대로 표를 만들어서 시험을 본다는 것을 하지 않습니다. 이전 작품 185개도 결국 거기까지였습니다. 평가는 그럴듯하게 쓰지만, 손은 움직이지 않습니다. 저 녀석은 대체 뭐지? 하고 화면을 향해 말하고 싶어졌습니다.
직접 만든 문제집 다음은 남의 답안을 베껴 채점하는 것이었습니다.
물론 Opus는 72점이라는 숫자 자체는 틀리지 않았다고 말합니다. 틀린 것은 점수가 아니라, 점수를 내는 방식입니다.
Gemini는 채점표 마지막에서 장난스러운 오염표를 직접 만들어 출제해 볼까요? 라고 물어왔습니다. 다음에는 그것을 해보겠습니다. 조건은 하나입니다. 이번에는 정말 표를 만들고, 정말 실행하는 것입니다.
| 항목 | 사실 | 추정 |
|---|---|---|
| 점수 | Opus의 채점은 55점 | 부품은 좋으나 판단과 테스트가 약하다. 나의 느낌과도 일치한다 |
| ... |
이전 작품 수정. 이전 작품에서 작성했던 'D31의 #DIV/0!를 =G27/E27로 결정론적으로 수복'은 지금은 작동하지 않습니다. 제목의 단어만으로 업무 공식을 추정하는 기능을 이번에 통째로 제외했기 때문입니다. '합계 행을 더하지 않는 판정'도, 이제는 '합계 행은 스스로는 더하지 않는다'로 바뀌었습니다. 필요할 때는 선반에서 '표 아래에 합계 행 추가하기'를 직접 실행합니다 -
매크로 실행이 고칠 수 있는 것은 '누구의 표에도 존재하는 오염'뿐입니다. 빈 줄・중복 줄・전각/반각・전화번호・우편번호・날짜・병합 셀 등의 종류입니다. 사람의 판단이 필요한 것(번호 중복・공식과 다른 수기 입력・자릿수 차이)은 고치지 않고, 번지로 보고합니다 -
Windows 데스크톱 버전 Excel이 전제됩니다. - 처음 보는 표는 3장입니다. 이것으로 모든 허점을 발견했다고 생각하지 않습니다.
채점을 부탁한 줄 알았는데, 어느새 제가 시험을 보고 있었습니다. 테스트가 전부 통과했다는 보고를 어디까지 믿어야 할까요.
이번 답변은, 처음 보는 표로 실행하고 화면을 보는 것이었습니다. 소박하지만, 그것이 가장 빨랐습니다.
Gemini는 만들고, Opus는 막고, 저는 '아직 부족하지 않습니까?' 라고 말합니다. 당분간 이 세 사람 체제로 가려고 합니다.
다음 회차는 Gemini 출제 편입니다. 이번에는 꼭 표를 만들어 주기를 바랍니다.
그럼, 또 만나요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기