
SDGs 에세이 대상, 30개 작품의 구조를 AI로 분석하다
요약
SDGs 에세이 수상작 30편을 벡터 임베딩 기술을 활용해 분석하여 일관된 이야기 구조를 도출했습니다. AI의 벡터 검색을 통해 키워드 일치 여부와 상관없이 의미적 유사성을 파악하고, 수상작의 패턴과 모범 답안의 차이를 규명했습니다.
핵심 포인트
- 벡터 임베딩을 활용한 문장의 의미적 유사성 분석
- 키워드 검색과 벡터 검색의 메커니즘 차이 설명
- 에세이 수상작에서 나타나는 공통적인 3막 구성 패턴 발견
- 형식적 구조와 내용적 실질 사이의 간극 확인
SDGs 에세이 대상, 30개 작품의 구조를 AI로 분석하다
TL;DR: 文藝春秋(분게이슌슈) × note 공동 주최 SDGs 에세이 콘테스트의 지난 4년간 수상작 30편을 요약과 벡터 임베딩 (Vector Embedding)으로 분석한 결과, 일관된 이야기 구조가 몇 가지 나타났다. 그런데 주최 측이 이번 연도를 위해 준비한 '모범 답안' 에세이는 그 구조의 형식은 정확히 따르고 있음에도 불구하고, 수상작에서 여러 번 나타난 유력한 패턴 중 하나와 콘테스트의 주제인 SDGs 그 자체에 대한 언급을 모두 결여하고 있었다. 형식을 흉내 내는 것과 형식의 내용을 채우는 것은 별개라는, 소박하지만 실무적인 발견(샘플은 1개 콘테스트·30편 + 모범 답안 1건에 한정된다는 유보 조건이 붙음).

「비슷하다」를 AI가 어떻게 판정하고 있는가
평소의 「검색」 대부분은 키워드 일치에 의존하고 있다. 「SDGs」라고 입력하면 「SDGs」라는 문자열을 포함하는 기사가 돌아오는 방식이다.
이 기사에서 사용하고 있는 「벡터 검색 (Vector Search)」은 조금 다른 도구로 작동한다. AI가 문장을 하나씩 읽어 들여, 그 의미를 수백 개의 숫자 나열 (벡터 (Vector))로 변환한다. 비슷한 의미의 문장끼리는 사용된 단어가 다르더라도 이 수치 공간 안에서 가까운 위치에 모이게 된다. 반대로 같은 단어를 사용하더라도 의미가 어긋나 있으면 먼 위치가 된다.

예를 들어 「버려두었던 김에 사실은 가치가 있었다」라는 이야기와 「오래된 웨딩드레스를 계속 수선하는 재봉사」의 이야기는 단어로서의 공통점은 거의 없다. 그럼에도 「간과되었던 것에 대한 깨달음」이라는 의미에서는 비슷해 보인다. 벡터 검색은 이러한 종류의 "의미의 가까움"을 수치상의 거리로 포착하는 메커니즘이다 (이 두 편이 실제로 가깝다고 판정되었는지 여부는 다음 장에서 확인한다).
이하에서 「유사도 (Similarity)」, 「근방 (Neighborhood)」이라고 쓰고 있는 것은 이 수치 공간상의 거리를 의미한다고 생각해주길 바란다. 거리가 가까울수록 AI는 그 두 문장을 의미적으로 가깝다고 판정하고 있다는 뜻이 된다. 감각적으로는 키워드 검색이 「같은 말을 찾는」 도구라면, 벡터 검색은 「비슷한 의미를 찾는」 도구라고 생각하면 가까울 것이다. 이 "의미의 가까움"이라는 감각은 실제 데이터에서 어디까지 신뢰할 수 있을까.
文藝春秋 × note 공동 주최 SDGs 에세이 콘테스트의 수상작을 모아서 읽을 기회가 있었다. 지난 4년 치, 그랑프리와 우수상을 합쳐 30편. 「#미래를 위해 할 수 있는 일」이라는 테마로, 응모자는 1000자 이내의 실체험 에세이를 작성한다.
처음에는 단순한 호기심이었다. 무엇이 선정되고 있는가, 막연한 경향은 있는가. 읽어나가면서 그 「막연한 것」이 생각보다 명확한 형태를 가지고 있다는 것을 깨달았다.
3막 구성과, 하나의 강력한 패턴
30편을 비교해 보니 대부분의 작품이 같은 골격을 가지고 있었다. 일상 속의 작은 사건이나 누군가의 한마디가 있고, 그것을 계기로 가치관이 전환되며, 마지막은 미래를 향한 추상적인 의지 표명으로 마무리한다. 이 3막 구성 (Three-act structure)은 심사 기준에 내걸린 「실체험에서 태어난 깨달음과 독자적인 시점」이라는 문구와 놀라울 정도로 솔직하게 대응하는 것처럼 보인다.
「대부분」이 어느 정도인지 나중에 다시 세어 보았다.
| 찾아낸 패턴 | 해당 작품 수 | 비율 |
|---|---|---|
| 3막 구성 (명확한 단일 계기가 있음) | 24/30 | 80% |
| ... | ||
![]() |
3막 구성은 역시 대다수에서 발견되었다. 또 하나, 맺음말이 「단정적인가, 열려 있는가」라는 축으로도 분류할 수 없을지 시도해 보았으나, 이것은 표에 남기지 않기로 했다. 단락 전체를 읽고 판정하면 4할이 「열린」 결말로 보였는데, 최종 문장의 어미만을 기계적으로 체크하는 방법 (이 기사 자체의 톤을 체크하고 있는 것과 같은 기준)으로 전환하자 그 비율은 3%까지 떨어졌다. 판정 방법을 바꾸는 것만으로 숫자가 10배 이상 움직인다면 패턴으로서 셀 자격이 없다고 판단했다. 이 불안정성 자체가 「형식」을 AI로 이야기할 때의 함정일지도 모른다.
또 다른 인상적인 패턴이 있었다. 「무가치하다고 생각했던 것에 사실은 가치가 있었다」라는 반전의 이야기다. 어느 해의 그랑프리는 시장에서는 팔리지 않는다고 버리던 청김을 어떤 사람에게 「그 향기가 필요하다」라는 말을 듣고 생각을 바꾸는 어부의 이야기. 다른 해의 그랑프리 작품은 오래된 웨딩드레스를 계속 수선하는 재봉사의 이야기였다. 환경 배려로서가 아니라 「수선하는 것을 좋아하고, 이야기를 품은 것은 아름답다」라는 마음에서 우러나온 수작업이라는 것이다. 연도도 필자도 완전히 다른 두 편의 그랑프리 작품에서 모두 「간과되었던 것에 대한 깨달음」이라는 공통된 질감을 느꼈다.
우연이라고 치부하기에는 너무나 정교하다는 느낌이 들었다. 물론, 단 두 편의 일치만으로 이를 「형식 (Pattern)」이라고 불러도 될지는 나 자신도 반신반의했다.
이 직감을 벡터 (Vector)로 확인해 보기로 했다. 결과는 기대했던 것과 달랐다. 이 두 편은 벡터 공간상에서 서로의 인접 이웃 (Neighbor)으로 나타나지 않았다.
내가 잘못 읽은 것은 아마도 이야기의 형식 그 자체였을 것이다. 김에 관한 이야기는 「버려지던 것 → 어떤 사람의 한마디로 가치를 깨닫게 됨」이라는 명확한 일직선상의 반전 구조를 가지고 있다. 반면 드레스 이야기를 다시 읽어보면, 축을 이루는 것은 「고치는 것을 좋아함」이라는 일관된 장인의 신념이며, 무가치한 것이 유가치하게 변하는 순간 그 자체는 묘사되지 않는다. 표면적으로는 비슷한 질감으로 느껴졌지만, 이야기의 골격으로서는 별개의 것이었다는 뜻일지도 모른다. 이번에는 벡터가 처음의 짐작보다 더 정확했던 것 같다.

30편 모두의 유사성을 도표로 그려보니 몇 가지 덩어리가 보인다.
| 토픽 덩어리 | 건수 | 비율 |
|---|---|---|
| 자연·커뮤니티와의 관계 (가장 느슨하고 큰 덩어리) | 12편 | 40% |
| ... | ||
![]() |
이 분류에서도 드레스 이야기는 「물건 만들기·수작업으로 무가치를 활용함」으로, 김 이야기는 「소비·환경 인프라에 대한 관점 전환」으로 서로 다른 그룹에 분류되었다. 앞서 말한 「사실은 반전 구조가 아니었다」라는 깨달음과도 정확히 일치한다. 한편, 가장 큰 덩어리(자연·커뮤니티 계열)는 명확한 하나의 테마라기보다, 다양한 이야기들이 느슨하게 연쇄하며 하나로 이어져 있었다. 이는 이것대로 테마의 다양성을 나타내는 것일지도 모른다.
모범 사례와 대조해 보기
이 콘테스트의 올해 모집 페이지에는 참고 작품으로서, 모모코 구미 컴퍼니(BiSH의 전 멤버) 씨가 주최 측의 의뢰로 작성한 에세이가 첨부되어 있었다. 「좋은 글쓰기의 예」로 제시된 것이다.
기왕 하는 김에 이것도 같은 방법으로 분석해 보았다.
결과는 조금 의외였다. 모범 에세이는 수상작 30편과 비슷한 정도의 유사도 범위에 포함되어 있었으며, 유사도 측면에서도 이상치 (Outlier)가 아니었다.
| 수상작 30편과의 유사도 |
|---||
| 평균 | 0.859 |
| ... |

참고로 수상작끼리(모범 사례를 제외한)의 유사도는 0.85~0.88 범위에 머물러 있다. 모범 사례의 수치도 거의 같은 범위에 들어 있어, 돌출된 이상치가 아님을 알 수 있다.
3막 구성 (Three-act structure)도 제대로 따르고 있다. 일상의 작은 사건(SNS에서의 반응)을 계기로 깨달음이 생겨나고, 내성적인 문장으로 마무리된다. 형식만 본다면 모범 답안이라고 불러도 좋을지 모른다.
다만, 두 가지 점에서 실제 수상작과는 달랐다.
하나는, 그 「무가치했던 것에 대한 가치의 재발견」이라는 반전 구조가 없다는 점이다. 모범 사례의 테마는 자신의 커리어와 일하는 보람에 대한 성찰이며, 폐기물이나 간과되었던 것이 재평가된다는 줄거리는 등장하지 않는다.
또 다른 하나는 훨씬 근본적인 것이었다. SDGs라는 단어도, 17개 목표 중 어느 하나에 대한 언급도, 사회 전체에 미치는 영향을 이야기하는 문장도 모범 에세이 어디에서도 찾아볼 수 없었다. 1인칭의 성찰이 계속 이어지는, 말하자면 「미래의 자신에게 쓰는 편지」 같은 문장이었다. 반면 실제 수상작 중에는 문장 끝에 목표 번호까지 구체적으로 적어 놓은 것도 여러 편 보였다. 개인적인 체험담이라는 형식을 취하면서도, 사회적 테마로의 연결을 의식적으로 남겨둔 작품이 있었다는 뜻이라고 생각한다.
수상작 30편이 실제로 어떤 목표를 다루었는지도 내용에서 추출하여 세어 보았다 (저자가 번호를 명시하지 않은 작품이 대부분이므로, 이는 필자의 판독에 따른 추정치임을 밝혀둔다). SDGs의 17개 목표 자체에 대해서는 일본 유니세프 협회 페이지에 목록이 있다 (note 공식 계정도 이 페이지를 참조하고 있다).
| 목표 | 해당 작품 수 |
|---|---|
| 12: 책임 있는 소비와 생산 | 10편 |
| ... | |
![]() |
가장 많았던 것은 「책임 있는 소비와 생산」으로, 30편 중 10편이었다. 모범 에세이에는 이 수치가 통째로 0이었던 셈인데, 수상작의 3할 이상이 다루고 있는 테마를 모범 사례는 단 한 마디도 언급하지 않았다는 결과가 된다.
여기서 앞서 말한 「무가치→가치의 반전 구조」 패턴을 떠올려 보길 바란다. 이 두 가지는 사실 상당히 겹쳐 있었다. 반전 구조를 사용한 6개 작품 중 5개 작품(83%)이 「책임 있는 소비와 생산」에도 해당했다. 역방향으로 보면, 「책임 있는 소비와 생산」 10개 작품 중 반전 구조를 사용한 것은 절반(5개 작품)뿐이었다.

즉, 반전 구조는 「이야기의 형식으로서 독립적으로 발견한 발견」이라기보다, 「만드는 책임 쓰는 책임이라는 테마를 선택한 시점에서 자연스럽게 나오기 쉬운 서술 방식 중 하나」라는 설명이 더 정확할지도 모른다. 다만 목표 12를 선택한 작품이 모두 이 형식을 사용하는 것도 아니었으며(냉장고 이야기나 고구마 이야기는 반전을 사용하지 않고 다른 관점에서 작성됨), 테마와 형식이 완전히 일치했던 것도 아니었다.
만약을 위해 다른 두 가지 패턴도 마찬가지로 목표 12와의 중첩 여부를 조사해 보았다. 30편 전체에서 목표 12가 차지하는 비율은 33%였으므로, 이를 기준으로 한다.
| 패턴 | 해당 작품 중 목표 12 비율 |
|---|---|
| 삼막 구조 (Three-act structure) | 33% |
| 기준율(33%)과의 차이 | |
| ... | ±0포인트 |
반전 구조만이 돌출되어 있었고, 나머지 두 가지는 목표 12를 다루고 있는지 여부에 따라 큰 차이가 나지 않았다 (유의성 검정은 실시하지 않았으며, 30편이라는 작은 모집단의 기술 통계에 그침). 삼막 구조나 직업을 통한 깨달음은 어떤 목표를 다루는지와 관계없이 나타나는, 진정한 의미에서의 「이야기의 형식」이라고 할 수 있을 것 같다. 반전 구조만이 테마 선택의 영향을 강하게 받았다는 의미가 된다.
또 하나, 세어보면서 깨달은 점이 있다. 17개 목표 중 4개——에너지, 산업과 기술 혁신, 기후 변화, 파트너십——는 30편 중 그 어디에도 한 번도 등장하지 않았다. 특히 기후 변화는 SDGs 중에서도 상당히 인지도가 높은 목표일 텐데, 그것이 제로였다는 점은 조금 의외였다.
SDGs는 「17개 목표는 통합되어 있으며 불가분하다」는 입장을 취하고 있다. 이는 본래 정책적으로 목표들이 서로 얽혀 있다는 의미이지, 「모든 문장에서 17개 목표를 균등하게 다뤄야 한다」는 뜻은 아닐 것이다. 그럼에도 불구하고, 1,000자 분량의 실체험 에세이라는 형식 자체가 이야기하기 쉬운 목표와 이야기하기 어려운 목표를 만들어내고 있는 것처럼 보인다. 쓰레기나 소비와 같은 친숙한 체험은 이야기로 만들기 쉽지만, 기후 변화나 산업 구조는 개인의 1인칭 에피소드로 녹여내기 어려울지도 모른다.
이러한 편향이 「심사하는 측의 취향」에 의한 것인지, 아니면 「응모하는 측이 애초에 그런 테마를 선택하기 쉬운 것」인지는 이번 데이터만으로는 구분할 수 없다. 수상작이 아닌 응모작 전체를 본다면 실마리가 될 것 같지만, 과거 연도의 응모작을 거슬러 올라가 볼 수 있는 수단은 보이지 않았다. 콘테스트 투고 페이지에는 기간을 지정하여 과거의 투고를 찾아내는 기능이 없었고, 지금 보이는 것은 최근의 투고뿐이었다. 이번에 어떤 목표가 승리했는지는 알 수 있지만, 왜 그 목표가 선택되기 쉬운지는 아직 잘 알 수 없다.
그럼에도 불구하고, 주최 측이 제시한 형식은 「정답은 아니지만 아주 틀린 것도 아닌(당라즈토모 토카라즈토모)」 수준이었다. 골격은 정확하게 모방하고 있었으나, 수상작에서 관찰된 특징을 모두 대표하지는 못했다.

형식을 모방하는 것의 한계
이 결과를 단순한 콘테스트 공략 팁 정도로 치부하기에는 아깝다는 생각이 들었다.
AI로 「승리 패턴」이나 「성공 사례의 형식」을 분석할 때, 우리는 종종 표층적인 구조——삼막 구조, 기승전결, 템플릿적인 흐름——를 추출하는 것에 만족해버리곤 한다. 하지만 이번에 알게 된 것은, 구조가 일치하더라도 그 구조 안에 무엇을 채워 넣느냐에 따라 결과는 완전히 달라질 수 있다는 사실이었다. 모범 에세이는 형식적으로는 모범 답안이지만, 실질적으로는 발견된 승리 패턴의 일부만을 대표하고 있는 것일지도 모른다.
주최 측 스스로가 선의로 준비한 참고 작품조차 이 차이를 완전히 메우지 못했다는 점은 흥미롭다. 형식을 만드는 입장에 있는 사람조차 수상작에 실제로 나타나는 특징을 모두 언어화하고 있다고 단정할 수는 없는지도 모른다.
이는 응모자에 대한 교훈이라기보다, 우리 자신에 대한 경계에 가깝다. 형식을 분석할 때, 「구조가 같으니 똑같이 평가받을 것이다」라는 전제를 우리는 어디까지 의심하고 있는가.
동일한 검증 방법을 다른 콘테스트나 다른 장르의 「모범 사례」에 적용한다면 어떤 결과가 나올까.
본 기사는 사쿠라 인터넷 「사쿠라 AI Engine 3,000 요청 소진 챌린지」 참여 작품입니다. 분석 대상은 문예춘추 × note 「#미래를 위해 할 수 있는 일」 에세이 콘테스트의 공개 수상작입니다. 본 기사의 요약 생성에는 Claude Opus 4.8, 벡터화 및 유사도 분석에는 로컬 임베딩 모델(intfloat/multilingual-e5-small, 384차원)을 사용했습니다. 시리즈의 다른 기사에서는 사쿠라 AI Engine(Kimi-K2.6, 문서 RAG API)도 이용하고 있습니다.
관심이 있으신 분은 링크된 원문 기사도 함께 읽어보시면 재미있을 것입니다.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기

