천문학 분야의 기계 학습 채택 현황 비교: 일본과 해외
요약
본 글은 2020년부터 2025년까지 arXiv의 astro-ph에 투고된 천문학 논문을 분석하여, 기계 학습(ML) 채택 현황을 일본과 해외를 비교합니다. 그 결과, ML 사용 비율이 해외 대비 일본에서 낮은 수준을 유지하며 따라잡지 못하고 있음을 통계적으로 확인했습니다. 특히 Transformer 계열의 경우 세계적인 급증세와 달리 일본은 상대적으로 적은 편이었으나, 이는 우연일 가능성도 제기되었습니다.
핵심 포인트
- 천문학 분야 ML 채택률: 해외 대비 일본이 약 절반 수준으로 낮은 경향을 보임.
- 해외는 5년 만에 ML 논문 비율이 두 배로 증가했으나, 일본은 낮은 수준을 유지함.
- Transformer 계열의 세계적 급증세와 비교 시, 일본의 현황은 통계적으로 단정하기 어려움.
- 연구 데이터 분석 과정에서 측정 방법론과 함정을 깊이 있게 다루는 것이 중요함을 강조.
천문학에서 기계 학습을 사용하는 연구를 하다 보면 '일본은 해외에 비해 뒤처지고 있다'는 이야기를 여러 번 듣게 됩니다.
하지만 그것은 학회의 분위기나 주변에서 접하는 논문을 통해 얻은 개인적인 인상일 수 있습니다.
그래서 이번 글에서는 강연이나 신청서의 배경 지식으로 활용할 수 있을지 궁금해서, 실제로 데이터를 가지고 숫자로 확인해 보았습니다.
2020년부터 2025년까지 arXiv의 astro-ph에 투고된 논문을 모두 세어보고, 기계 학습을 사용한 논문의 비율을 일본과 해외를 비교했습니다.
결론부터 말씀드리자면, 일본의 ML 채택률은 해외의 약 절반 수준이었습니다. 또한, 계산 방법을 다양하게 바꿔보아도 이러한 경향은 변하지 않았습니다.
본문에서는 결과 외에도 논문을 세는 방식과 중간에 겪었던 어려움(함정)들에 대해 정리했습니다.
서지 데이터를 세는 작업은 처음에는 간단해 보였지만, 실제로 조사해보니 제대로 측정하지 않으면 결론이 뒤집힐 수도 있어서 생각보다 매우 번거로웠습니다….
먼저 결과부터

왼쪽: 기계 학습을 사용한 논문의 비율. 오른쪽: 일본의 채택률을 해외의 채택률로 나눈 비율. 음영 영역과 오차 막대는 95% 신뢰 구간입니다.
왼쪽 그래프가 채택률의 추이입니다. 해외는 2020년의 3.2%에서 2025년의 6.4%로, 5년 만에 두 배가 되었습니다. 일본은 1.8%에서 3.1%로, 2024년까지는 거의 평행했습니다.
오른쪽 그래프는 일본의 채택률을 해외의 채택률로 나눈 비율입니다. 6년간을 종합하면 0.48배 (95% 신뢰 구간 0.41~0.57) 이며, 어느 해를 보아도 1보다 낮습니다. 일본의 논문 수는 매년 약 1,000편 정도로 적기 때문에 약간의 변동은 있지만, 유의미한 차이는 확인되었습니다.
또한 비율이 0.57에서 0.42로 떨어진 것처럼 보일 수도 있지만, 통계적으로 유의하다고는 할 수 없는 상황입니다. 따라서 전체적으로 말할 수 있는 것은, 해외의 채택률이 계속 증가하는 동안 일본은 낮은 수준을 유지하며 따라잡지 못하고 있다는 점입니다.
방법별로 살펴보면
기계 학습 방법을 5가지로 나누어 세어보니 다음과 같았습니다.
| 방법 | 세계 (2020→2025) | 일본 (2020→2025) |
|---|---|---|
| Transformer 계열 | 0 → 132편 | 0 → 3편 |
| ... | ||
| 目を引くのは Transformer です。世界では 2022 年ごろから急増して 6 年で 248 本になったのに対し、日本の論文は 2024 年まで 1 本もなく、2025 年にようやく 3 本でした(確かに Transformer 系の発表を国内でほぼ聞いたことがない…)。 |
가장 눈에 띄는 것은 Transformer입니다. 세계적으로는 2022년경부터 급증하여 6년간 248편이 되었는데, 반면 일본의 논문은 2024년까지 1편도 없었고, 2025년에 겨우 3편에 그쳤습니다 (확실히 국내에서 Transformer 계열 발표를 거의 들어본 적이 없습니다…).
다만 이것이 유의미한지 따져보면 의심스럽고, 설령 세계와 같은 비율로 가정하더라도 일본의 Transformer 계열 기대치는 약 6편 정도인데, 실제 3편과의 차이는 우연으로 설명 가능한 범위입니다 (포아송 분포에서 p ≈ 0.16). 따라서 Transformer 계열이 특별히 뒤처지고 있다고는 현재로서는 단정할 수 없는 결과였습니다 (2026년은 세계적으로 극적으로 증가할 것 같으니 내년에는 명확해질 것 같습니다).
측정 방법
모집단과 정의
| 항목 | 정의 |
|---|---|
| 모집단 | ADS에 수록된, arXiv의 astro-ph (CO / EP / GA / HE / IM / SR) 논문, 2020~2025년 |
| ... | |
| 연구를 주도한 사람(PI)으로 정의하기 위해 '일본 논문'인지 여부는 제1 저자와 교신 저자를 기준으로 삼았습니다. 특히 대규모 국제 공동 연구의 경우, 일본 기관의 연구자가 공동 저자로 참여했더라도 방법론 선택에 관여하지 않은 경우가 많기 때문입니다. |
방법론 판정은 제목과 초록에 대한 정규 표현식(regular expression)을 기반으로 합니다. 여러 방법을 사용한 논문은 Transformer > CNN > 기타 딥러닝 > 고전적 방법 > 방법명 없음 순서로 상위 항목 1개로 분류했습니다. 이 우선순위는 천문학 딥러닝 리뷰 논문 (Ting 2026, ARA&A)의 집계 방식에 맞추었습니다.
전체 과정은 ADS API를 이용해 후보 논문을 가져온 뒤 → 수동으로 분류하고 → 연도별로 세는 3단계입니다.
타당성 평가
여기부터가 문제입니다. 측정 과정 중 어딘가 편향이 있다면, '일본은 절반'이라는 결과 자체가 의심스러워집니다. 그래서 번거롭지만, 떠오르는 한계점(bias)을 하나씩 제거하는 작업을 했습니다.
1. 천문학이 아닌 연구가 섞여 들어갔다
처음에는 OpenAlex라는 무료 논문 데이터베이스의 분야 분류(Astronomy and Astrophysics)를 모집단으로 삼았습니다. 국가 정보가 구조화되어 있어 다루기 쉬웠기 때문입니다.
그런데, 분류의 정확성을 확인하기 위해 'Transformer'로 판정된 논문을 50편 체크해 본 결과, 19편이 천문학 논문이 아니었습니다. 송전망에 흐르는 지자기 유도 전류, 변전소 접지, 낙뢰기 설계, 인도네시아어 프로그래밍 논문, 학술지 심사 코멘트에 대한 답변까지 포함되어 있었습니다.
아마 우주 날씨(태양 활동이 지상 전력망에 미치는 영향)의 연관성 때문에 천문학으로 분류된 것으로 보입니다. 그리고 정규 표현식의 'transformer'는 전기 변압기에 반응하고 있었습니다.
골치 아픈 점은, 이런 논문들이 채택률의 분모에도 똑같이 포함되어 있다는 것입니다. 정규 표현식을 수정하는 것만으로는 부족했기 때문에, 모집단을 '저자 자신이 astro-ph에 투고한 논문'으로 변경하고 데이터 소스도 익숙한 ADS로 바꿨습니다. 편리함을 얻으려다 본말전도를 겪었습니다….
2. 하이픈 하나로 논문을 놓치다
분류기가 얼마나 많은 논문을 빠뜨리는지 확인하기 위해, 일본 연구자가 작성한 기계 학습 논문 중 제가 확실히 아는 것 11편을 대조했습니다. 결과는 11편 중 7편밖에 검출하지 못했다는 것이었습니다.
원인의 대부분은 간단해서, 초록에 'deep-learning-based'처럼 하이픈으로 연결되어 쓰였기 때문입니다. 정규 표현식은 'deep learning' 사이에 공백만 허용했기 때문에, 이를 놓치고 있었습니다. 나머지는 'deep anomaly detection'이나 'machine learning'처럼, 방법론명을 언급하지 않고 기계 학습 사용을 서술한 논문이었습니다.
그래서 단어 사이의 하이픈을 허용하고, 나아가 방법론명 없이도 기계 학습 사용이 파악되는 표현 방식도 하나의 분류로 포함하도록 했습니다. 이렇게 하자 11편 모두를 검출할 수 있었습니다.
다만, 이 11편은 분류기를 수정하는 데 사용했기 때문에 '놓친 논문이 제로'는 아니라는 점에 주의가 필요합니다. 이곳의 독립적인 추정은 향후 과제가 될 것입니다.
3. 일본 저자만 표기 방식이 다른 가능성
여기서 걱정된 것은, '일본 저자는 방법론명을 쓰지 않고 '기계 학습으로'라고만 서술하는 경향이 있어, 일본 논문만 많이 놓치고 있는 것이 아닐까' 하는 가능성이었습니다. 만약 그렇다면, 일본의 기계 학습 채택률이 실제보다 낮게 나올 수 있습니다.
확인해 보니 다행히 기계 학습 논문 중 방법론명을 쓰지 않은 비율은, **일본과 해외 모두 21.4%**였습니다. 실제로 방법론명 없는 논문을 포함하든 안 하든, 채택률의 비는 0.483으로 변하지 않았습니다.
4. 소속을 알 수 없는 논문이 3할이나 있다
arXiv에만 실린 논문(학회 발표 초록, 백서, 기계 학습 워크숍 논문 등)은 ADS에서도 저자의 소속이 공란인 경우가 있습니다. 그 비율은 astro-ph 전체로 볼 때 1221%이지만, **기계 학습 논문에서는 2132%**로 확연히 높아져 있었습니다. 기계 학습 논문의 경우만큼 학술지에 실리지 않는 워크숍 논문이 많기 때문인 것으로 보입니다.
이는 무시할 수 없는 바이어스입니다. 예를 들어 소속을 알 수 없는 논문을 '해외'로 계산하면, 기계 학습 논문일수록 누락되기 쉬워서 일본의 기계 학습 논문이 분자에서 더 많이 빠지게 됩니다. 진정한 비율을 0.43으로 가정하고 200만 편의 모의 데이터로 테스트했을 때, 이 방식으로 계산하면 0.39가 되어, 일본의 뒤처짐을 약 1할 정도 과장하는 계산이 됩니다.
그래서 채택률은 '제1 저자와 최종 저자의 소속이 모두 확인되는 논문'만으로 계산하기로 했습니다. 같은 모의 데이터에서 0.42로, 거의 진값으로 돌아오는 것도 확인했습니다. 다만, 이 보정에는 '소속 누락 가능성은 일본 논문인지 여부와 무관하다'는 가정이 있습니다 (이는 확인할 방법이 없으므로 본 조사 결과의 한계로 합니다).
5. '일본' 판별은 정확한가
일본 논문인지 아닌지는 ADS 소속란에 'Japan'이나 주요 도시명, NAOJ・JAXA・RIKEN 등의 기관명이 들어있는지 여부로 판정했습니다. 확인을 위해 OpenAlex가 기관별로 붙인 국가 코드를 비교해 본 결과, 일치율은 제1 저자에서 99.7%, 최종 저자에서 99.6%였으므로 문제없다고 판단했습니다. 불일치의 대부분은 ADS 측에서 소속이 공란인 논문 같았습니다.
6. 기계 학습이 아닌 논문을 세고 있지 않은가
마지막으로 가장 힘든 확인 작업으로, 기계 학습(ML)으로 판별된 논문의 제목과 초록을 방법론별로 50편씩, 총 250편 읽었습니다(실제로는 몇 번이고 다시 했기 때문에 500편 이상을 읽게 되었네요…). 사람의 눈으로 ‘기계 학습을 사용하지 않았다’고 판단한 건 9편이었고, 기계 학습 논문으로서의 정확도는 0.96입니다. 각 방법론별 본수에 가중치를 다시 부여하자 전 세계적으로는 0.952, 일본에서는 0.953으로 나타났으며, 오탐지 비율은 일본과 해외에서 동일하여 편향이 없음을 확인했습니다.
천문학 특유의 오탐지 사례
정규 표현식(regex)으로 논문을 분류하다 보니 천문학 특유의 함정에 여러 개나 부딪혔습니다. 기록으로 남겨둡니다.
| 구절 | 반응해 버린 것 |
|---|---|
| transformer | 송전망 변압기 |
| ... | |
어떤 경우든, 천문학 논문을 읽은 사람이라면 순식간에 알 수 있는 것이지만, 정규 표현식으로는 알 수 없습니다. 결국, transformer |
나 convolutional
같은 단어는 단독으로 쓰지 않고, ‘transformer-based’ 또는 ‘convolutional neural network’처럼 사용 방식이 명확한 형태로 한정하고, 약어는 대소문자를 구분하여 처리했습니다.
참고로, 최근접 이웃(k-NN) 처리는 조금 고민해봤습니다. 환경 밀도 측정 방법은 통계학적으로 k-근방법의 밀도 추정 그 자체입니다. 다만, 이번 조사에서 알고 싶은 것은 ‘기계 학습을 연구 도구로 활용하고 있는지’인데, 환경 밀도는 기계 학습이 보급되기 훨씬 전부터 천문학에서 사용되어 온 정형화된 측정 방법이라 포함하지 않는 것이 좋다고 판단했습니다.
본 조사의 한계점
위와 같이 생각보다 어려웠기 때문에 이 글에서는 다음 사항들을 타협했습니다. 향후 조사 보고서로 제출할 때의 개선 메모로 기록해둡니다.
- 초록에 전혀 언급되지 않은 기계 학습은 집계 불가. 본문 일부에서 보조적으로 사용된 논문은 제외됩니다.
- 방법론별 분류는 대략적인 참고치입니다. 250편을 읽고 붙인 라벨을 기준으로 방법론별 정확도는 Transformer 0.80, CNN 0.86, 기타 심층 학습(deep learning) 0.66, 고전적 방법(classical methods) 0.96, 방법명 없음 0.72였습니다. 오분류의 대부분은 비교 대상으로 이름만 언급된 상위 방법론에 끌려가는 경우입니다(예: 랜덤 포레스트를 사용한 논문이 ‘신경망에 비해’라는 한 문장 때문에 심층 학습으로 분류되는 등).
- 분야 구성 차이는 보정하지 않았습니다. 체감상 크게 다르지 않다고 생각하지만, 만약 일본의 논문들이 기계 학습이 원래 쓰이기 어려운 분야에 편중되어 있다면, 방법 선택 방식이 같더라도 비율은 1 미만이 될 수 있습니다. arXiv의 하위 카테고리별 비교는 향후 과제입니다.
- 누락률(miss rate)은 아직 독립적으로 측정되지 않았습니다. 이 역시 향후 과제입니다.
맺음말
직감적으로 느낀 ‘일본이 뒤처지고 있다’는 것은 적어도 astro-ph 논문으로 볼 때 맞는 이야기였고, 그 차이는 약 2배라는 결과였습니다.
다만 개인적으로 이 결과는 오히려 격려가 되고, 앞으로 진지하게 임할 동기가 될 것 같습니다. Subaru 망원경의 HSC, PFS처럼 일본에는 세계 최고 수준의 대규모 데이터가 있는 반면, 그것을 활용하는 방법론 측면이 따라가지 못하고 있습니다. 이러한 비대칭성은 역설적으로 일본 발(發) 방법 개발이 들어갈 여지가 아직 크다는 것을 의미합니다.
이번 조사를 통해 가장 크게 느낀 것은 셈하는 작업일수록, 세는 방식의 검증에 시간이 많이 걸린다는 것입니다. 집계 자체보다 송전망 혼입, 하이픈, 소속 누락 등 다양한 오염(contaminants)을 하나하나 제거하는 데 상상 이상으로 많은 시간이 걸렸습니다…. 서지 데이터로 무언가를 주장할 때는, 먼저 직접 50편 정도 읽어보는 것을 추천합니다.
참고 자료
- Ting, Y.-S. 2026,
AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn ML의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기