AI로 기록 보관소를 탐색해 잊힌 운석과 코뿔소 기록 등을 찾아냄
요약
AI를 활용하여 방대한 역사 기록물(VOC 기록 등)을 탐색하고, 잊힌 지식이나 과거의 기상 패턴 같은 정보를 복원하는 흥미로운 시도가 논의되었습니다. LLM과 자연어 처리 기술이 기존 수작업 방식보다 효율적으로 대규모 데이터셋 구축에 활용될 가능성이 제시되었습니다.
핵심 포인트
- LLM은 영리한 통계 기법으로, 전통적인 NLP/OCR 기법을 능가하는 탐색력을 보여줌.
- 방대한 역사 기록물에서 과거의 기상 패턴이나 침몰선 정보 등 새로운 데이터를 추출할 수 있음.
- 대규모 전처리 작업에 LLM과 텍스트 임베딩 결합이 유용하며, 초기 투자 대비 효율성이 높음.
- AI 기술을 활용한 지식 탐험은 가치 있는 학습 경험을 제공하지만, 결과물의 해석에는 신중함이 필요함.
훌륭한 성과인데 반사적인 반AI 정서 때문에 제대로 인정하지 않는 건 안타까움. 똑같은 특이점과 이상 징후를 3~5년 전에 전통적인 자연어 처리, OCR, 영리한 통계 기법으로 발견했어도 폄하했을까?
글에는 AI를 조율하고 탐색한 과정이 나와 있으며, 기존 기법을 썼을 때보다 노력이 덜 인상적인 것도 아니고 발견의 검토 가치가 떨어지는 것도 아님.
이 비판은 이해하기 어려움. 이 댓글 스레드는 발견에 상당히 긍정적임. 지금은 작업을 평가하고 검증하기 어려워진 사회적 검증 문제 때문에 모두 판단에 더 신중해진 것임.
LLM도 영리한 통계 기법임. 직접 코딩하겠다고 고집하는 나 같은 구식 개발자도 이런 활용에는 박수를 보내게 됨.
VOC 기록물은 케이프타운과 큐에도 있음. 큐에서는 ‘letters of Loot’를 검색하면 되며, 실제로 사략선이 약탈한 기록물임. 모두 고지 네덜란드어로 쓰였고 일부는 독일어인데, 번역은 얼마나 신뢰할 수 있을까?
잃어버린 지식을 탐험하는 듯한 흥미로운 글이었고, 디자인과 운석·화산 효과도 마음에 듦. 다만 회전하는 코뿔소와 그 주위를 흐르는 본문은 고쳐주면 좋겠음.
이런 기록에서 침몰선의 위치·항로와 사라진 화물, 한때 전설적이었지만 지금은 잊힌 해적 선장, 여름철 강설 같은 이상 기상 현상도 찾을 수 있지 않을까?
회전하는 코뿔소, 운석 충돌, 움직이는 흐름도는 불필요한 시각 효과라 거의 풍자물처럼 보이게 함. 이런 고급 효과 경쟁이 계속되면 결국 1990년대 ‘공사 중’ 배너 GIF처럼 보일 듯함.
효과가 우스울 정도로 별로임. New York Times의 스크롤 효과에서 영감을 받은 듯하지만, NYT는 본문을 가릴 만큼 어리석지는 않았음. 형태는 기능을 따라야 하며, 웹페이지의 기능은 읽히는 것임. 화산재 구름이 시야를 가리는 모습을 흉내 내려는 듯한 효과로 읽을 내용을 가려서는 안 됨. 적어도 ‘공사 중’ 배너는 본문을 침범하지 않았음.
그럴 수도 있지만, 지금은 이런 효과가 재미있게 느껴짐.
바로 그 1990년대 ‘공사 중’ 배너 같은 느낌이 마음에 듦.
“네덜란드 동인도회사 기록만 페이지당 2분씩, 하루 8시간, 주 5일 읽어도 약 70년이 걸리지만, 직접 만든 AI 실험실은 밤사이 12시간 만에 전체 기록을 처리했다”고 함.
정작 저자 본인은 네덜란드 동인도회사에 대해 얼마나 배웠을까? 거의 배우지 못했을 것 같음. 이런 작업은 영양가 없이 열량만 있는 정크푸드를 떠올리게 함.
대부분이 가치가 적고 지루한 반복 작업이라 아예 읽지 않는 것보다는 분명 더 배웠을 것임.
과거 기상 패턴 복원에 활용할 수 있을 듯함. 날씨는 예측하기 어려우니 과거 정보가 더 나은 모델을 만드는 데 도움이 될 수 있음. 수백만 문서에서 수작업으로 수집하기는 고되지만, 텍스트 임베딩과 LLM 분석을 결합하면 외딴 지역이나 과거 시기의 기상 데이터셋을 만들 수 있음.
“오늘 비가 많이 왔다”는 일기 한 줄도 재료가 될 수 있음. 쓸 만한 데이터를 복원할 만큼 정보가 충분한지는 모르지만, 시도해 볼 만한 실험으로 보임.
아마 많이 배웠을 것임. 나는 지난 2년간 LLM으로 그 어느 때보다 다양한 분야를 배웠음.
댓글 이력으로 보면 오랫동안 똑똑했던 이들이 왜 LLM에는 이렇게 빈약한 논리와 합리화를 들이대는지 모르겠음. 오히려 내 입장이 더 급진적으로 바뀌고 있음. 곳곳에 데이터센터가 생기고 토큰이 전기나 물처럼 저렴해지길 바람.
이 작업을 안 했으면 동인도회사에 대해 대단히 많이 배웠을 거라는 건가? 정크푸드도 결국 음식이며, 그것만 먹고도 몇 년은 살 수 있음.
현대 정치 논평 매체를 대상으로 비슷한 프로젝트를 진행 중임. 팟캐스트, 블로그, 기고문, 방송을 작은 단위로 나누고 구조·발화자·인용문·명사를 추출해 상호 참조함. 역사 문서에도 이런 대규모 전처리를 적용할 가치가 있을지 궁금함.
초기 비용은 훨씬 크지만, 이후에는 현재 시스템보다 더 적은 비용으로 질문에 답할 수 있음. 관심 있는 이들을 모아 구조화 작업에 공동 투자하는 것도 고려할 만함. 현대 음성 전사와 역사 문서 스캔 모두 잘못 적힌 단어를 문맥으로 교정해야 한다는 공통점도 있음.
비슷한 작업에서 내 가장 큰 골칫거리는 OCR 오류였음. 교육을 덜 받은 사람이 쓸 법한 자연스러운 철자 오류는 그다지 어렵지 않음. VOC 서신 대부분은 교육받은 서기가 작성해서 이 부분은 덜 까다롭지만, 1650년 이전 필체는 상당히 달랐음.
이런 작업의 윤리적 파급효과도 꼭 고려해 주길 바람. 정확히 무엇을 만드는지는 모르지만, 그 구조는 무기로도 쓰일 수 있음. 무기는 만든 사람의 선의를 개의치 않음.
기존 삶의 방식을 대체하는 파괴적 기술이 등장할 때마다 사람들은 적응해 왔고, 이번에도 그래야 함. LLM이 이전에 가치 있던 작업의 가치를 낮춘다고 느낀다면, LLM이 대체하는 수준을 넘어서는 성과를 내야 할 때임. 그럴 능력은 있지만 방법은 스스로 찾아야 함. 비난만 하며 아무것도 기여하지 않으면, 자신이 내는 성과도 오히려 줄어들게 됨.
이 프로젝트의 구성과 상호작용 요소, 화면을 가로지르는 운석 효과가 마음에 들었으며, 지금까지 본 LLM 활용 중에서도 매우 훌륭함. 앞으로 계획이 있는지, 아니면 여기서 마무리인지 궁금함. 현재 진행 상황을 다룬 부분에서는 다음 탐색 주제를 찾지 못했음. 지금은 답을 찾는 것만큼 질문을 찾는 일도 중요해 보임.
이 글은 도도새나 Newton 연구와는 다름. 그 글들은 해당 분야 전문가가 AI의 끈질긴 탐색으로 흥미로운 예외를 발견한 것이지만, 여기서는 “어느 분야에 접근하고 무슨 질문을 할까?”부터 시작함.
비개발자 친구들이 바이브 코딩하는 모습을 보면 기본 기술 지식은 부족해도, 시간이 지나면서 의존성이나 모바일·데스크톱 버전의 차이를 알아채는 작은 경험이 쌓임. “모르겠고 관심도 없으니 결과만 달라”는 태도보다 “어디에 생산적으로 적용할 수 있겠다”는 깨달음이 훨씬 흥미로움.
Anthropic이 ‘매우 중요한’ Linux 버그를 많이 찾았다고 여기는 것도 비슷함. 실제로는 그렇지 않음.
이 논리에는 허점이 많음. 어떤 분야에 대해 말하려고 반드시 전문가일 필요는 없으며, 그런 자격 중심주의는 AI 자체가 무너뜨리고 있음. 비개발자 친구들이 그 정도로 바이브 코딩을 할 수 있다는 사실부터 이를 뒷받침함. 작은 취약점을 연결해 실제 공격을 만들 수 있는데 Anthropic이 중요한 Linux 버그를 찾지 못했다고 단정하는 것도 이상함. 과거 공격 대부분이 그런 식으로 이뤄졌음. OpenAI가 최근 해당 분야 전문가 없이 수학의 매우 중요한 문제들을 푸는 증명 400개를 공개한 것도 훌륭한 반례임.
기록에서 미기록 화산 폭발을 찾았다는 건가? 400년 된 ‘멸종한 도도새의 새로운 목격 기록’을 발견했다는 건가? 상당히 의심스러운 주장으로 보임.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기