AI 챗봇, 금융 질문에 ‘대부분’ 잘못된 답변
요약
AI 챗봇의 금융 질문 답변 정확도가 낮다는 지적이 있으나, 모델 자체 능력과 도구 결합 능력을 구분해야 합니다. LLM은 최신 세법 반영에 시차가 있지만, 웹 검색 및 코드 실행 도구를 결합하면 신뢰성이 크게 높아집니다. 궁극적으로는 재무 자문가의 객관적인 조언을 얻는 것이 중요합니다.
핵심 포인트
- LLM의 금융 답변 정확도는 모델 자체 능력과 외부 도구 활용 능력을 구분해야 합니다.
- 웹 검색 및 코드 실행 도구를 결합하면 신뢰성이 크게 향상됩니다.
- 금융 정보는 정부 기관에 갇히는 경향이 있어, 프로그래밍만큼 자유롭지 않습니다.
- 재무 자문가 선택 시 판매 수수료를 받지 않는 '수탁자 의무' 준수 여부가 중요합니다.
기사는 https://www.saturnos.com/report/artificial-authority를 두루뭉술하게 요약한 수준임.
개인적으로 현재 모델은 일반적인 개인 재무 원칙을 꽤 잘 다루는 것 같음. 직접 여러 책과 자료를 찾아보는 경우가 아니라면, 보통 접하는 재무 교육보다는 확실히 나은 편임. 다만 최신 세법 등이 학습에 반영되기까지 시차가 있으므로, 실제 돈이 걸린 의사결정을 직접 맡기지는 않겠음.
이제 모델은 권위 있는 책의 일부를 제공하면 그 내용을 반영해 더 나은 답을 내놓을 정도로 발전했음. 기본 답변이 평범하더라도 개선이 가능하고, 개인 상황에 맞게 조정해 주기도 함. 에이전트 방식이 다른 분야에서도 작동하는데 주로 코딩에만 쓰이는 게 흥미로움.
여전히 적어도 일부는 검증해야 하지만, 예전에 Google로 간단히 검색해서 찾던 보통 수준의 자료보다는 전반적으로 낫다고 봄.
그렇다면 모델 자체와 이를 감싸는 실행 환경이 각각 얼마나 영향을 주는지가 궁금함.
여기서 측정한 것은 모델 자체의 능력이지, 모델의 응답에 호출 가능한 도구를 결합한 채팅 도구의 능력이 아니라는 점을 짚어야 함. 주요 AI 연구소도 이를 잘 알고 있음. Anthropic 등의 교육 자료는 사용자나 작업 흐름을 설계하는 분석가가 적절한 도구 사용을 보장하고, 작업의 위험과 결과에 따라 적절한 단계에서 사람이 검증해야 한다고 강조함.
학습 시점에 제한이 있는 언어 모델이 최신 세법을 모르거나 정확한 수치 계산을 못 하는 것은 당연함. 하지만 채팅 에이전트가 호출하는 웹 검색과 코드 실행 도구를 결합하면 결과의 신뢰성이 훨씬 높아짐.
세법 반영 시차와는 거의 관계없는 일임.
산업마다 같은 일이 반복될 것임. AI가 금융을 잘 못하는 것은 아직 금융 역량에 대한 강화학습을 충분히 하지 않았기 때문임. 대형 AI 연구소의 우선순위에서 금융 벤치마크가 뒤처져 있을 뿐이며, 현 단계에서 가장 큰 지렛대 효과를 주는 프로그래밍 해결이 먼저였음. 정리 증명도 코드였기에, 그 부산물로 밀레니엄 난제까지 풀 수 있었음.
FT 댓글의 재무 자문가들은 전형적인 함정에 빠지고 있음. AI 챗봇에 근본적인 결함이 있어 금융을 영원히 못 할 것이라고 여기지만, 이는 현재 제품과 기술 자체를 혼동하는 것임. 가까운 미래에 누군가 금융 특화 Claude를 내놓으면 그들의 세계가 무너질 것임.
여기서 금융 질문이 구체적으로 무엇이었는지는 모르겠지만, LLM이 금융에서도 프로그래밍만큼의 역할을 하게 될지는 의문임. 일정 수준을 넘어서면 금융 정보는 정부가 특별한 권한을 부여한 민간 기관 안에 갇혀 있는 반면, 프로그래밍 정보는 누구나 자유롭게 접근할 수 있음.
LLM이 프로그래밍을 해결한 것은 아님. AI 챗봇은 프로그래밍 질문에도 대부분 틀린 답을 내놓음.
매년 Claude에 복잡한 세금 계산을 맡기고, 세무 자문가의 결과와 비교함. 해마다 결과가 정확히 일치함. 내가 정말 운이 좋은 걸까?
아니면 세금 계산이 아주 단순한 것 아닐까?
재무 자문가 대부분이 최선과는 거리가 먼 조언을 하고 판매 수수료를 받는 상품으로 고객을 유도하는 만큼, bogleheads.org로 학습한 편향 없는 LLM이라면 기꺼이 받아들일 수 있음.
그래서 펀드 선택에 따른 판매 수수료를 받지 않고 고객의 이익을 우선할 수탁자 의무가 있는 재무 자문가를 찾는 것이 중요함.
원하는 게 그거라면 토큰을 아껴주겠음. 어떤 질문을 읽어도 Put it into VFIAX만 출력하는 셸 반복문이면 됨.
단발성 응답이었는지, 추론을 활성화했는지 궁금함. 내 경험상 추론을 켜면 환각이 크게 줄고 출력 품질도 좋아짐. 추론 없는 모델은 신뢰하지 않음.
기사에 따르면 가장 성능이 좋았던 모델은 추론 모드의 Claude Opus 5였지만, 그마저도 답변의 39%에서 오류를 냈다고 함.
금융에서 LLM이 겪는 어려움은 글쓰기, 디자인 등 여러 분야와 같음. 코드가 아니라는 것임.
코드는 의도한 대로 작동하는지, 특정 테스트를 통과하는지 객관적으로 확인할 수 있어 코딩 에이전트가 해법의 적절성을 판단할 단서를 얻을 수 있음. 다른 거의 모든 분야에서는 이것이 훨씬 어려움.
다른 분야의 통과·실패 테스트는 활용도가 훨씬 낮음. 특정 단어를 쓰지 말거나 문장을 일정 길이 이하로 제한할 수는 있지만, 그런 규칙만으로는 부족함. 글이나 디자인이 코드처럼 제대로 작동하는지 판정할 수는 없음.
수백만 단위의 계산 오류를 만들어내고, 재무상태표 등 금융 데이터의 배치가 학습 데이터와 다르면 제대로 처리하지 못함.
작업 흐름에 AI를 더 많이 넣어보려 하지만, 아직은 바이브 코딩처럼 잘 작동하지 않음. 그래도 규정 등 전문 자료 검색은 잘되는 편임.
나도 같은 일을 겪었음. 밀레니엄 수학 난제를 풀 수 있는 기술이 꽤 기초적인 금융 계산은 완전히 망친다는 게 참 이상함.
어떤 맥락을 제공하느냐에 크게 달린 것 같음. 필요한 정보를 제대로 주면 금융 관련 질문에도 탄탄한 답을 받았음. 다만 빠진 내용을 알아서 추측하도록 맡기지는 않겠음. 이번 시험에서 모델에 데이터와 맥락을 얼마나 제공했는지 궁금함.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기