Show HN: Echo — 오픈 가중치 모델로 Fable 수준 결과를 3분의 1 비용에 달성
요약
오픈 가중치 모델을 활용해 비용 효율적인 추론을 제공하는 Echo 서비스에 대한 사용자 피드백과 기술적 분석을 다룹니다. 모델 라우팅과 앙상블 최적화를 통해 비용을 절감하는 기술적 접근법과 서비스 운영상의 다크 패턴 문제를 함께 논의합니다.
핵심 포인트
- 오픈 가중치 모델 간 추론 자원의 효율적 배분 및 앙상블 기술 탐구
- 단순 모델 라우팅을 넘어 연산량과 중간 결과 결합을 결정하는 오케스트레이션 강조
- 초기 사용자 경험을 저해하는 다크 패턴 및 투명성 부족에 대한 비판
- 모델 성능 중심에서 효율적인 모델 운영 시스템 중심으로의 패러다임 변화 예측
응답을 받을 수 있는 것처럼 보이는 Message Echo 입력창을 보여준 뒤 가입 페이지로 보내는 전형적인 다크 패턴임
사이트가 유도한 첫 행동부터 발목을 잡혔으니 즉시 떠났고 다시 방문하지 않을 것임
나도 똑같이 느꼈으며, 이런 다크 패턴이 너무 싫어서 이제 이 제품에는 전혀 관심이 없음
지금 제거하고 있음
반면 로그인 전 요청을 허용하면 제작자가 초기 질의 비용을 부담해야 하고, 악용으로 큰 청구서가 생길 수도 있음
AI 제품을 만드는 입장에서는 이해할 만한 선택이기도 함
Echo를 사용하고 피드백을 준 모두에게 감사하며, 바로 이런 이유로 일찍 출시했음 더 어려운 코딩·에이전트 벤치마크를 포함해 최신 최고 수준과의 차이를 더 정확히 보여주는 평가를 계속 공개하고, 공개 평가 대시보드도 확장할 예정임. 평가 대시보드 UI와 가입 절차에서 발견된 문제는 운영 환경에서 수정했음
Echo 체험에는 신용카드가 필요 없고, 계정마다 API와 채팅에서 쓸 수 있는 무료 크레딧 10달러가 제공됨
단순한 모델 라우팅보다 넓게, 오픈 가중치 모델들 사이에서 추론 자원을 효율적으로 배분하는 방법을 탐구 중임. 어떤 모델을 쓸지뿐 아니라 요청에 얼마나 많은 연산을 투입하고 중간 결과를 어떻게 결합할지도 결정함
앙상블 자체는 랜덤 포레스트 이전부터 알려졌지만, Echo의 핵심은 매 요청마다 전체 앙상블 비용을 내지 않고 이를 모델링하고 활용하는 것임. Fusion이나 Fugu와 개념적으로 비슷한 면은 있어도 구조와 최적화 목표는 다름
작은 피드백으로, create password가 특수문자를 요구하지만 Google 비밀번호 관리자의 기본 생성 비밀번호에는 특수문자가 없음
두 자릿수 길이의 영숫자 조합이면 충분해 보이지만 아이디어 자체는 훌륭함
왜 다크 패턴을 사용했는지 의문임. 관심이 있었지만 이제는 사라졌음
가입을 한 번만 시도했는데도 too many authentication attempts 오류가 발생함
다크 패턴을 제거해야 함
계속 오픈 가중치를 강조하면서 어떤 모델을 사용하는지는 전혀 공개하지 않음
투명성이 없다면 오픈 가중치 모델을 쓰는 것이 최종 사용자에게 어떤 이점을 주는지 모르겠음
Fable급 결과를 3분의 1 비용으로라는 설명은 크게 보조되는 월 200달러 요금제 사용자에게는 매력적이지 않아 보임
이 요금제가 언제까지 유지될지는 모르지만, 그동안은 공개 API 가격의 3분의 1도 그다지 매력적이지 않음
월 200달러 요금제에서 주간 Fable 사용량을 소진한 뒤 판촉용 크레딧 200달러로 중간 규모 코딩 계획을 실행했는데, 1시간 15분 만에 120달러를 사용함
하위 에이전트 여러 개가 동시에 실행됐고 Claude가 저렴한 모델을 쓰라는 지시를 잊어 Fable 인스턴스가 여럿 돌아간 탓도 있지만, 토큰당 과금은 감당하기 어려움. 월 200달러도 비싸지만 하룻밤 200달러는 터무니없음
업무에 사용하는 기업 고객은 보조 요금제를 이용할 수 없으므로, 전체 사용량에서 그런 요금제가 차지하는 비중은 소수일 가능성이 큼
이 요금제는 기업공개(IPO) 까지는 유지되겠지만 그 후 오래가지는 않을 듯함
월 200달러 사용자가 API 크레딧 1만 달러어치를 쓰면 사용자당 이익률이 -98%라 손익에 도움이 되지 않음
사용량 제한이나, 경계선을 넘었을 때의 계정 정지를 피하려는 목적이라면 이야기가 달라짐
Anthropic에서 오늘 받은 이메일에 따르면 Fable 5는 7월 20일부터 사용량 크레딧 방식으로 전환됨
계속 사용할 수 있지만 종량제 크레딧이 필요하며 구독 요금제의 사용량 제한에는 포함되지 않음
앞으로 몇 년 안에 최고의 모델이라는 개념이 틈새로 밀려나도 놀랍지 않을 것임
대부분의 운영 시스템에서는 언제 저렴한 모델을 쓰고, 강력한 모델로 전환하며, 여러 출력을 결합할지 아는 오케스트레이터가 승자가 될 수 있음
그게 Gemini CLI의 발상 아닌지 궁금함
진화할 갈래가 매우 많지만 결국 최고의 모델이 틈새 개념이 되는 방향으로 수렴할 듯함
큰 흐름은 기기 내장 모델이며, 모델이 칩 다이에 들어가 몇 년마다 칩셋을 교체하는 방식도 가능함. 그런 환경에서는 대형 클라우드 사업자가 손해를 볼 것임
가장 흥미로운 결론 중 하나는 모델 크기보다 모델 선택이 더 중요할 수 있다는 것임
업계는 더 큰 모델에 집중해 왔지만, 요청을 적절한 전문 모델 조합으로 지능적으로 라우팅하면 훨씬 적은 비용으로 더 큰 개선을 얻을 수 있어 보임
약한 모델도 쓸모없어진 게 아니라 각기 다른 영역에서 뛰어나며, 다른 모델과 결합하면 가치가 크게 높아질 수 있음. 다만 적절한 모델 선택이 훨씬 어려운 코딩·에이전트 작업에서도 성립할지는 궁금함
각 작업에 전문성을 지니면서 상관관계가 낮은 소형 모델을 강하게 앙상블하면 매우 흥미로운 결과를 얻을 수 있음
에이전트·코딩 작업은 세분성 때문에 더 복잡함. 각 모델을 언제, 어떻게, 그리고 세션·목표·작업·대화 차례·도구 호출 중 어느 추상화 계층에서 사용할지 결정해야 하며 현재 적극적으로 연구 중임
실제로 몇 가지 사용자 경험 결함을 발견함 Thinking이 계속 표시돼 멈췄거나 네트워크 문제가 생긴 것처럼 보이고, 프롬프트를 입력하는 왼쪽 패널을 확장하거나 크기 조절할 수 없음. 코드를 생성해 달라고 하면 출력이 계속 끊긴 뒤 처음부터 다시 시작해 이전 대화를 이어가지 못함
문제의 복잡도를 미리 알 수 없고 이후 대화를 같은 모델로 보낸다는 보장이 없다면 이 방식은 잘 작동하지 않음
같은 대화를 여러 모델에 라운드 로빈으로 보내면 캐시가 깨져, 캐시를 고려하는 시스템보다 오히려 비용이 더 들 가능성이 큼
Anthropic Opus 4.8과 Fable 5를 한동안 사용했고 최신 OpenAI 모델도 시험했는데, 모두 불필요한 출력을 지나치게 많이 생성함
가격이 아니라 품질 때문에 다른 모델을 시험하기 시작했고, 업무 영역에서는 GLM 5.2가 Fable 5보다 모든 면에서 훨씬 우수했음. 작업을 성공적으로 끝내지 못하는 경우가 오히려 놀라울 정도임
Kimi K2.7은 지시가 조금 더 필요하지만 Opus 4.8보다 나은 사용감을 주며 K3는 아직 써보지 못함. 최신 OpenAI 모델은 소프트웨어 설계와 구현 능력이 터무니없이 나쁨
이는 데이터 분석, 기계학습, 소프트웨어 공학이 많은 내 업무 영역에 한정한 평가임
벤치마크도 사용 모델 정보도 없고, AI 생성 영상과 가입 페이지만 있음
“모놀리스를 마이크로서비스로 바꿔 모든 장애를 살인 미스터리처럼 만들었다”는 아키텍처 농담이 떠오름
공개 평가기는 https://echo.tracerml.ai/eval/에 있음
현재 7개 벤치마크 계열에서 저장된 907개 행을 공개하며 프롬프트, 출력, 평가, 비용 기록을 확인할 수 있고 더 추가할 예정임
요청별 라우팅 정책 자체가 제품이므로 공개하지 않지만, 요청별 비법을 노출하지 않는 범위에서 사용 가능한 오픈 가중치 모델 목록 일부, 버전 날짜, 전체 할당 비율, 평가 설정은 공개할 수 있음. 새 영상도 제작 중임
본질적으로 OpenRouter를 재현하려는 것으로 보임. OpenRouter는 장애 조치, 사용량 측정, 자동 전환 등으로 특정 공급자를 추상화하며 꽤 잘 작동하는 영리한 인프라 추상화임
실제 문제를 해결하기보다 “OpenRouter가 유니콘이 됐으니 나도 바이브 코딩으로 비슷하게 만들 수 있다”고 투자자에게 말하려는 시도처럼 보여 아쉬움 Fable급이라고 부르는 것도 지적으로 게으르거나 부정직하게 느껴짐
tenderlove의 “마이크로서비스는 함수 호출을 분산 컴퓨팅 문제로 바꾼다”라는 문구가 떠오름
로그인으로 보호되는 앱은 Show HN에서 허용되지 않는 것으로 알고 있음
Ask Jeeves, AltaVista, Lycos의 결과를 모아주던 Dogpile.com을 다시 만든 것인지 궁금함. 시간은 순환하는 듯함
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기