Launch HN: Nao Labs (YC X25) – 데이터용 커서
요약
기존의 범용 LLM 코딩 도구(예: Cursor)는 데이터베이스 스키마나 데이터 컨텍스트를 이해하지 못해 실제 데이터 작업에 한계가 있습니다. nao Labs에서 개발한 'nao'는 VS Code 기반으로 BigQuery, Snowflake, Postgres 등 주요 데이터 웨어하우스와 직접 연결되며, 사용자의 데이터 스키마와 코드베이스 전체를 RAG(Retrieval-Augmented Generation) 방식으로 학습합니다. 이를 통해 SQL, Python, YAML 등 데이터 관련 코드를 작성할 때 데이터의 출력을 예측하고,
핵심 포인트
- nao는 BigQuery, Snowflake, Postgres 등 주요 DW와 직접 연결되는 AI 코드 에디터로, 범용 LLM 도구의 한계를 극복했습니다.
- 데이터 스키마 및 전체 데이터 계보(Data Lineage)를 RAG 방식으로 학습하여, SQL/Python 코드를 작성할 때 데이터 출력 결과를 시각적으로 비교하고 검증할 수 있습니다.
- AI 에이전트가 누락 값 감지, 이상치 탐지 등 데이터 품질 검사(Data Quality Check) 및 다운스트림 영향도 분석을 자동으로 수행합니다.
- 데이터 팀이 dbt 등을 활용하여 모델링, 문서화, 테스트를 진행할 때, 비기술적 사용자도 쉽게 접근 가능한 개발자 경험을 제공합니다.
안녕하세요 HN에 오신 여러분, 저희는 nao Labs의 Claire와 Christophe입니다 (https://getnao.io/). 저희는 데이터를 다루기 위한 AI 코드 에디터인 nao를 출시했습니다. 이 도구는 로컬 에디터이며, 데이터 웨어하우스(data warehouse)에 직접 연결되어 있고, 사용자의 데이터 스키마(schema)와 데이터별 도메인 지식(context)이 내장된 AI 코파일럿(AI copilot)을 통해 구동됩니다.
데모는 여기에서 확인하실 수 있습니다:
LLM(대규모 언어 모델)을 사용하여 코드를 작성하는 것이 소프트웨어 엔지니어링의 새로운 표준이 되고 있습니다. 하지만 데이터 조작에 있어서는 그렇지 않습니다. Cursor와 같은 도구들은 데이터 웨어하우스와 네이티브하게 상호 작용하지 못합니다. 이들은 데이터 스키마를 알지 못한 채 SQL을 맹목적으로 자동 완성(autocomplete)할 뿐입니다. 대부분의 사람들은 여전히 여러 도구를 오가며 작업하고 있습니다: Cursor에서 코드를 작성하고, 웨어하우스 콘솔(warehouse console)에서 결과를 확인하며, 관측 가능성 도구(observability tool)로 문제 해결을 하고, BI 도구에서 대시보드가 망가지지 않았는지 검증합니다.
LLM으로 데이터에 대한 코드를 작성할 때, 사용자가 신경 쓰는 것은 코드 자체가 아니라 데이터 출력 결과입니다. 따라서 사용자에게는 자신의 데이터와 관련된 코드를 작성하는 것을 돕고, 그 코드가 출력 결과에 미치는 영향을 시각화하며, 품질 검사를 수행해 주는 도구가 필요합니다.
Christophe와 저는 각각 데이터 분야에서 10년씩을 보냈습니다. Christophe는 데이터 엔지니어로서 수십 개의 조직을 위해 데이터 플랫폼을 구축했으며, 저는 데이터 책임자(head of data)로서 데이터 팀이 분석 및 데이터 제품(analytics & data products)을 구축하는 것을 도왔습니다. 우리는 비즈니스가 데이터를 빠르게 배포하도록 요구하는 상황에서, 이 작은 코드 한 줄이 CEO 대시보드에서 수익을 실수로 x5배 증폭시킬지 걱정하며 고민하는 상황을 목격했습니다. 이는 우리에게 두 가지 선택지만 남깁니다: 광범위하게 테스트하여 느리게 배포하거나, 테스트 없이 빠르게 배포하는 것입니다. 바로 이 때문에 저희는 nao를 만들기로 결심했습니다. 데이터 팀이 비즈니스 속도에 맞춰 배포할 수 있도록, 우리의 데이터 작업에 진정으로 적응된 도구 말입니다.
nao는 VS Code의 포크(fork) 버전이며, BigQuery, Snowflake, Postgres용 내장 커넥터가 있습니다. 저희는 자체 AI 코파일럿과 탭 시스템을 구축하고, 여기에 데이터 웨어하우스 스키마와 코드베이스에 대한 RAG(Retrieval-Augmented Generation)를 적용했습니다. 또한 데이터를 쿼리하고, 데이터를 비교하며, dbt 같은 데이터 도구를 이해하고, 전체 데이터 계보(data lineage)에서 코드의 다운스트림 영향을 평가할 수 있는 일련의 에이전트 도구(agent tools)를 추가했습니다.
AI 탭과 AI 에이전트는 사용자의 스키마에 맞는 코드를 즉시 작성해 주며, SQL, Python, YAML 등 어떤 언어든 가능합니다. 또한 코드 차이점(code diffs)과 데이터 차이점(data diffs)을 나란히 보여주어 변경 사항이 데이터 출력 결과에 어떤 영향을 미쳤는지 시각화할 수 있게 합니다. 그리고 데이터 품질 검사는 에이전트에게 맡길 수 있습니다: 누락되거나 중복된 값, 이상치(outliers) 감지, 다운스트림에서 발생할 수 있는 오류 변화 예측, 또는 개발 환경과 운영 환경의 데이터 차이 비교 등이 가능합니다.
데이터 팀들은 보통 nao를 사용합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기