microsoft/data-formulator
요약
Microsoft의 Data Formulator 0.7(alpha 2)는 AI 에이전트를 활용하여 데이터 탐색과 시각화를 지원하는 도구입니다. 다양한 데이터베이스 커넥터와 대화형 에이전트를 통해 사용자의 맥락을 유지하며, 자연어로 차트 스타일을 정교하게 다듬을 수 있는 기능을 제공합니다.
핵심 포인트
- Superset, MySQL, BigQuery 등 다양한 데이터 소스에 대한 퍼스트 클래스 커넥터 지원
- 대화의 맥락을 유지하며 탐색과 시각화를 수행하는 통합 DataAgent 제공
- 30개 이상의 차트 유형과 자연어 기반의 차트 스타일 정교화 에이전트 탑재
- 사용자의 세션에서 지식을 추출하여 공유 라이브러리로 만드는 지식 증류 기능(실험적)
- 로컬 및 Azure Blob을 활용한 지속적인 세션 및 워크스페이스 관리
🪄 AI 에이전트(AI agents)를 활용하여 시각화를 통해 데이터를 탐색하세요.
[05-11-2026] Data Formulator 0.7 (alpha 2) — AI 기반 데이터 탐색을 위한 새로운 장
- 🔌 데이터 커넥터 (Data connectors)— Superset, Kusto, Cosmos DB, MySQL, PostgreSQL, MSSQL, S3, Azure Blob, BigQuery 등에 대한 퍼스트 클래스(first-class) 지속 연결을 지원하며, SSO, 지연 카탈로그 로딩(lazy catalog loading), 검색 및 스마트 필터를 제공합니다.
- 💬 스레드 메모리(thread memory)를 갖춘 대화형 에이전트 (Conversational agent)— 설명, 탐색, 시각화 및 추천을 하나의 유연한 대화로 엮어내는 통합된
DataAgent를 제공합니다. 대화의 맥락을 유지하여 에이전트가 사용자의 사고 흐름과 동기화된 상태를 유지합니다. - 🗂️ 지속적인 세션 및 워크스페이스 관리 (Persistent session & workspace management)— 로컬 및 Azure Blob 백엔드를 사용하는 ID 격리형 워크스페이스를 제공합니다. 세션은 타임스탬프 및 정렬 기능을 통해 재시작 후에도 유지됩니다.
- 📊 표현력이 풍부한 시각화 (Expressive visualization)— 새로운 시맨틱 차트 엔진(semantic chart engine)을 통해 30개 이상의 차트 유형(영역(area), 스트림그래프(streamgraph), 캔들스틱(candlestick), 파이(pie), 레이더(radar), 지도(maps) 등)을 지원합니다. 또한, 거친 차트를 발표용 비주얼로 바꿔주는 차트 스타일 정교화 에이전트(chart style-refinement agent)를 제공하여, 클릭 한 번으로 스타일을 재설정하고 자연어를 통해 타이포그래피, 색상, 레이아웃 및 주석을 정교하게 다듬을 수 있습니다.
- 📚 지식 증류 (Knowledge distillation, 실험적 기능)— 에이전트가 사용자의 세션으로부터 재사용 가능한 기술과 경험을 추출하여 공유 지식 라이브러리(shared knowledge library)로 만들며, 이는 향후 세션에 반영됩니다.
프리릴리스(pre-release) 버전을 설치하려면 다음을 실행하세요:
pip install --pre data-formulator
또는 버전을 ==0.7.0a2로 고정하세요.
팁 (Tip)
개발자이신가요? AI 기반 데이터 탐색의 미래를 함께 만들어가세요!
새로운 에이전트, 데이터 커넥터, 차트 템플릿 등에 대한 도움을 기다리고 있습니다.
개발자 가이드(Developers' Guide)와 오픈 이슈(open issues)를 확인해 보세요.
다음은 현재 설계로 이어지는 마일스톤(milestones)입니다:
v0.6(데모): 라이브 데이터로부터의 실시간 인사이트 — URL 및 데이터베이스에 연결하여 자동 새로고침 지원
uv 지원: uv를 통한 더 빠른 설치 — uvx data_formulator 또는 uv pip install data_formulator
v0.5.1(Demo): 커뮤니티 데이터 로더 (Community data loaders), 미국 지도 및 파이 차트 (US Map & Pie Chart), 편집 가능한 보고서 (editable reports), 더 빨라진 UI
v0.5: 데이터와 교감하며 제어하기 — 에이전트 모드 (agent mode), 데이터 추출 (data extraction), 보고서 (reports)
v0.2.2(Demo): 에이전트 추천을 통한 목표 중심 탐색 (Goal-driven exploration) 및 성능 개선
v0.2.1.3/4(Readme | Demo): 외부 데이터 로더 (External data loaders) (MySQL, PostgreSQL, MSSQL, Azure Data Explorer, S3, Azure Blob)
v0.2(Demos): DuckDB 통합을 통한 대규모 데이터 지원
v0.1.7(Demos): 더 깔끔한 워크플로우를 위한 데이터셋 앵커링 (Dataset anchoring)
v0.1.6(Demo): 자동 조인 (automatic joins)을 포함한 다중 테이블 (Multi-table) 지원
모델 지원 (Model Support): LiteLLM을 통한 OpenAI, Azure, Ollama, Anthropic 지원 (피드백 반영)
Python 패키지 (Python Package): 간편한 로컬 설치 (직접 시도해보세요)
시각화 챌린지 (Visualization Challenges): 실력을 테스트해보세요 (challenges)
데이터 추출 (Data Extraction): 이미지 및 텍스트에서 데이터 파싱 (demo)
초기 출시 (Initial Release): 블로그 (Blog) | 비디오 (Video)
Data Formulator는 AI 에이전트 (AI agents)를 활용한 시각화 기반 데이터 탐색을 위한 Microsoft Research의 프로토타입입니다.
Data Formulator는 분석가가 시각화를 통해 데이터를 탐색할 수 있도록 지원합니다. 어떤 형식이든 (스크린샷, 텍스트, csv 또는 데이터베이스) 데이터로 시작하여, *사용자 인터페이스 상호작용 (UI interactions)*과 자연어 (NL) 입력을 결합한 새로운 혼합 인터페이스를 통해 AI 에이전트와 함께 작업할 수 있습니다. 이를 통해 사용자는 자신의 의도를 전달하고, 분기되는 탐색 방향을 제어하며, 통찰력을 공유하기 위한 보고서를 작성할 수 있습니다.
다음 옵션 중 하나를 선택하여 Data Formulator를 사용해 보세요.
옵션 1: uv를 통한 설치 (권장)
uv는 매우 빠른 Python 패키지 관리자입니다. uv가 설치되어 있다면, 별도의 설정 없이 Data Formulator를 직접 실행할 수 있습니다:
uvx data_formulator
사용 가능한 모든 옵션(사용자 정의 포트, 샌드박싱 모드, 데이터 저장 위치 등)을 확인하려면 다음을 실행하세요:
uvx data_formulator --help
옵션 2: pip를 통한 설치
설치에 pip를 사용하세요 (권장: 가상 환경에 설치하십시오).
pip install data_formulator # 설치
python -m data_formulator # 실행
Data Formulator가 브라우저의 http://localhost:5567 에서 자동으로 열립니다.
옵션 3: Docker로 실행
docker compose up --build
브라우저에서 http://localhost:5567 을 여십시오. 중지하려면 Ctrl+C를 누르거나 docker compose down을 실행하십시오.
옵션 4: Codespaces
Codespaces에서 Data Formulator를 실행할 수 있습니다. 모든 설정이 미리 완료되어 있습니다. 자세한 내용은 CODESPACES.md를 참조하십시오.
옵션 5: 개발자로 작업하기
Data Formulator를 로컬에 빌드하고 자신만의 버전을 개발할 수 있습니다. 자세한 내용은 DEVELOPMENT.md를 확인하십시오.
구조화된 데이터가 포함된 csv, tsv 또는 xlsx 파일을 업로드하는 것 외에도, Data Formulator에게 스크린샷, 텍스트 블록 또는 웹사이트에서 데이터를 추출하도록 요청하거나, 커넥터 (connectors)를 사용하여 데이터베이스에서 데이터를 로드하도록 요청할 수 있습니다. 그런 다음 탐색할 준비가 됩니다. 시각화 (visualization) 질문을 던지고, 차트를 편집하거나, 일부 탐색 작업을 에이전트 (agents)에게 위임하십시오. 그런 다음 통찰력을 공유하기 위한 보고서를 생성하십시오.
data-formulator-tutorial.mp4
@article{wang2024dataformulator2iteratively,
title={Data Formulator 2: Iteratively Creating Rich Visualizations with AI},
author={Chenglong Wang and Bongshin Lee and Steven Drucker and Dan Marshall and Jianfeng Gao},
...
@article{wang2023data,
title={Data Formulator: AI-powered Concept-driven Visualization Authoring},
author={Wang, Chenglong and Thompson, John and Lee, Bongshin},
...
이 프로젝트는 기여와 제안을 환영합니다. 대부분의 기여에는 귀하가 기여를 사용할 권리를 가지고 있으며 실제로 권리를 부여한다는 것을 선언하는 기여 라이선스 동의서 (Contributor License Agreement, CLA)에 동의해야 합니다. 자세한 내용은 https://cla.microsoft.com 을 방문하십시오.
풀 리퀘스트 (pull request)를 제출하면, CLA-bot이 귀하가 CLA를 제공해야 하는지 여부를 자동으로 결정하고 PR을 적절하게 꾸밉니다 (예: 레이블, 댓글). 봇이 제공하는 지침을 따르기만 하면 됩니다. 당사의 CLA를 사용하는 모든 리포지토리(repository)에 대해 이 작업은 한 번만 수행하면 됩니다.
이 프로젝트는 Microsoft 오픈 소스 행동 강령 (Open Source Code of Conduct)을 채택했습니다. 자세한 내용은 행동 강령 FAQ를 참조하거나, 추가 질문 또는 의견이 있는 경우 opencode@microsoft.com으로 문의하시기 바랍니다.
이 프로젝트에는 프로젝트, 제품 또는 서비스에 대한 상표나 로고가 포함될 수 있습니다. Microsoft 상표 또는 로고의 허가된 사용은 Microsoft의 상표 및 브랜드 가이드라인 (Trademark & Brand Guidelines)을 준수해야 하며 이에 따라야 합니다. 이 프로젝트의 수정된 버전에서 Microsoft 상표 또는 로고를 사용하는 것은 혼동을 야기하거나 Microsoft의 후원을 암시해서는 안 됩니다. 제3자의 상표 또는 로고를 사용하는 것은 해당 제3자의 정책을 따릅니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub Trending TypeScript (weekly)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기