하나의 모델로 세 가지 작업을 수행하고 재학습은 필요 없다: 스프레드시트에 파운데이션 모델이 생겼다
요약
Stable AI가 4억 개의 매개변수를 가진 표 형식 파운데이션 모델 LimiX-2를 발표했습니다. 이 모델은 별도의 미세 조정 없이 단 한 번의 순전파만으로 분류, 회귀, 결측값 대체 등 세 가지 작업을 처리할 수 있습니다. 특히 실제 데이터 대신 인과 이론 기반 합성 테이블로 훈련되어 높은 성능을 보였습니다.
핵심 포인트
- LimiX-2는 표 형식 데이터를 위한 파운데이션 모델입니다.
- 분류, 회귀, 결측값 대체 등 다중 작업을 단일 모델로 처리합니다.
- 실제 데이터가 아닌 인과 이론 기반 합성 테이블로 훈련되었습니다.
이번 주 가장 중요한 AI 발표는 4억 개의 매개변수를 가졌지만 채팅 기능은 전혀 없습니다. Stable AI가 2026년 9월 16일에 LimiX-2를 출시했습니다. 이는 표 형식의 파운데이션 모델로, 지저분한 스프레드시트를 지정하면 단 한 번의 순전파(forward pass)만으로 분류(classification), 회귀(regression), 결측값 대체(missing-value imputation)를 처리하며 작업별 미세 조정(task-specific fine-tuning)이 필요 없습니다. 이 모델은 TabArena에서 1935의 Elo 점수를 기록했는데, 이는 이전 선두 주자보다 무려 117.4점 높은 수치이며, 세 가지 벤치마크 스위트 전반에 걸쳐 업계 표준 자동화 표 형식 ML인 AutoGluon 1.6을 능가했습니다. 흥미로운 점은 점수가 아닙니다. 학습 데이터입니다. 이 모델은 실제 스프레드시트를 본 적이 없습니다. 인과 이론(causal theory)에서 생성된 합성 테이블로 훈련되었습니다.
초등학생도 이해하는 설명: 세 명의 전문가 대신 한 명의 의사
표 형식 데이터는 기계 학습의 눈에 띄지 않는 일꾼입니다. 스프레드시트, 고객 기록, 센서 로그, 의료 차트 등이 해당됩니다. 아무도 이에 대해 흥분된 헤드라인을 쓰지 않지만, 실제 기업 ML 노력 대부분이 이 분야에 투입됩니다.
기존 워크플로우는 세 명의 별도 전문가를 고용했습니다. 이탈(churn) 예측을 위한 분류기 훈련, 수익 예측을 위한 별도의 회귀기 훈련, 빈칸 채우기를 위한 대체 모델 훈련 등 각각이 자체 일정으로 조정되고 검증되며 재학습되었습니다. LimiX-2는 한 번의 방문에서 진단하고 처방하며 차트의 공백을 채워주는 하나의 의사입니다. 테이블을 건네주면, 컨텍스트를 파악하여 어떤 작업이 필요한지 알아내고 단 한 번의 순전파로 처리합니다.
작동 방식: 표가 파운데이션 모델 물결에 저항했던 이유
텍스트와 이미지는 수년 전에 파운데이션 모델에게 넘어갔습니다. 왜냐하면 이들은 균일한 구조를 가지고 있기 때문입니다. 모든 토큰은 단어이고, 모든 패치(patch)는 픽셀이기 때문입니다. 결측값, 혼합된 유형, 자유 형식 메모 열을 가진 40개 열의 스프레드시트는 트랜스포머에게 붙잡을 만한 균일한 것을 아무것도 제공하지 않습니다. 게다가, 모든 표는 다른 열 구조를 가지고 있기 때문에, 한 스키마(schema)로 훈련된 모델은 언어 모델이 어떤 텍스트에든 전이되는 방식처럼 다른 표에도 쉽게 적용되지 않습니다.
TabPFN이 개척한 혁신적인 계보는 테이블 자체의 학습 행(training rows)을 추론 시간(inference time)에 컨텍스트로 활용하는 것이었습니다: 스프레드시트를 위한 인-컨텍스트 러닝 (in-context learning). 모델은 특정 데이터셋을 학습하는 대신, 데이터셋을 '읽는' 방법을 학습합니다. 레이블이 지정된 행들은 프롬프트가 되고, 사용자가 관심을 갖는 행이 쿼리가 됩니다.
LimiX-2의 메커니즘은 세 가지 부분으로 구성됩니다:
- 공동 분포 목표 (joint-distribution objective). LimiX는 마스크드 목표(masked objective)를 통해 테이블 변수 전체와 그 결측성(missingness)에 대한 공동 분포를 학습합니다: 무작위 셀을 마스킹하고 나머지 셀로부터 이를 예측하는 방식입니다. 하나의 고정된 모델이 동일한 메커니즘으로부터 분류(classification), 회귀(regression), 보간(imputation)—심지어 테이블 데이터 생성까지—제공할 수 있습니다.
- 컨텍스트 메커니즘 네트워크 (Contextual Mechanism Network). Stable AI가 LimiX-2를 위해 설계한 아키텍처입니다. LimiX-2M에 대한 형제 논문(arXiv 2606.04485)은 이 디자인이 확장됨에 따라 발생하는 두 가지 실패 모드, 즉 저랭크 붕괴(low-rank collapse)—내부 표현이 낮은 차원의 부분 공간으로 퇴화하는 현상—와 여러 이질적인 컬럼을 참조할 때의 어텐션 병목 현상(attention bottlenecks)을 목표로 했습니다.
- 컨텍스트 조건부 마스크드 모델링 (Context-Conditional Masked Modeling, CCMM). 사전 학습 방법입니다: 테이블의 컨텍스트에 조건화하여 마스킹된 셀을 재구성합니다. 이 마스크 자체가 작업이 됩니다—레이블 컬럼을 마스킹하면 분류를 수행하는 것이고; 숫자형 컬럼을 마스킹하면 회귀를 수행하는 것이며; 무작위로 마스킹하면 보간을 수행하는 것입니다.
최신 기술 수준: 수치적 비교
Stable AI가 보고한 TabArena 종합 Elo 점수 (기본 설정의 LimiX-2, 전체 벤치마크):
| 모델 | Elo ↑ |
|---|---|
| LimiX-2 | 1935 |
| ... |
Elo 외 지표: TabFM+ 대비 개선 가능성(improvability)은 3.3%로, 6.2%보다 낮을수록 좋다는 점에서 우수하며, 평균 순위는 5.5, 종합 승리 횟수는 18.9—이는 TabFM+의 약 3.6배에 해당합니다. 분류 분할(38개 데이터셋)에서는 Elo 1917점, 94.5% 승률을 기록했습니다. 회귀 분할(13개 데이터셋)에서는 Elo 2206점, 96.9% 승률을 기록했습니다. 또한 세 가지 스위트 모두에서 TALENT (1506점)과 BCCO (1432점)에서 1위를 차지했습니다.
AutoML 벤더들을 불안하게 만들 결과: 성숙하고 앙상블 기반이며 업계 표준으로 자리 잡은 AutoGluon이 아예 사용자의 데이터로 학습하지 않은 단일 고정(frozen) 4억 개 매개변수 네트워크에 패배했다.
진정 흥미로운 부분은 학습 데이터다. LimiX-2는 실제 크롤링된 테이블에서 학습한 적이 없다. 대신 구조적 인과 모델(structural causal models)로 생성된 합성 데이터셋으로 학습했는데, 이는 실제 테이블 데이터에서 발견되는 원인-결과 관계를 모방하도록 조작된 가짜 데이터다. 비유하자면 이렇다: 대시캠 영상 대신 물리 방정식으로 만들어진 비행 시뮬레이터에서 운전을 가르치는 것과 같다. 만약 물리 법칙이 정확하다면, 기술은 깨끗하게 전이되며 무료로 무한하고 완벽하게 레이블링된 학습 데이터를 얻을 수 있다. 하지만 어딘가 미묘하게 잘못되었다면, 최악의 순간—다른 사람의 프로덕션 데이터에서—발견하게 된다. 벤치마크는 이 전이가 세 가지 독립적인 테스트 스위트 전반에 걸쳐 유지됨을 보여준다. 남겨진 의문은 공유 드라이브에 놓인 지저분하고 부서별 특화된 스프레드시트다.
두 가지 주의사항을 명확히 밝힌다. 첫째, Elo 수치는 Stable AI가 자체적으로 산출한 것이므로, 그들이 선택하지 않은 벤치마크에서 독립적인 재현이 이루어져야 격차를 해소할 수 있으며, 아직 그런 일은 일어나지 않았다. 둘째, 이 버전은 StableAI LimiX 비상업적 라이선스 v1.0 하에 배포된다: 가중치(weights)와 추론 코드(inference code)는 공개되었지만, 상업적 배포는 제한된다. 이 라이선스가 주목할 만한 부분이다—LimiX-2가 연구 결과물로 남을지, 아니면 누군가가 상업적 라이선스 비용을 지불하고 자금 조달 라운드 시계가 작동하기 시작할지가 관건이다.
주요 시사점
- 하나의 고정된 모델이 세 가지 핵심 테이블 작업(tabular jobs)을 수행합니다. 분류(Classification), 회귀(Regression), 결측치 대체(Imputation) — 단 한 번의 순전파(forward pass)만으로, 미세 조정(fine-tuning)이나 태스크별 파이프라인 없이 처리할 수 있습니다.
- 오래된 방식은 사라지고 있습니다. 태스크별 경사 부스팅(gradient boosting)을 훈련하는 것이 여전히 프로덕션 환경의 기본값입니다. 하지만 단지 400M 매개변수(parameter) 네트워크가 아예 훈련 과정 없이도 이 전통적인 방식을 사용하던 최고 자동화 버전의 성능을 능가했습니다.
- 훈련 데이터 트릭이 매개변수 개수보다 중요합니다. 대규모 합성 인과 데이터(Synthetic causal data at scale)가 전이 가능한 아이디어입니다 — 향후 1년 안에 모든 테이블 관련 연구실에서 이 방식을 복제할 것으로 예상됩니다.
- 리더보드뿐만 아니라 라이선스도 주목하세요. 비상업적 라이선스는 누군가 상용화하기 전까지는 이것을 순수 연구 아티팩트(research artifact)로 유지시킬 것입니다.
- 신뢰하고, 검증하십시오. 스스로 보고한 Elo 점수는 결과가 아닌 주장입니다. 외부 벤치마크에서 독립적으로 재현되는 것이 중요한 이정표입니다.
참고 문헌 (References): LimiX: Unleashing Structured-Data Modeling Capability for Generalist Intelligence (arXiv 2609.17488, Xingxuan Zhang et al., Stable AI, Sep 2026) · LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models (arXiv 2606.04485) · 코드 및 가중치: github.com/limix-ldm-ai/LimiX — LimiX-2.ckpt는 2026년 9월 16일에 공개되었으며, 추론 코드는 Hugging Face에서 확인할 수 있습니다 · 벤치마크: TabArena, TALENT, BCCO · SmartChunks: "Stable AI의 LimiX-2가 세 가지 ML 작업을 하나의 400M 매개변수 모델에 담다" (Sep 2026).
다이어그램
다운로드: diagram-1-why-tables-are-hard.png
다운로드: diagram-2-one-model-three-tasks.png
다운로드: diagram-3-tabular-arena-elo.png
다운로드: diagram-4-synthetic-causal-pretraining.png
동반 노트북: 본 게시물의 실행 가능한 튜토리얼 — 여기에서 다운로드 (Colab/Jupyter에서 열기).
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기


