당신의 AI 에이전트는 보고, 듣고, 말할 수 있습니다. 하지만 느낄 수 있을까요?
요약
Embodied AI 분야에서 촉각(tactile) 데이터의 표준화 부재로 발생하는 '바벨 문제'를 지적합니다. 연구실마다 상이한 데이터 형식과 단위로 인해 데이터셋 간 교차 학습과 협업이 어려운 현 상황을 분석합니다.
핵심 포인트
- 촉각 데이터의 표준화된 의미론, 구조, 단위가 부재함
- 데이터 형식 불일치로 인한 '바벨 문제' 발생
- 표준 부재 시 데이터셋 간 교차 학습 및 모델링 효율 저하
- MCP나 A2A 등 기존 표준이 촉각 지각을 다루지 못함
3년 전만 해도 저는 눈으로 볼 수도, 귀로 들을 수도, 사진으로 찍을 수도 없는 무언가를 위한 소프트웨어를 만든다는 것을 상상조차 할 수 없었습니다.
오늘날 저는 로봇이 어떻게 느끼는지, 더 구체적으로는 로봇의 피부가 생성하는 데이터를 우리가 어떻게 이해할 수 있는지에 대해 고민하며 하루를 보냅니다.
최근 AI 에이전트 분야를 지켜봐 오셨다면 (솔직히 안 그러는 사람이 어디 있겠습니까), 한 가지 패턴을 발견하셨을 겁니다. 모두가 보고(vision), 듣고(audio), 말할 수 있는(LLM outputs) 에이전트를 만들고 있다는 점입니다. 하지만 거의 아무도 이렇게 묻지 않습니다: 촉각(touch)은 어떨까요?
아무도 말하지 않는 "바벨 문제 (Babel Problem)"
제가 Embodied AI (체화된 인공지능) 데이터를 다루기 시작했을 때 발견한 사실은 다음과 같습니다:
지구상의 모든 로봇 공학 연구실은 촉각 데이터(tactile data)를 서로 다르게 저장합니다. 서로 다른 컬럼 이름, 서로 다른 단위, 서로 다른 샘플링 속도(sampling rates), 그야말로 모든 것이 다릅니다.
-
연구실 A는 힘을 뉴턴(Newtons) 단위로 기록하며, 컬럼 이름은 fx, fy, fz입니다.
-
연구실 B는 원시 ADC 카운트(raw ADC counts)를 사용하며, 컬럼 이름은 ch_0, ch_1... 입니다.
-
연구실 C는 중첩된 객체(nested objects)를 가진 자체적인 JSON 스키마(schema)를 가지고 있습니다.
-
로봇 D는 완전히 다른 좌표계(coordinate system)를 사용합니다.
이러한 데이터셋들을 가로질러 모델을 학습시켜 보십시오. 벤치마크를 수행해 보십시오. 다른 대학의 협력자와 데이터를 공유해 보십시오. 행운을 빕니다.
저는 이것을 바벨 문제(Babel Problem)라고 부릅니다. 모두가 자신만의 언어를 말하고 있으며, 아무도 서로를 이해할 수 없습니다.
"하지만 이제 MCP가 있지 않나요?"
좋은 질문입니다. MCP는 LLM이 도구(tools)를 호출하는 방식을 표준화했습니다. A2A는 에이전트 간 통신(agent-to-agent communication)을 처리합니다. OpenTelemetry는 관측 가능성(observability)을 다룹니다.
이 중 어느 것도 촉각 지각(tactile perception)을 다루지 않습니다.
"촉각 판독값(tactile reading)"이 실제로 무엇을 의미하는지에 대한 표준이 없습니다. 그 의미론(semantics)도, 구조(structure)도, 단위(units)도 없습니다. 접촉 기하학(contact geometry), 압력 분포(pressure distribution), 미끄러짐 이벤트(slip events), 또는 질감 특징(texture features)을 어떻게 설명해야 하는지에 대한 표준도 없습니다.
이렇게 생각해 보십시오. 만약 누군가 인치(inches), 화씨(Fahrenheit), 그리고 "글러그(glugs)"라는 맞춤형 단위를 사용하여 레시피를 발표했다면, 요리가 아무리 훌륭하더라도 당신은 그것을 재현할 수 없을 것입니다. 촉각 데이터의 현재 상황이 바로 이와 같습니다.
지금 이것이 중요한 이유
Embodied AI (체화된 AI)가 전성기를 맞이하고 있습니다. 파운데이션 모델 (Foundation models)은 로봇 시연 데이터를 통해 학습되고 있습니다. 정교한 조작 (Dexterous manipulation)은 더 이상 공상 과학이 아닙니다. 하지만 이 모든 것을 뒷받침하는 데이터 파이프라인 (Data pipeline)은 임시방편으로 간신히 유지되고 있는 실정입니다.
표준이 없다면:
- 데이터셋 간 교차 학습 (Cross-dataset training)이 사실상 불가능합니다 (모델링보다 데이터 정규화 (Normalizing)에 더 많은 시간을 소비하게 됩니다).
- 하드웨어를 교체할 때마다 모든 다운스트림 파이프라인 (Downstream pipeline)이 망가집니다.
- 재현성 (Reproducibility)은 농담 수준입니다 (타인의 촉각 벤치마크를 재현하려 한다면 행운을 빌어야 할 것입니다).
- 연구실 간의 데이터 공유를 위해서는 데이터셋마다 별도의 맞춤형 컨버터 (Custom converter)가 필요합니다.
우리가 만든 것
수개월간의 좌절 끝에, 저는 촉각 데이터를 위한 개방형 표준인 TLabel을 만들기 시작했습니다.
핵심 아이디어는 간단합니다. 어떤 센서가 생성했는지와 관계없이 촉각 데이터가 무엇을 의미하는지 설명하는 보편적인 스키마 (Universal schema)를 정의하는 것입니다.
TLabel은 다음과 같은 14가지 의미론적 차원 (Semantic dimensions)을 정의합니다:
- 접촉 기하학 (Contact Geometry) — 접촉이 어디서 어떻게 발생하는지
- 수직력 / 전단력 (Normal / Shear Force) — 힘의 방향과 크기
- 압력 분포 (Pressure Distribution) — 공간적 압력 맵
- 질감 (Texture) — 표면의 미세 특징
- 온도 (Temperature) — 열적 인지
- 미끄러짐 (Slip) — 접촉부에서의 움직임 감지
- ...외 8가지 더 (전체 사양은 설계 문서 참조)
각 데이터 파일은 준수 수준 (Compliance Level, L1–L4)을 포함하고 있어, 일부 센서가 기본적인 측정값만 제공하더라도 사용자가 어떤 데이터를 사용할 수 있는지 정확히 알 수 있습니다.
핵심 설계 원칙: TLabel은 촉각 데이터를 어떻게 처리할지 알려주지 않습니다. 데이터를 어떻게 설명할지를 알려줍니다. 처리는 여러분의 몫입니다.
코드 보기
촉각 파일을 로드합니다. 어떤 센서가 생성했는지와 관계없이 동일한 API를 사용합니다:
from tlabel import TLabelFile
data = TLabelFile("sample.tlabel")
표준화된 차원에 접근합니다:
forces = data.get_forces() # 항상 뉴턴 (Newtons) 단위
contacts = data.get_contact_geom() # 일관된 좌표계 (Coordinate frame)
textures = data.get_texture_features()
사용 가능한 항목을 확인하고 센서 메타데이터 (Metadata)를 검사합니다:
print(data.compliance_level) # L1 = 기본(basic), L4 = 전체 사양(full spec)
print(data.sensor_info) # 원본 하드웨어 메타데이터(Metadata) 보존
원본 데이터가 GelSight, BioTac, 커스텀 정전용량 방식 어레이(capacitive array), 혹은 아직 아무도 발명하지 못한 미래의 센서에서 왔는지에 관계없이 — 인터페이스(Interface)는 동일합니다.
Python 패키지는 PyPI에서 v0.18.2 버전으로 제공되며, 현재 인기 있는 형식들을 위한 익스포터 플러그인(exporter plugins)을 활발히 구축하고 있습니다.
오픈 소스 Embodied AI 생태계는 LeRobot, Forge, 다양한 시뮬레이터 및 하드웨어 플랫폼과 함께 빠르게 움직이고 있습니다. 하지만 이러한 시스템들이 촉각 데이터(tactile data)를 공유하고 이해할 수 없다면, 우리는 공통 언어가 없는 탑을 쌓고 있는 것과 같습니다.
저는 TLabel이 최종적인 정답이라고 생각하지는 않습니다. 하지만 논의는 이루어져야 하며, 표준(standard)은 특정 기업이나 연구소의 소유가 아닌 개방형이어야 합니다.
관심이 있다면 프로젝트를 확인해 보세요: github.com/liesliy/tlabel
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기