Hugging Face의 PapersWithCode 복원 프로젝트
요약
Hugging Face의 오픈 소스 팀원이 Meta에 인수된 후 관리가 중단된 PapersWithCode를 복원하는 프로젝트를 진행 중입니다. AI 에이전트를 활용해 대규모 논문 파싱과 리더보드 자동 생성을 구현하며, 트렌딩 논문, 도메인별 분류, 인용 횟수 지원 등 다양한 기능을 제공합니다.
핵심 포인트
- AI 에이전트를 사용하여 대규모 논문 파싱 및 리더보드 자동 생성 프로세스 구축
- GitHub 스타 속도 기반 트렌딩 논문 및 도메인별(OCR, RLVR 등) 분류 기능 제공
- 인용 횟수, 외부 논문 지원, 자동 연결된 GitHub 저장소 등 기존 PapersWithCode의 핵심 기능 복원
- Hugging Face 계정 연동 및 스토리지 버킷을 통한 데이터 백업 지원
안녕하세요,
Hugging Face의 오픈 소스 (open-source) 팀의 Niels입니다. 다른 많은 분들과 마찬가지로 저 또한 paperswithcode의 열렬한 팬이었습니다. 안타깝게도 해당 웹사이트는 Meta에 인수된 이후 더 이상 유지 관리되지 않고 있습니다.
그래서 저는 이를 복원하는 작업을 진행해 왔습니다. 저는 당연히 AI 에이전트 (AI agents)를 사용하여 대규모로 논문을 파싱 (parse)하고 리더보드 (leaderboards)를 자동으로 생성하고 있습니다 (현재는 제가 직접 결과를 검증하고 있습니다). 지금까지는 Qwen 3.5 및 3.6, 객체 탐지 (object detection)를 위한 RF-DETR, DINOv3, MTEB 리더보드의 SOTA 임베딩 모델 (embedding models), 자동 음성 인식 (automatic speech recognition) 모델을 위한 Open ASR 리더보드 등, 제가 SOTA (State-of-the-Art)임을 알고 있는 영향력 있는 논문들만 파싱했습니다.
현재 포함된 기능은 다음과 같습니다:
- Github 스타 속도 (star velocity)를 기반으로 한 기본 트렌딩 논문 (trending papers)
- 도메인별 분류, 예: OCR
- 기존 PwC에서 제공했던 [방법론 (methods)], 예: RLVR
- 영향력 있는 논문에 대한 평가 결과 (eval results), 하단의 Qwen 3.5 참조
- 각 도메인별 리더보드, 예: MMTEB 또는 COCO val 2017
- 인용 횟수 (citation counts) 지원 (도메인별 최다 인용 논문도 확인할 수 있습니다!)
- 자동 연결된 Github, 프로젝트 페이지 URL 및 아티팩트 (artifacts) (논문 페이지에서 여러 저장소 지원)
- Arxiv 이외의 외부 논문 지원, 예: DeepSeek v4
- 코딩 에이전트 (coding agent) 벤치마크를 위한 Harness 보고서, 예: Terminal Bench
- 썸네일, 논문 PDF 및 전체 데이터 백업을 저장하기 위해 "Sign in with HF" 및 스토리지 버킷 (Storage Buckets) 사용
여러분의 피드백과 기능 요청이 궁금합니다!
paperswithcode.co에서 확인해 보세요.
예를 들어 Terminal Bench 2.0의 SOTA 리더보드를 확인해 보세요:
논문 페이지는 다음과 같은 모습입니다: https://paperswithcode.co/paper/2602.15763
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Research의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기